Odmowa, możliwości i modele z otwartymi wagami.
Badamy, czym opublikowane modele zmodyfikowane pod kątem rzadszych odmów różnią się od swoich wersji bazowych w zwykłych zadaniach i działaniu lokalnym. Obecne prace obejmują odtwarzalne porównania nieszkodliwych zadań, precyzji obliczeń i wydajności na lokalnym sprzęcie. Formalne testy odmów czekają na dopracowanie planu analizy oraz ocenę etyczną i metod punktacji. Obserwacje z pilotaży nie są potwierdzonymi wynikami dotyczącymi bezpieczeństwa.
Pytanie i zakres
Podstawą jest porównanie dobranych par: co zmienia opublikowana modyfikacja ograniczająca odmowy modelu i jak wpływa na wykonywanie zwykłych zadań? Korzystamy z istniejących wersji modeli; nie tworzymy nowych modeli pozbawionych ograniczeń.
Obecne pomiary dotyczą par modeli o 3 i 8 miliardach parametrów, uruchamianych na Macu mini M1 z 2020 roku i 16 GB pamięci. Obejmują małe pilotaże z nieszkodliwymi zadaniami, porównania precyzji i kwantyzacji oraz pomiary możliwości uruchomienia i szybkości działania.
Podejście badawcze
Porównanie, które można zinterpretować.
Przypinamy wersje modeli, sprawdzamy sumy kontrolne i zapisujemy tokenizer, środowisko wykonawcze, sposób przygotowania poleceń, dekodowanie i punktację. Surowe odpowiedzi pozostają prywatne; zachowujemy wyniki liczbowe i ich pochodzenie.
Pilotaż oddzielony od pełnego eksperymentu.
Niewielkie, wcześniej ustalone zestawy służą sprawdzeniu metody pomiaru. Użyte już zadania wykluczamy z późniejszej formalnej oceny.
Testy odmów po wymaganej ocenie.
Szerszy plan porównuje opublikowane ingerencje w polecenia, dekodowanie i wagi modelu w jednakowych warunkach. Testy wymagają dopracowanego planu analizy oraz oceny etycznej i metody punktacji.
Co zamierzamy mierzyć
- Obecne pilotaże: poprawność odpowiedzi w parach, zgodność wyników i prawdopodobieństwo ustalonych odpowiedzi w małych zestawach nieszkodliwych zadań.
- Pomiary lokalne: możliwość uruchomienia modeli i ich wydajność w zapisanych warunkach.
- Planowana ocena formalna: odmowy i nieuzasadnione odmowy nieszkodliwych próśb, z uprzednio zweryfikowaną metodą punktacji.
Co możemy ustalić, a czego nie
Małe próby na jednym komputerze i wybranych modelach nie ustalają ogólnego wpływu modyfikacji na możliwości. Kwantyzacja może zmieniać zachowanie i nie wolno mylić jej wpływu z wpływem edycji wag.
Nie wykonano eksperymentu ze szkodliwymi poleceniami. Udzielenie odpowiedzi zamiast odmowy samo w sobie nie dowodzi skutecznego szkodliwego użycia. Badanie nie mierzy rzeczywistej skali wykorzystania przestępczego.
Plan nie został zewnętrznie zarejestrowany ze znacznikiem czasu. Formalne wnioski o możliwościach i odmowach pozostają otwarte. Nie zmierzono poboru energii z gniazdka ani kosztu prądu.
Kolejne kroki
Dopracować plan analizy, dobór zadań i punktację; uzyskać wymagane oceny; następnie przeprowadzić większy, odrębny eksperyment. Przyszła publikacja powinna wyraźnie odróżniać obserwacje eksploracyjne od wyników zaplanowanych przed pomiarem.
Porozmawiajmy o badaniach