Wszystkie badania
Zachowanie modeliW toku

Odmowa, możliwości i modele z otwartymi wagami.

Badamy, czym opublikowane modele zmodyfikowane pod kątem rzadszych odmów różnią się od swoich wersji bazowych w zwykłych zadaniach i działaniu lokalnym. Obecne prace obejmują odtwarzalne porównania nieszkodliwych zadań, precyzji obliczeń i wydajności na lokalnym sprzęcie. Formalne testy odmów czekają na dopracowanie planu analizy oraz ocenę etyczną i metod punktacji. Obserwacje z pilotaży nie są potwierdzonymi wynikami dotyczącymi bezpieczeństwa.

Pytanie i zakres

Podstawą jest porównanie dobranych par: co zmienia opublikowana modyfikacja ograniczająca odmowy modelu i jak wpływa na wykonywanie zwykłych zadań? Korzystamy z istniejących wersji modeli; nie tworzymy nowych modeli pozbawionych ograniczeń.

Obecne pomiary dotyczą par modeli o 3 i 8 miliardach parametrów, uruchamianych na Macu mini M1 z 2020 roku i 16 GB pamięci. Obejmują małe pilotaże z nieszkodliwymi zadaniami, porównania precyzji i kwantyzacji oraz pomiary możliwości uruchomienia i szybkości działania.

Podejście badawcze

  1. Porównanie, które można zinterpretować.

    Przypinamy wersje modeli, sprawdzamy sumy kontrolne i zapisujemy tokenizer, środowisko wykonawcze, sposób przygotowania poleceń, dekodowanie i punktację. Surowe odpowiedzi pozostają prywatne; zachowujemy wyniki liczbowe i ich pochodzenie.

  2. Pilotaż oddzielony od pełnego eksperymentu.

    Niewielkie, wcześniej ustalone zestawy służą sprawdzeniu metody pomiaru. Użyte już zadania wykluczamy z późniejszej formalnej oceny.

  3. Testy odmów po wymaganej ocenie.

    Szerszy plan porównuje opublikowane ingerencje w polecenia, dekodowanie i wagi modelu w jednakowych warunkach. Testy wymagają dopracowanego planu analizy oraz oceny etycznej i metody punktacji.

Co zamierzamy mierzyć

  • Obecne pilotaże: poprawność odpowiedzi w parach, zgodność wyników i prawdopodobieństwo ustalonych odpowiedzi w małych zestawach nieszkodliwych zadań.
  • Pomiary lokalne: możliwość uruchomienia modeli i ich wydajność w zapisanych warunkach.
  • Planowana ocena formalna: odmowy i nieuzasadnione odmowy nieszkodliwych próśb, z uprzednio zweryfikowaną metodą punktacji.

Co możemy ustalić, a czego nie

Małe próby na jednym komputerze i wybranych modelach nie ustalają ogólnego wpływu modyfikacji na możliwości. Kwantyzacja może zmieniać zachowanie i nie wolno mylić jej wpływu z wpływem edycji wag.

Nie wykonano eksperymentu ze szkodliwymi poleceniami. Udzielenie odpowiedzi zamiast odmowy samo w sobie nie dowodzi skutecznego szkodliwego użycia. Badanie nie mierzy rzeczywistej skali wykorzystania przestępczego.

Plan nie został zewnętrznie zarejestrowany ze znacznikiem czasu. Formalne wnioski o możliwościach i odmowach pozostają otwarte. Nie zmierzono poboru energii z gniazdka ani kosztu prądu.

Kolejne kroki

Dopracować plan analizy, dobór zadań i punktację; uzyskać wymagane oceny; następnie przeprowadzić większy, odrębny eksperyment. Przyszła publikacja powinna wyraźnie odróżniać obserwacje eksploracyjne od wyników zaplanowanych przed pomiarem.

Porozmawiajmy o badaniach