Badania
Możliwości. Granice. Dowody.
Pytania, którym wartopoświęcić uwagę.
Chcemy zrozumieć, do czego AI jest naprawdę zdolna, sprawdzać jej granice i rozwijać skuteczniejsze zabezpieczenia wraz ze wzrostem możliwości. Badamy modele, uprawnienia agentów i weryfikowalne decyzje, aby realnie zwiększać bezpieczeństwo AI.
Wybierz pytanie badawczeTrzy pytania badawcze
Podążaj za pytaniem.
W aktywnym badaniu modeli z otwartymi wagami wykonano małe porównania nieszkodliwych zadań dla par modeli 3B i 8B, testy precyzji oraz pomiary działania lokalnego. Dwie propozycje rozszerzają program o uprawnienia agentów i dowody dotyczące decyzji.
Jedno badanie w toku / Dwie propozycje
Odmowa, możliwości i modele z otwartymi wagami.
Pytanie przewodnieCo się zmienia, gdy model rzadziej odmawia wykonania polecenia?
Badamy, czym opublikowane modele zmodyfikowane pod kątem rzadszych odmów różnią się od swoich wersji bazowych w zwykłych zadaniach i działaniu lokalnym. Obecne prace obejmują odtwarzalne porównania nieszkodliwych zadań, precyzji obliczeń i wydajności na lokalnym sprzęcie. Formalne testy odmów czekają na dopracowanie planu analizy oraz ocenę etyczną i metod punktacji. Obserwacje z pilotaży nie są potwierdzonymi wynikami dotyczącymi bezpieczeństwa.
Obecny etapPilotaże eksploracyjne
Poznaj zakres badaniaJakich uprawnień naprawdę potrzebuje agent AI?
Pytanie przewodnieCzy węższe uprawnienia pozwalają zachować użyteczność i ograniczyć skutki błędu?
Proponujemy porównanie szerokiego dostępu do konta, stałych ról i uprawnień nadawanych do konkretnego zadania w symulatorze z syntetycznymi procesami. Osobno sprawdzimy odczyt rekordu, propozycję zmiany i zatwierdzony zapis, również po cofnięciu dostępu lub wygaśnięciu zgody. Zmierzymy zarówno niedozwolone działania, które rzeczywiście doszły do skutku, jak i poprawne wykonanie dozwolonych zadań.
Obecny etapPropozycja badania eksploracyjnego
Poznaj zakres badaniaCzy ktoś inny odtworzy przebieg decyzji?
Pytanie przewodnieJakich dowodów potrzebuje osoba oceniająca działanie AI, gdy zmienił się już jego kontekst?
Proponujemy porównanie zapisów rozmów, zwykłych dzienników aplikacji i uporządkowanych zestawów dowodów w syntetycznych procesach. Niezależne osoby oceniające odpowiedzą na ustalone pytania o źródła, uprawnienia, zgody i wyniki. Zmierzymy poprawność odtworzenia, brakujące powiązania, czas analizy i ilość zachowanych danych wrażliwych. Sama jakość dowodów nie potwierdza zgodności z przepisami.
Obecny etapPropozycja badania eksploracyjnego
Poznaj zakres badaniaPodejście badawcze
Od lepszego pytania
do skuteczniejszej ochrony.
Możliwości
Co system naprawdę potrafi?
Sprawdzić określone zadanie, również tam, gdzie system zawodzi.
Granice
Do czego ma uprawnienia?
Określić dostęp, narzędzia i zgody wymagane od człowieka.
Dowody
Na czym opieramy wniosek?
Zachować wersje, wyniki i informacje o niepewności.
Projektowanie zabezpieczeń
Co trzeba zmienić?
Na podstawie dowodów poprawić zabezpieczenia i sprawdzić je ponownie.
Standard badawczy
Dowody wraz z ich ograniczeniami.
Chcemy, by metody, założenia i ograniczenia były równie widoczne jak wyniki. Pilotaż służy poznaniu sposobu pomiaru; formalny wniosek wymaga odpowiedniego projektu i dowodów.
Zlecenie komercyjne nie daje nam automatycznie prawa do ponownego wykorzystania danych, kodu czy ustaleń klienta. Badania wymagają odrębnego zakresu i odpowiednich zgód.
Zapisywać wersje modeli, narzędzi, danych i reguł każdego porównania.
Oddzielać przykłady rozwojowe, pilotaże i nowe przypadki ewaluacyjne.
Mierzyć poprawne wykonanie dozwolonych zadań oraz błędy bezpieczeństwa.
Zachowywać wyniki zerowe, nieudane próby i niepewność.
Perspektywy
Idee, które kierują pracą.
Dwa punkty wyjścia do rozmowy o bezpieczniejszym AI.
Bezpieczeństwo agentów wymaga granic poza modelem.
Agent może potrafić wykonać zadanie, nie mając prawa go wykonać. Od tego rozróżnienia zaczynamy projektowanie bezpiecznych wdrożeń AI.
Przeczytaj tekstCo byłoby dowodem na bezpieczniejsze AI?
Istotne jest nie to, czy demonstracja wygląda bezpiecznie, lecz to, jakie wnioski pozwala wyciągnąć dobrze zaprojektowany test.
Przeczytaj tekstWspółpraca badawcza
Jakie pytanie powinniśmy zbadać razem?
Zapraszamy do konkretnych rozmów o metodach ewaluacji, uprawnieniach agentów i dowodach potrzebnych do oceny pracy wspomaganej przez AI. Współpraca zaczyna się od jasnego pytania, danych z odpowiednimi zgodami i wykonalnego zakresu.
Zacznijmy od pytania, które ma znaczenie.