Badania i perspektywy

Perspektywa / Forthreason AI

Co byłoby dowodem na bezpieczniejsze AI?

Istotne jest nie to, czy demonstracja wygląda bezpiecznie, lecz to, jakie wnioski pozwala wyciągnąć dobrze zaprojektowany test.

Nasze podejście i pytania badawcze.

Zacznij od twierdzenia, które może okazać się błędne.

"Ten system jest bezpieczny" to twierdzenie zbyt szerokie, by sensownie je sprawdzić. Węższe określa zadanie, środowisko, uprawnienia i istotny błąd. Przykład: czy agent potrafi wykonać dozwoloną aktualizację bez zmiany rekordu spoza przydzielonego zakresu?

Takie ujęcie pozwala porównać rozwiązania i rozpoznać wynik sprzeczny z oczekiwaniami. Chroni też przed zastąpieniem ogólnego dowodu jedną udaną demonstracją.

Rozróżniaj odmowę, możliwości i ochronę.

Odmowa opisuje odpowiedź. Możliwości dotyczą zdolności wykonania zadania. Ochrona dotyczy tego, czy konkretny system zapobiega niedozwolonemu skutkowi. Chcemy badać związki między tymi pytaniami bez zastępowania jednego drugim.

Trwający projekt modeli z otwartymi wagami obejmuje obecnie eksploracyjne porównania nieszkodliwych zadań, wariantów precyzji i lokalnego wykonania. Formalna ocena odmów wymaga jeszcze ostatecznego planu analizy oraz przeglądu etycznego i zasad oceniania. Pilotaże nie potwierdzają zdolności do szkodliwego użycia ani zweryfikowanego wyniku dotyczącego bezpieczeństwa.

Pozwól ocenić porównanie.

W naszej praktyce badawczej chcemy zapisywać wersje modeli i oprogramowania, dozwolone dane, próby wykonania, błędy i reguły oceniania. Obok wyniku bezpieczeństwa powinna znaleźć się skuteczność w dozwolonych zadaniach, niepewność i nieudane próby.

Ramy zarządzania ryzykiem AI opracowane przez NIST uwzględniają wiarygodność w projektowaniu, rozwoju, użyciu i ocenie AI. Dla nas prowadzi to do praktycznego pytania: jakich dowodów potrzebuje inna osoba, by ocenić to samo twierdzenie?

Pozwól wynikom zmienić projekt.

Przydatne badanie powinno pomóc podjąć decyzję: ograniczyć uprawnienie, zmienić zatwierdzanie, poprawić test lub odrzucić podejście, które nie działa. W proponowanym badaniu odtwarzalności decyzji pytamy, czy zapis dowodów pomaga zrozumieć źródła, uprawnienia i wyniki.

To połączenie naszych ambicji badawczych, doradczych i produktowych. Uczciwie zbadać możliwości, zrozumieć błąd i przełożyć potwierdzoną poprawę na coś przydatnego dla organizacji.