Perspektywa / Forthreason AI
Co byłoby dowodem na bezpieczniejsze AI?
Istotne jest nie to, czy demonstracja wygląda bezpiecznie, lecz to, jakie wnioski pozwala wyciągnąć dobrze zaprojektowany test.
Nasze podejście i pytania badawcze.
Zacznij od twierdzenia, które może okazać się błędne.
"Ten system jest bezpieczny" to twierdzenie zbyt szerokie, by sensownie je sprawdzić. Węższe określa zadanie, środowisko, uprawnienia i istotny błąd. Przykład: czy agent potrafi wykonać dozwoloną aktualizację bez zmiany rekordu spoza przydzielonego zakresu?
Takie ujęcie pozwala porównać rozwiązania i rozpoznać wynik sprzeczny z oczekiwaniami. Chroni też przed zastąpieniem ogólnego dowodu jedną udaną demonstracją.
Rozróżniaj odmowę, możliwości i ochronę.
Odmowa opisuje odpowiedź. Możliwości dotyczą zdolności wykonania zadania. Ochrona dotyczy tego, czy konkretny system zapobiega niedozwolonemu skutkowi. Chcemy badać związki między tymi pytaniami bez zastępowania jednego drugim.
Trwający projekt modeli z otwartymi wagami obejmuje obecnie eksploracyjne porównania nieszkodliwych zadań, wariantów precyzji i lokalnego wykonania. Formalna ocena odmów wymaga jeszcze ostatecznego planu analizy oraz przeglądu etycznego i zasad oceniania. Pilotaże nie potwierdzają zdolności do szkodliwego użycia ani zweryfikowanego wyniku dotyczącego bezpieczeństwa.
Pozwól ocenić porównanie.
W naszej praktyce badawczej chcemy zapisywać wersje modeli i oprogramowania, dozwolone dane, próby wykonania, błędy i reguły oceniania. Obok wyniku bezpieczeństwa powinna znaleźć się skuteczność w dozwolonych zadaniach, niepewność i nieudane próby.
Ramy zarządzania ryzykiem AI opracowane przez NIST uwzględniają wiarygodność w projektowaniu, rozwoju, użyciu i ocenie AI. Dla nas prowadzi to do praktycznego pytania: jakich dowodów potrzebuje inna osoba, by ocenić to samo twierdzenie?
Pozwól wynikom zmienić projekt.
Przydatne badanie powinno pomóc podjąć decyzję: ograniczyć uprawnienie, zmienić zatwierdzanie, poprawić test lub odrzucić podejście, które nie działa. W proponowanym badaniu odtwarzalności decyzji pytamy, czy zapis dowodów pomaga zrozumieć źródła, uprawnienia i wyniki.
To połączenie naszych ambicji badawczych, doradczych i produktowych. Uczciwie zbadać możliwości, zrozumieć błąd i przełożyć potwierdzoną poprawę na coś przydatnego dla organizacji.