Perspektywa / Forthreason AI
Bezpieczeństwo agentów wymaga granic poza modelem.
Agent może potrafić wykonać zadanie, nie mając prawa go wykonać. Od tego rozróżnienia zaczynamy projektowanie bezpiecznych wdrożeń AI.
Nasze podejście i pytania badawcze.
Możliwości badamy. Uprawnienia projektujemy.
System może napisać przekonującą wiadomość, odczytać dokument lub przygotować zmianę. Prawo do wysłania wiadomości, dostępu do dokumentu czy zapisania zmiany jest osobną kwestią. Podłączenie narzędzi nadaje temu rozróżnieniu praktyczne znaczenie.
Zaczynamy od zadania: kto je zlecił, jakie dane są potrzebne, jakie działania są dozwolone i kto odpowiada za wynik. Instrukcja dla modelu może opisywać te granice; aplikacja musi je egzekwować. OWASP wskazuje zbędne funkcje, uprawnienia i autonomię jako przyczyny nadmiernej sprawczości agentów.
Oddziel propozycję od jej skutków.
Rozważmy syntetyczny proces aktualizacji danych dostawcy. Asystent odczytuje zgłoszenie i proponuje zmianę. Osoba odpowiedzialna ocenia jej dokładną treść. Osobna usługa sprawdza aktualne uprawnienia przed zapisem. Odczyt, propozycja, zatwierdzenie i wykonanie to różne kroki.
To przykład projektowy, a nie deklaracja wdrożenia produktu zabezpieczającego płatności. Pozwala postawić konkretne pytania: czy stara zgoda pozwoli na zmienione działanie, czy cofnięcie dostępu zadziała i czy żądanie może wyjść poza swój zakres?
Sprawdzaj rzeczywisty skutek.
Uspokajająca odpowiedź nie dowodzi, że niedozwolone działanie zostało zablokowane. W proponowanym badaniu uprawnień agentów chcemy mierzyć końcowy stan kontrolowanego procesu oraz poprawne wykonanie dozwolonych zadań. System odrzucający wszystko nie rozwiązuje problemu biznesowego.
Wcześniejsza praca założyciela pod marką Bento daje temu kierunkowi praktyczne podstawy: weryfikacja aplikacji Queenie's obejmowała role i własność rozmów, a poufny projekt dla branży gier dotyczył między innymi zapisu działań operacyjnych. To doświadczenie inżynierskie, nie zakończone eksperymenty nad bezpieczeństwem agentów.
Zabezpieczenie, które potwierdza swoją wartość.
Chcemy ustalić, które mechanizmy ograniczają możliwość szkody, zachowując użyteczność. Potrzebne są testy o określonym zakresie, jawne kryteria błędu i zapis możliwy do oceny przez inną osobę. Celem jest skuteczniejsza ochrona wokół coraz bardziej sprawnych systemów, oparta na dowodach.