Badania

Możliwości. Granice. Dowody.

Pytania, którym wartopoświęcić uwagę.

Zacząć od tego, czego jeszcze nie wiemy.

Chcemy zrozumieć, do czego AI jest naprawdę zdolna, sprawdzać jej granice i rozwijać skuteczniejsze zabezpieczenia wraz ze wzrostem możliwości. Badamy modele, uprawnienia agentów i weryfikowalne decyzje, aby realnie zwiększać bezpieczeństwo AI.

Wybierz pytanie badawcze

Trzy pytania badawcze

Podążaj za pytaniem.

W aktywnym badaniu modeli z otwartymi wagami wykonano małe porównania nieszkodliwych zadań dla par modeli 3B i 8B, testy precyzji oraz pomiary działania lokalnego. Dwie propozycje rozszerzają program o uprawnienia agentów i dowody dotyczące decyzji.

Jedno badanie w toku / Dwie propozycje

Wybierz obszar badania

Wybierz pytanie, aby poznać zakres badania.

01 / Zachowanie modeliW toku

Odmowa, możliwości i modele z otwartymi wagami.

Pytanie przewodnieCo się zmienia, gdy model rzadziej odmawia wykonania polecenia?

Badamy, czym opublikowane modele zmodyfikowane pod kątem rzadszych odmów różnią się od swoich wersji bazowych w zwykłych zadaniach i działaniu lokalnym. Obecne prace obejmują odtwarzalne porównania nieszkodliwych zadań, precyzji obliczeń i wydajności na lokalnym sprzęcie. Formalne testy odmów czekają na dopracowanie planu analizy oraz ocenę etyczną i metod punktacji. Obserwacje z pilotaży nie są potwierdzonymi wynikami dotyczącymi bezpieczeństwa.

Obecny etapPilotaże eksploracyjne

Poznaj zakres badania
02 / Minimalne uprawnienia agentówPropozycja badania

Jakich uprawnień naprawdę potrzebuje agent AI?

Pytanie przewodnieCzy węższe uprawnienia pozwalają zachować użyteczność i ograniczyć skutki błędu?

Proponujemy porównanie szerokiego dostępu do konta, stałych ról i uprawnień nadawanych do konkretnego zadania w symulatorze z syntetycznymi procesami. Osobno sprawdzimy odczyt rekordu, propozycję zmiany i zatwierdzony zapis, również po cofnięciu dostępu lub wygaśnięciu zgody. Zmierzymy zarówno niedozwolone działania, które rzeczywiście doszły do skutku, jak i poprawne wykonanie dozwolonych zadań.

Obecny etapPropozycja badania eksploracyjnego

Poznaj zakres badania
03 / Dowody i zapis decyzjiPropozycja badania

Czy ktoś inny odtworzy przebieg decyzji?

Pytanie przewodnieJakich dowodów potrzebuje osoba oceniająca działanie AI, gdy zmienił się już jego kontekst?

Proponujemy porównanie zapisów rozmów, zwykłych dzienników aplikacji i uporządkowanych zestawów dowodów w syntetycznych procesach. Niezależne osoby oceniające odpowiedzą na ustalone pytania o źródła, uprawnienia, zgody i wyniki. Zmierzymy poprawność odtworzenia, brakujące powiązania, czas analizy i ilość zachowanych danych wrażliwych. Sama jakość dowodów nie potwierdza zgodności z przepisami.

Obecny etapPropozycja badania eksploracyjnego

Poznaj zakres badania

Podejście badawcze

Od lepszego pytania
do skuteczniejszej ochrony.

  1. Możliwości

    Co system naprawdę potrafi?

    Sprawdzić określone zadanie, również tam, gdzie system zawodzi.

  2. Granice

    Do czego ma uprawnienia?

    Określić dostęp, narzędzia i zgody wymagane od człowieka.

  3. Dowody

    Na czym opieramy wniosek?

    Zachować wersje, wyniki i informacje o niepewności.

  4. Projektowanie zabezpieczeń

    Co trzeba zmienić?

    Na podstawie dowodów poprawić zabezpieczenia i sprawdzić je ponownie.

Nasze podejście: poznanie możliwości pomaga wyznaczyć granice, a dowody kierują projektowaniem zabezpieczeń. Schemat opisuje metodę, nie wyniki eksperymentów.

Standard badawczy

Dowody wraz z ich ograniczeniami.

Chcemy, by metody, założenia i ograniczenia były równie widoczne jak wyniki. Pilotaż służy poznaniu sposobu pomiaru; formalny wniosek wymaga odpowiedniego projektu i dowodów.

Zlecenie komercyjne nie daje nam automatycznie prawa do ponownego wykorzystania danych, kodu czy ustaleń klienta. Badania wymagają odrębnego zakresu i odpowiednich zgód.

  1. Zapisywać wersje modeli, narzędzi, danych i reguł każdego porównania.

  2. Oddzielać przykłady rozwojowe, pilotaże i nowe przypadki ewaluacyjne.

  3. Mierzyć poprawne wykonanie dozwolonych zadań oraz błędy bezpieczeństwa.

  4. Zachowywać wyniki zerowe, nieudane próby i niepewność.

Perspektywy

Idee, które kierują pracą.

Dwa punkty wyjścia do rozmowy o bezpieczniejszym AI.

Współpraca badawcza

Jakie pytanie powinniśmy zbadać razem?

Zapraszamy do konkretnych rozmów o metodach ewaluacji, uprawnieniach agentów i dowodach potrzebnych do oceny pracy wspomaganej przez AI. Współpraca zaczyna się od jasnego pytania, danych z odpowiednimi zgodami i wykonalnego zakresu.

Zacznijmy od pytania, które ma znaczenie.