Lilith.
⌕
Ilustracja redakcyjna: Goodfire pilnuje agentów od środka i twierdzi, że obniżyło koszt z 10 000 do 51 dolarów
Ilustracja Lilith · remiks redakcyjny

Goodfire uruchomiło system monitoringu, który obserwuje więcej niż tekst i działania agenta AI. Małe klasyfikatory nazywane probes odczytują wewnętrzne aktywacje modelu podczas inference, a tylko podejrzane przypadki przekazują drugiemu modelowi AI do dokładniejszej kontroli. Usługa jest dostępna dla klientów platformy inference Baseten.

Probes sprawdzają każdy krok i eskalują tylko podejrzane przypadki

Klient może wybrać ryzyka, takie jak ofensywne hakowanie, nadużycia chemiczne i biologiczne czy reward hacking. Ustala też reakcję: zapis zdarzenia, przekazanie człowiekowi albo odrzucenie żądania. Pierwszy monitor Goodfire powstał dla otwartego modelu Kimi K3.

Kaskada rozwiązuje problem kosztu tradycyjnego nadzoru. Osobny sędzia LLM musi ponownie przeczytać długą historię agenta, podczas gdy probe korzysta z obliczeń już wykonywanych przez model docelowy. Droższa kontrola uruchamia się dopiero po przekroczeniu ustawionego progu.

Tani pierwszy filtr może zatrzymać akcję przed użyciem narzędzia

W teście Goodfire obejmującym około 1 500 sesji Kimi K3 monitoring kosztował mniej więcej 51 dolarów. Według firmy tańszy model kontrolujący każdy krok kosztowałby 233 dolary, a model najwyższej klasy około 10 000 dolarów. Probes wykryły 94 % szkodliwych sesji hakerskich i skierowały do ponownej oceny 8,7 % sesji nieszkodliwych.

Jeśli podobne proporcje utrzymają się w produkcji, zespoły bezpieczeństwa nie będą musiały wybierać między szybką reakcją a rachunkiem za drugi duży model. Filtr synchroniczny może zablokować podejrzane działanie przed wywołaniem narzędzia. Dla agentów z dostępem do sieci, terminala lub danych firmowych jest to ważniejsze niż raport po incydencie.

Firmowy benchmark nie tworzy jeszcze uniwersalnej ochrony

Liczby pochodzą od Goodfire i opisują testy na konkretnym modelu oraz zbiorze ataków. Firma podaje, że cztery równoległe probes zwiększyły czas do pierwszego tokenu o mniej niż 2 %, lecz jakość produkcyjną określą fałszywe alarmy, zmiany modelu i ataki dopasowane do samego monitora. Przerwanie 8,7 % nieszkodliwych sesji może być do przyjęcia w sandboxie cyberbezpieczeństwa, a bardzo uciążliwe w zwykłej pracy deweloperskiej.

Metoda wymaga też dostępu do wewnętrznych aktywacji i integracji z warstwą inference. Najlepiej pasuje więc do modeli otwartych oraz dostawców kontrolujących serving. Takiego monitora nie da się po prostu podłączyć do zamkniętego API, które nie udostępnia sygnałów wewnętrznych.

Transfer między modelami i adaptacyjne ataki rozstrzygną o wartości

Kolejny test powinien pokazać, jak szybko probes można przenieść na inny model i co dzieje się po aktualizacji albo fine-tuningu. Niezależne red teamy powinny obejmować napastników znających zasadę działania monitora, a nie tylko stały zestaw wcześniej wybranych jailbreaków.

Kupujący będą potrzebowali danych z eksploatacji: ile szkodliwych działań system zatrzymuje przed tool use, ile prawidłowej pracy przerywa i ile kosztuje ponowne trenowanie po zmianie modelu. Te trzy wielkości pokażą, czy wewnętrzne aktywacje staną się zwykłą telemetrią bezpieczeństwa, czy dodatkiem dla kilku otwartych modeli.

Werdykt Lilith

Goodfire montuje czujnik dymu wewnątrz silnika agenta, a drogiego śledczego wzywa dopiero po wykryciu podejrzanego zapachu. Rozwiązanie zda egzamin, jeśli czujnik przetrwa wymianę silnika i nie będzie alarmował przy każdej parze.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗