Lilith.
⌕
Ilustracja redakcyjna: Google chce zmieniać uprawnienia agentów wraz z kontekstem
Ilustracja Lilith · remiks redakcyjny

Google Research opublikował raport warsztatowy o prywatności i bezpieczeństwie agentów AI, w którego przygotowaniu uczestniczyło ponad 50 osób ze świata nauki i przemysłu. Uczestnicy spotkali się pod koniec 2025 roku na warsztatach CAPS w Nowym Jorku. Proponują rozszerzyć teorię Contextual Integrity z oceny właściwego przepływu informacji na ocenę działań agenta.

Raport wskazuje trzy cechy, z którymi tradycyjne zabezpieczenia radzą sobie słabo: niejednoznaczne dane wejściowe w języku naturalnym, probabilistyczny przebieg wykonania oraz autonomię połączoną z delegowaniem. Agent może czytać pocztę, wywoływać narzędzia i przekazywać zadania innym agentom. Uprawnienie nadane na początku niewiele więc mówi o tym, czy późniejszy krok będzie właściwy.

Kontekst ma stać się częścią autoryzacji

Contextual Integrity ocenia przepływ informacji według uczestników, rodzaju danych i zasad ich przekazywania. Agent zakupowy może na przykład znać listę prezentów, ale nie powinien ujawniać jej rodzinie, dla której są przeznaczone. Raport stosuje tę samą logikę do działań: przed użyciem narzędzia system ma sprawdzić, czy dany krok pasuje do celu i sytuacji.

Proponowana warstwa nadzorcza zawiera kontekstowy policy engine. Ma on podczas działania tworzyć i egzekwować reguły dla nowych narzędzi, zmieniających się zadań oraz aktualnie przetwarzanych danych. Decyzja powinna zapaść, zanim informacja opuści przestrzeń roboczą użytkownika.

Zespoły bezpieczeństwa dostają ruchomy model uprawnień

Dla programistów i zespołów bezpieczeństwa pytanie zmienia się z prostego dostępu na konkretny cel. Ten sam agent może potrzebować danych paszportowych do wizy, adresu do rezerwacji hotelu oraz e maila dla organizatora konferencji. Każdy krok ma innego odbiorcę i inne dopuszczalne minimum danych.

Raport łączy więc sandboxing, tożsamość agenta, dynamiczne cofanie dostępu, rozumowanie modelu, kontrolę użytkownika i reguły współpracy wielu agentów. Zwraca też uwagę na zmęczenie potwierdzeniami. Gdy człowiek zatwierdza dziesiątki okien, kliknięcie przestaje być realną barierą bezpieczeństwa.

Model nie może jednocześnie składać wniosku i wydawać wyroku

Słabym punktem jest przełożenie norm społecznych na zasady, które maszyna potrafi wyegzekwować. Kontekst bywa sporny, różni się między organizacjami i czasem jest niejasny nawet dla ludzi. Jeśli ten sam model proponuje działanie, interpretuje regułę i zatwierdza własną interpretację, warstwa nadzorcza tylko przenosi zaufanie do kolejnego promptu.

To agenda badawcza, a nie gotowy produkt bezpieczeństwa. Raport nie podaje wspólnej miary, która pokazałaby, kiedy policy engine poprawnie wykrył niewłaściwe działanie, a kiedy tylko zablokował legalną pracę.

Długie testy pokażą, czy reguły przetrwają zmianę sytuacji

Autorzy proponują otwarte środowiska Agent Gym do długotrwałych testów wielu agentów i kaskad ich działań. Użyteczny benchmark musi mierzyć więcej niż powodzenie ataku. Powinien rejestrować zmiany uprawnień, pochodzenie każdego kroku, fałszywe blokady i możliwość natychmiastowego cofnięcia dostępu.

W produkcji kluczowe będzie rozdzielenie ról. Policy engine potrzebuje własnego śladu audytowego i technicznej możliwości zatrzymania tool call, nawet gdy model uzna działanie za właściwe. Rozumowanie o kontekście bez niezależnego egzekwowania pozostaje radą, którą napastnik może próbować przegadać.

Werdykt Lilith

Agent jednym tchem prosi o paszport, kalendarz i kartę firmową. Kontekstowy policy engine musi pilnować każdego przekazania osobno i móc zatrzymać jego rękę, a nie tylko szeptać kolejną radę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗