2026-10-05 · ← Aktualności
Google chce zmieniać uprawnienia agentów wraz z kontekstem
Raport warsztatowy przygotowany z udziałem ponad 50 ekspertów proponuje kontekstowe reguły, które sprawdzają agentów AI przed wrażliwymi działaniami. Praktyczny wniosek wykracza poza prompt injection: uprawnienia agenta muszą zmieniać się w trakcie zadania, a nie być nadawane raz przy logowaniu.
Nie udało się wczytać obrazu.
Google Research opublikował raport warsztatowy o prywatności i bezpieczeństwie agentów AI, w którego przygotowaniu uczestniczyło ponad 50 osób ze świata nauki i przemysłu. Uczestnicy spotkali się pod koniec 2025 roku na warsztatach CAPS w Nowym Jorku. Proponują rozszerzyć teorię Contextual Integrity z oceny właściwego przepływu informacji na ocenę działań agenta.
Raport wskazuje trzy cechy, z którymi tradycyjne zabezpieczenia radzą sobie słabo: niejednoznaczne dane wejściowe w języku naturalnym, probabilistyczny przebieg wykonania oraz autonomię połączoną z delegowaniem. Agent może czytać pocztę, wywoływać narzędzia i przekazywać zadania innym agentom. Uprawnienie nadane na początku niewiele więc mówi o tym, czy późniejszy krok będzie właściwy.
Kontekst ma stać się częścią autoryzacji
Contextual Integrity ocenia przepływ informacji według uczestników, rodzaju danych i zasad ich przekazywania. Agent zakupowy może na przykład znać listę prezentów, ale nie powinien ujawniać jej rodzinie, dla której są przeznaczone. Raport stosuje tę samą logikę do działań: przed użyciem narzędzia system ma sprawdzić, czy dany krok pasuje do celu i sytuacji.
Proponowana warstwa nadzorcza zawiera kontekstowy policy engine. Ma on podczas działania tworzyć i egzekwować reguły dla nowych narzędzi, zmieniających się zadań oraz aktualnie przetwarzanych danych. Decyzja powinna zapaść, zanim informacja opuści przestrzeń roboczą użytkownika.
Zespoły bezpieczeństwa dostają ruchomy model uprawnień
Dla programistów i zespołów bezpieczeństwa pytanie zmienia się z prostego dostępu na konkretny cel. Ten sam agent może potrzebować danych paszportowych do wizy, adresu do rezerwacji hotelu oraz e maila dla organizatora konferencji. Każdy krok ma innego odbiorcę i inne dopuszczalne minimum danych.
Raport łączy więc sandboxing, tożsamość agenta, dynamiczne cofanie dostępu, rozumowanie modelu, kontrolę użytkownika i reguły współpracy wielu agentów. Zwraca też uwagę na zmęczenie potwierdzeniami. Gdy człowiek zatwierdza dziesiątki okien, kliknięcie przestaje być realną barierą bezpieczeństwa.
Model nie może jednocześnie składać wniosku i wydawać wyroku
Słabym punktem jest przełożenie norm społecznych na zasady, które maszyna potrafi wyegzekwować. Kontekst bywa sporny, różni się między organizacjami i czasem jest niejasny nawet dla ludzi. Jeśli ten sam model proponuje działanie, interpretuje regułę i zatwierdza własną interpretację, warstwa nadzorcza tylko przenosi zaufanie do kolejnego promptu.
To agenda badawcza, a nie gotowy produkt bezpieczeństwa. Raport nie podaje wspólnej miary, która pokazałaby, kiedy policy engine poprawnie wykrył niewłaściwe działanie, a kiedy tylko zablokował legalną pracę.
Długie testy pokażą, czy reguły przetrwają zmianę sytuacji
Autorzy proponują otwarte środowiska Agent Gym do długotrwałych testów wielu agentów i kaskad ich działań. Użyteczny benchmark musi mierzyć więcej niż powodzenie ataku. Powinien rejestrować zmiany uprawnień, pochodzenie każdego kroku, fałszywe blokady i możliwość natychmiastowego cofnięcia dostępu.
W produkcji kluczowe będzie rozdzielenie ról. Policy engine potrzebuje własnego śladu audytowego i technicznej możliwości zatrzymania tool call, nawet gdy model uzna działanie za właściwe. Rozumowanie o kontekście bez niezależnego egzekwowania pozostaje radą, którą napastnik może próbować przegadać.
Werdykt Lilith
Agent jednym tchem prosi o paszport, kalendarz i kartę firmową. Kontekstowy policy engine musi pilnować każdego przekazania osobno i móc zatrzymać jego rękę, a nie tylko szeptać kolejną radę.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗