Lilith.
⌕
Redakční ilustrace: Google chce agentům měnit oprávnění podle kontextu
Ilustrace Lilith · redakční remix

Google Research zveřejnil workshop report o soukromí a bezpečnosti AI agentů, na němž se podílelo více než 50 lidí z akademie a průmyslu. Autoři se sešli na workshopu CAPS v New Yorku na konci roku 2025 a navrhují rozšířit teorii Contextual Integrity z vhodného toku informací také na vhodnost akcí agenta.

Report popisuje tři vlastnosti, kvůli nimž běžné zabezpečení nestačí: nejednoznačné vstupy v přirozeném jazyce, pravděpodobnostní průběh vykonávání a autonomii s delegováním. Agent může číst poštu, volat nástroje a rozdělit úlohu dalším agentům. Jedno oprávnění udělené na začátku proto říká málo o tom, zda je konkrétní krok později vhodný.

Kontext se má stát součástí autorizace

Contextual Integrity posuzuje tok informací podle aktérů, typu dat a pravidel přenosu. Nákupní agent například může znát seznam dárků, ale neměl by ho sdělit rodině, pro kterou jsou dárky určené. Report stejnou logiku vztahuje i na akce: před použitím nástroje se má hodnotit, zda krok odpovídá účelu a situaci.

Navržený supervisor obsahuje kontextový policy engine. Ten má za běhu vytvářet a vynucovat pravidla pro nově objevené nástroje, měnící se úlohu a data, která agent právě zpracovává. Cílem je rozhodnout ještě předtím, než informace opustí pracovní prostor uživatele.

Bezpečnostní tým dostává pohyblivý model oprávnění

Pro vývojáře a bezpečnostní týmy to mění otázku z prostého přístupu na konkrétní účel. Stejný agent může potřebovat pasové údaje pro žádost o vízum, adresu pro hotel a e mail pro organizátora konference. Každý krok má jiného příjemce a jiné přijatelné minimum dat.

Report proto kombinuje sandboxing, identitu agenta, dynamické odebrání přístupu, modelové uvažování, uživatelské ovládání a pravidla pro spolupráci více agentů. Upozorňuje také na únavu z potvrzování. Pokud člověk schválí desítky dialogů, jeho kliknutí přestává fungovat jako bezpečnostní bariéra.

Model nesmí být zároveň žadatelem i soudcem

Slabým místem návrhu je převod společenských norem na strojově vynutitelnou politiku. Kontext bývá sporný, mění se mezi organizacemi a někdy chybí i lidem. Pokud stejný model navrhne akci, vyloží pravidlo a schválí vlastní výklad, supervisor jen přesune důvěru do dalšího promptu.

Report je výzkumná agenda, nikoli hotový bezpečnostní produkt. Neuvádí společnou metriku, která by ukázala, kdy policy engine správně rozpoznal nevhodnou akci a kdy pouze zablokoval legitimní práci.

Dlouhé testy ukážou, zda pravidla přežijí změnu situace

Autoři navrhují otevřená prostředí Agent Gym pro dlouhodobé testy více agentů a kaskád jejich akcí. Užitečný benchmark musí zachytit nejen úspěch útoku, ale také změny oprávnění, původ jednotlivých kroků, falešné blokace a možnost přístup okamžitě odebrat.

V produkci bude rozhodující oddělení rolí. Policy engine musí mít vlastní auditní stopu a technickou moc zastavit tool call, i když model tvrdí, že je krok vhodný. Kontextové uvažování bez nezávislého vynucení zůstává doporučením, které útočník může zkusit ukecat.

Lilithin verdikt

Agent žádá o pas, kalendář a firemní kartu jedním dechem. Kontextový policy engine má stát u každého předání zvlášť a smět mu ruku zastavit, ne pouze šeptat další doporučení.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗