Lilith Lilith.
Redakční ilustrace: Claude Code Auto Mode má díru: Bezpečnostní mechanismus blokuje vlastní úklid
Ilustrace Lilith · redakční remix

Auto Mode se stává součástí problému

Bezpečnostní výzkumník Johann Rehberger demonstroval úspěšný útok na výchozí Auto Mode v Claude Code od Anthropicu. Pomocí prompt injection dokázal agenta přesvědčit, aby stáhl a rozbalil archiv obsahující maskovaný lokální soubor, který po importu běžné knihovny spustí škodlivý kód. Úspěšnost útoku dosahuje podle Rehbergera 80 %.

Kritický objev ale neleží v samotném spuštění kódu. Když Claude Code kompromitaci zaznamenal a pokusil se proces s malwarem ukončit, Auto Mode tento úklidový příkaz zablokoval. Klasifikátor tedy povolil vytvoření škodlivého procesu, ale následně zakázal jeho odstranění.

Pro vývojáře se mění rovnice důvěry

Tento vektor ukazuje, že přidání další schvalovací a bezpečnostní vrstvy do autonomního vývojářského agenta neřeší podstatu problému s prompt injection, pouze mění chování nástroje. Anthropic na Auto Mode sázel jako na robustní ochranu, chyba ale demonstruje, že pokud je agent schopen spouštět kód, obranné mechanismy samotného agenta mohou paradoxně bránit mitigaci škod po úspěšném průniku.

Pro týmy nasazující agentní nástroje to znamená jediné: spoléhat na to, že model rozpozná a napraví vlastní bezpečnostní selhání, zatím není možné, zvlášť když mu v tom brání jeho vlastní vnitřní pravidla.

Sandbox je jediné reálné řešení

Případ ukazuje limity softwarových bariér uvnitř LLM systémů. Jakmile kód běží ve stejném prostředí, ke kterému má přístup model a do kterého proudí vnější, potenciálně kontaminovaná data (například stažené soubory z webu), je prostředí vždy zranitelné.

Pokud se agent dostane k domácím složkám, SSH klíčům nebo cloudovým credentials, kompromitace je úplná. Jakkoliv dobrý Auto Mode nemůže nahradit fyzickou a síťovou izolaci.

Tlak na architekturu agentních nástrojů

Incident donutí tvůrce agentů přesunout pozornost od pokusů o „neprůstřelné prompty“ k systematickému sandboxingu. Zásadním ukazatelem vyspělosti budoucích kódovacích asistentů nebude to, jak dobře se sami hlídají, ale jestli už v základu běží v kontejnerech bez síťového egressu a bez přístupu k citlivým proměnným vývojáře.

Lilithin verdikt

Agent nesmí být vlastní policajt. Dokud kód z LLM běží s právy k tvému domovskému adresáři, je sebelepší Auto Mode jen bezpečnostní divadlo, které navíc může při požáru zablokovat hasičák.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗