Lilith Lilith.
Redakční ilustrace: Codex mazal soubory tam, kde agent dostal příliš volnou ruku
Ilustrace Lilith · redakční remix

Simon Willison upozornil na citaci Thibaulta Sottiauxe o chybě v Codexu, při níž GPT-5.6 v několika hlášeních nečekaně mazal soubory. Podle citace se problém nejčastěji objevil v situaci s konkrétní kombinací přístupů a nastavení.

Chyba v Codexu se týkala kombinace plného přístupu a $HOME

K události mělo dojít, když byl zapnutý full access mode, Codex běžel bez sandboxing protections a bez auto review, model se pokusil přepsat proměnnou $HOME pro dočasný adresář a omylem smazal domovský adresář. Nejde tedy o to, že by GPT-5.6 mazalo soubory paušálně, ale o důsledek volnosti v právech.

To je typ selhání, který se u coding agents podceňuje. Dokud model jen navrhuje patch, nevypadá nebezpečně. Pokud ale dostane shell, přístup na filesystem a možnost obejít review, obyčejná chyba v interpretaci proměnné může skončit destruktivně.

Pro vývojářské týmy se mění vnímání bezpečnosti agentů

Pro týmy používající Codex, Claude Code nebo interní agentní nástroje platí, že bezpečnost coding agenta už není jen benchmark schopnosti psát kód. Je to architektura celého runtime prostředí, ve kterém běží.

Sandbox, explicitní allowlist, potvrzení destruktivních operací a audit log jsou rozdíl mezi agentem, který chybně navrhne změnu, a agentem, který ji fyzicky provede. Auto review je klíčové přesně pro ty chvíle, kdy je chyba v úsudku banální, ale její důsledek zásadní.

Plný přístup zvyšuje dosah omylů

Full access mode je pro vývojáře pohodlný, protože snižuje tření. Agent nemusí žádat o každé povolení a zvládne více kroků sám. Stejná volnost ale přímo úměrně zvětšuje dosah každé, i nezáměrné, chyby v jeho postupu.

Incident neukazuje na zlý úmysl, Sottiaux přímo popisuje „honest mistake“. To dělá situaci o to složitější, protože bezpečnostní pojistky nesmí spoléhat na to, že model chybuje pouze zjevně a dramaticky.

Přístup k filesystému se musí stát bezpečnostním rozhraním

Zajímavé bude sledovat, zda OpenAI upraví výchozí nastavení Codexu a zda destruktivní operace nebo přepisování kritických cest dostanou tvrdší pravidla pro schvalování.

Pokud se coding agents mají stát běžnou součástí vývoje, práce se soubory musí být navržena jako řízené bezpečnostní rozhraní, ne jen jako samozřejmý vedlejší efekt shellu.

Lilithin verdikt

Když pošlete úředníka s vozíkem do archivu a ukážete mu špatnou cestu, vyveze do skartu celou skříň. S filesystémem je to stejné.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗