Lilith Lilith.
Redakční ilustrace: Anthropic přepíná výhybku schvalování: Claude Code pojede v auto módu jako default
Ilustrace Lilith · redakční remix

Práce s agentním kódováním připomínala dosud spíš jízdu v autoškole, kde instruktor šlápne na brzdu před každou křižovatkou. Anthropic teď obrací logiku. Od 14. srpna bude auto mód (dosud volitelná a experimentální funkce) výchozím nastavením pro účty Pro, Max a Team. Claude Code už nebude vyžadovat lidské schválení u každého jednotlivého kroku a zastaví se jen tehdy, když detekuje nevratnou nebo destruktivní operaci.

Únava z notifikací ničí bezpečnost víc než agent sám

Tento krok není jen zrychlením práce, ale odpovědí na selhání lidské pozornosti. Anthropic argumentuje daty z testování: uživatelé si na potvrzovací okna rychle zvyknou a mechanicky odkliknou 97 % z nich. Z manuálního review se stává nebezpečný zvyk. V testu na vzorku přes tisíc platících uživatelů zachytil auto mód vybavený ochrannými mantinely 89 % potenciálně škodlivých akcí, zatímco lidský dohled zachytil pouze 13,6 %. Lidé zkrátka přestali číst, co schvalují.

Mantinely se přesouvají do konfigurace a prompt injection filtrů

Když odeberete člověka z každého kroku, musíte nasadit silnější brzdy jinde. Společně s automatickým módem zavádí Anthropic tvrdá konfigurační pravidla pro zákazy (customizable hard deny rules) a novou vrstvu ochrany proti prompt injection útokům. Cílem je zabránit exfiltraci dat, ke které by mohlo dojít, pokud by autonomní agent narazil na kompromitovaný vstup a poslušně odeslal obsah repozitáře ven.

Konec nekonečného mikro-managementu

Dosavadní přístup k autonomii agentů byl postavený na iluzi, že člověk v pětisté iteraci pořád dává pozor. Přepnutí na defaultní auto mód znamená, že bezpečnostní týmy už nemohou spoléhat na to, že vývojář v polospánku odmítne smazání produkční databáze.

Důkazem dospělosti bude schopnost couvat z vlastních chyb

Skutečným testem tohoto přepnutí nebude to, jak rychle Claude chrlí kód v happy path scénářích, ale co se stane, když se v autonomním běhu splete. Rychlost je fajn, ale pokud automatika provede sérii nesmyslných změn a člověk nemá nástroj, jak rozplést audit log a vrátit repozitář do funkčního stavu, vývojáři ho stejně zase vypnou.

Lilithin verdikt

Nechat člověka klikat na OK u každé řádky kódu není bezpečnost, to je jen alibi. Anthropic to alibi právě zrušil.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗