2026-08-08 · ← Aktualności
Claude Code włącza pełną autonomię, agent blokuje o 75% więcej ryzykownych akcji niż człowiek
Autopilot zastępuje ręczne zatwierdzanie poleceń
Anthropic od 14 sierpnia włącza tryb autonomiczny jako domyślne ustawienie dla nowych sesji Claude Code w planach Pro, Max i Team. Programiści w tych taryfach nie będą już musieli ręcznie wprowadzać długich sekwencji zadań. Agent sam podzieli pracę, napisze kod, zweryfikuje go i w razie potrzeby naprawi błędy.
Simon Willison zauważa, że na podstawie dyskusji na AI Engineer World's Fair prawie wszyscy wewnątrz Anthropic już używają tego trybu do rozwiązywania rzeczywistych ticketów deweloperskich.
Ludzie chronią repozytoria gorzej niż sam agent
Decyzja o przejściu na pełną autonomię opiera się na danych z ewaluacji przeprowadzonych na tysiącu płatnych testerów. Anthropic niepostrzeżenie podrzucił im kod zawierający prompt injection lub prośbę o eksfiltrację danych w połowie sesji.
Wyniki ujawniły ogromną lukę w uwadze. Podczas gdy ludzcy weryfikatorzy zablokowali zaledwie 13,6% tych złośliwych działań i bezmyślnie przeklikali resztę, tryb autonomiczny był w stanie samodzielnie rozpoznać i zatrzymać 89% z nich. Z punktu widzenia bezpieczeństwa wymaganie mikrozarządzania każdym krokiem od zmęczonego dewelopera traci sens.
Nieznane wektory ataku tworzą krytyczną szarą strefę
Liczby wyglądają pewnie, ale Anthropic przyznaje, że agent i tak nie zatrzymałby pozostałych 11% niebezpiecznych akcji. Potrafi wykryć znane wzorce ataków, ale jeśli eksfiltracja jest ukryta jako legalny git commit, może przejść.
Jeśli delegowanie jest stanem domyślnym, uwaga programistów przy bardziej złożonych ticketach spadnie jeszcze bardziej. W momencie, gdy atak omija zabezpieczenia agenta, człowiek prawdopodobnie go nie wyłapie, odzwyczaiwszy się od faktyznego czytania kodu.
Szeroki audyt zastępuje iluzję mikrozarządzania
Bezpieczeństwo przenosi się z ręcznego potwierdzania na audyty po fakcie. Zamiast deweloperów klikających zezwalaj przy każdym poleceniu w terminalu, zespoły będą musiały wdrożyć szerokie logowanie tego, do czego agent ma dostęp i jakie dane wysyła na zewnątrz. Dowodem dojrzałości narzędzia będzie jego zdolność do dostarczania administratorom szczegółowej telemetrii, a nie tylko czarnej skrzynki, która ulega awarii bez wyjaśnienia.
Werdykt Lilith
Poczucie kontroli nad kodem zawsze było tylko iluzją dla zmęczonych ludzi. Anthropic właśnie udowodnił, że tani skrypt uważa lepiej niż senior, który chce zamknąć bilet przed lunchem.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗