Lilith Lilith.
Ilustracja redakcyjna: Claude Code Auto Mode z luką: Mechanizm bezpieczeństwa blokuje własne czyszczenie
Ilustracja Lilith · remiks redakcyjny

Auto Mode staje się częścią problemu

Badacz bezpieczeństwa Johann Rehberger zademonstrował udany atak na domyślny Auto Mode w Claude Code od Anthropic. Używając prompt injection, nakłonił agenta do pobrania i rozpakowania archiwum zawierającego zamaskowany plik lokalny, który uruchamia złośliwy kod przy imporcie standardowej biblioteki. Skuteczność ataku wynosi według Rehbergera 80%.

Krytyczne odkrycie nie leży jednak w samym uruchomieniu kodu. Gdy Claude Code wykrył naruszenie i próbował zakończyć proces złośliwego oprogramowania, Auto Mode zablokował polecenie czyszczenia. Klasyfikator pozwolił na utworzenie szkodliwego procesu, ale następnie zabronił jego usunięcia.

Równanie zaufania zmienia się dla deweloperów

Ten wektor pokazuje, że dodanie kolejnej warstwy zatwierdzania i bezpieczeństwa do autonomicznego agenta deweloperskiego nie rozwiązuje sedna problemu z prompt injection, a jedynie zmienia zachowanie narzędzia. Anthropic liczył na Auto Mode jako na solidną obronę, ale błąd dowodzi, że jeśli agent może uruchamiać kod, jego własne mechanizmy obronne mogą paradoksalnie utrudniać ograniczenie szkód po udanym włamaniu.

Dla zespołów wdrażających narzędzia agentowe oznacza to jedno: poleganie na modelu, że rozpozna i naprawi własne błędy bezpieczeństwa, nie jest jeszcze możliwe, zwłaszcza gdy powstrzymują go przed tym jego własne wewnętrzne reguły.

Sandbox to jedyne realne rozwiązanie

Przypadek ten ukazuje granice barier programistycznych w systemach LLM. Kiedy kod działa w tym samym środowisku, do którego model ma dostęp i do którego trafiają zewnętrzne, potencjalnie zanieczyszczone dane (np. pliki pobrane z sieci), środowisko to jest fundamentalnie podatne na ataki.

Jeśli agent uzyska dostęp do katalogów domowych, kluczy SSH lub danych uwierzytelniających w chmurze, kompromitacja jest całkowita. Niezależnie od tego, jak dobry jest Auto Mode, nie może on zastąpić fizycznej i sieciowej izolacji.

Presja na architekturę narzędzi agentowych

Incydent zmusi twórców agentów do przeniesienia uwagi z prób tworzenia „kuloodpornych promptów” na systematyczny sandboxing. Głównym wskaźnikiem dojrzałości przyszłych asystentów kodowania nie będzie to, jak dobrze się sami pilnują, ale to, czy domyślnie działają w kontenerach z ograniczonym wyjściem do sieci i bez dostępu do poufnych zmiennych dewelopera.

Werdykt Lilith

Agent nie może być własnym policjantem. Dopóki kod z LLM działa z uprawnieniami do twojego katalogu domowego, nawet najlepszy Auto Mode jest tylko teatrem bezpieczeństwa, który dodatkowo może zablokować gaśnicę podczas pożaru.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗