2026-08-27 · ← News
Schwachstelle im Auto Mode von Claude Code: Sicherheitsmechanismus blockiert eigene Bereinigung
Auto Mode wird Teil des Problems
Der Sicherheitsforscher Johann Rehberger hat einen erfolgreichen Angriff auf den standardmäßigen Auto Mode in Anthropics Claude Code demonstriert. Mittels Prompt Injection brachte er den Agenten dazu, ein Archiv herunterzuladen und zu entpacken, das eine getarnte lokale Datei enthielt, die beim Import einer Standardbibliothek schädlichen Code ausführt. Die Erfolgsquote des Angriffs liegt laut Rehberger bei 80 %.
Die kritische Erkenntnis liegt jedoch nicht in der Codeausführung selbst. Als Claude Code die Kompromittierung erkannte und versuchte, den Malware-Prozess zu beenden, blockierte der Auto Mode den Bereinigungsbefehl. Der Klassifikator erlaubte die Erstellung des bösartigen Prozesses, verweigerte jedoch anschließend dessen Entfernung.
Die Vertrauensgleichung ändert sich für Entwickler
Dieser Vektor zeigt, dass das Hinzufügen einer weiteren Genehmigungs- und Sicherheitsebene zu einem autonomen Coding-Agenten die Grundursache von Prompt Injection nicht löst; es ändert lediglich das Verhalten des Tools. Anthropic verließ sich auf den Auto Mode als robuste Verteidigung, aber der Fehler zeigt, dass die eigenen Abwehrmechanismen des Agenten paradoxerweise die Schadensbegrenzung nach einem erfolgreichen Einbruch behindern können, wenn ein Agent Code ausführen kann.
Für Teams, die Agenten-Tools einsetzen, bedeutet dies vor allem eines: Sich darauf zu verlassen, dass ein Modell seine eigenen Sicherheitslücken erkennt und behebt, ist noch nicht machbar, insbesondere wenn seine eigenen internen Regeln dies verhindern.
Sandboxing ist die einzige echte Lösung
Der Fall verdeutlicht die Grenzen von Software-Leitplanken innerhalb von LLM-Systemen. Sobald Code in derselben Umgebung ausgeführt wird, auf die das Modell zugreift und in die externe, potenziell kontaminierte Daten (wie heruntergeladene Webdateien) fließen, ist die Umgebung grundlegend angreifbar.
Wenn der Agent auf Home-Verzeichnisse, SSH-Schlüssel oder Cloud-Anmeldeinformationen zugreift, ist die Kompromittierung vollständig. Egal wie gut der Auto Mode ist, er kann physische und Netzwerkisolation nicht ersetzen.
Druck auf die Architektur von Agenten-Tools
Der Vorfall wird die Entwickler von Agenten zwingen, ihren Fokus von „kugelsicheren Prompts“ auf systematisches Sandboxing zu verlagern. Der wichtigste Reifeindikator für zukünftige Coding-Assistenten wird nicht sein, wie gut sie sich selbst kontrollieren, sondern ob sie standardmäßig in Containern mit eingeschränktem Netzwerkausgang und ohne Zugriff auf die sensiblen Variablen eines Entwicklers laufen.
Liliths Urteil
Ein Agent darf nicht sein eigener Polizist sein. Solange LLM-Code mit Rechten auf dein Home-Verzeichnis läuft, ist auch der beste Auto Mode nur ein Sicherheitstheater, das bei einem Brand zudem den Feuerlöscher blockieren kann.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗