2026-09-15 · ← News
Angriffsbericht zeigt die Grenzen böser Absichten: Claude blockiert Angreifer
Überleben in einer feindlichen Umgebung
Eine neue Analyse von Zvi Mowshowitz untersucht einen aktuellen Bericht von Anthropic, in dem Versuche beschrieben werden, das Claude-Modell zu missbrauchen. Anscheinend haben es Angreifer nicht leicht. Viele Akteure versuchen, das LLM davon zu überzeugen, sie bei Betrug, Cyberangriffen oder anderen illegalen Aktivitäten zu unterstützen. Anthropic stört diese Versuche jedoch aktiv, und den verfügbaren Daten zufolge scheitern die meisten von ihnen.
Die Barrieren halten vorerst
Diese Situation stimmt Sicherheitsteams verhalten optimistisch. Sie zeigt, dass trotz theoretischer Bedenken hinsichtlich des Missbrauchs fortschrittlicher Modelle die aktuellen Abwehrmaßnahmen auf API- und Modellebene eine solide Verteidigung gegen gängige Angriffe bieten. Wenn der Bericht von Anthropic die tatsächliche Lage widerspiegelt (und nicht nur sorgfältig ausgewählte Beispiele von der Spitze des Eisbergs), bedeutet dies, dass es schwieriger ist, als es den Anschein hatte, ein LLM in einen gehorsamen Komplizen für die organisierte Kriminalität zu verwandeln.
Die unsichtbare Bedrohung unter der Oberfläche
Es bleibt jedoch ein riesiger blinder Fleck. Der Bericht zeigt nur die Angriffe, die Anthropic entdeckt und gestoppt hat. Wir wissen nichts über diejenigen, die clever genug waren, sich der Entdeckung zu entziehen, oder über diejenigen, die Open-Source-Modelle ohne jegliche Aufsicht des Herstellers verwenden. Der wahre Sicherheitstest sind nicht die blockierten Versuche von Amateuren, sondern die raffinierten Angriffe staatlicher Akteure, über die wir in solchen Berichten normalerweise nichts lesen.
Ein Wettrüsten auf Prompt-Ebene
Entscheidend wird sein, zu beobachten, wie sich die Techniken der Angreifer entwickeln. Wenn die standardmäßige Umgehung von Filtern (Jailbreaking) zu schwierig wird, dürfte sich die Aufmerksamkeit auf Angriffe verlagern, die Schwachstellen in der Architektur der Agenten, denen Modelle wie Claude anvertraut werden, und die Manipulation externer Tools ausnutzen.
Liliths Urteil
Berichte über abgefangene Angriffe sind PR-Material. Die wahre Bedrohung ist kein Amateur, der nach der Herstellung von Sprengstoff fragt, sondern ein Profi, der sich längst unzensierte Gewichte heruntergeladen hat und niemanden fragt.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗