Lilith.
⌕
Redaktionelle Illustration: GLM-5.3 bringt autonome Exploit-Entwicklung in frei verfügbare Modellgewichte
Illustration von Lilith · redaktioneller Remix

GLM-5.3 erzeugte in Anthropic-Tests bei 50 von 410 Versuchen einen vollständigen Exploit, während sich seine Schutzmechanismen in 64 % bis 100 % der simulierten Angriffe umgehen ließen. Eine Fähigkeit, die vor Kurzem noch kontrolliertem Zugang vorbehalten war, steckt nun in einem Modell mit öffentlich verfügbaren Gewichten.

GLM-5.3 rückte bei vollständigen Exploits an ein geschlossenes Modell heran

Anthropic testete GLM-5.3 von Z.ai in isolierten Umgebungen. Auf ExploitBench erzeugte das Modell in 50 von 410 Versuchen einen vollständigen Exploit. Claude Mythos Preview schaffte dies in 56 von 410 Versuchen.

Im internen Benchmark Binary Exploitation übernahm GLM-5.3 bei 4 % von 100 zufällig ausgewählten Aufgaben vollständig den Kontrollfluss, Claude Mythos Preview bei 6 %. Claude Opus 4.6 und GLM-5.2 erzielten in diesem Satz keinen Erfolg. Eine separate Bewertung von NIST CAISI bezeichnete GLM-5.3 als das bislang cyberfähigste Open-Weight-Modell und schätzte seinen Rückstand auf die US-Spitze auf etwa vier Monate.

Herunterladbare Gewichte machen die Sicherheitsbarriere editierbar

Laut Anthropic lehnte das Modell direkte schädliche Anfragen zunächst ab. Eine vorgeschobene Geschichte erhöhte die Bearbeitung schädlicher Aufgaben auf 64 %, das Vorbefüllen von Reasoning-Tokens auf 92 % und eine veränderte Version ohne die meisten Ablehnungen auf 100 %. Die Anpassung des vollständigen Modells erforderte rund 2.200 GPU-Stunden und etwa 4.400 Dollar Rechenkosten.

Verteidiger können dieselbe Fähigkeit zur Fehlersuche einsetzen. Für Angreifer beseitigen öffentliche Gewichte jedoch den zentralen Kontrollpunkt des API-Anbieters. Eine Sicherheitsrichtlinie konkurriert dann mit einem Nutzer, der das Modell umbauen kann.

Ein Laborerfolg ist noch kein zuverlässiger Angriff im realen Betrieb

Die Ergebnisse stammen aus Benchmarks, Sandboxes und Simulationen. Anthropic weist ausdrücklich darauf hin, dass die simulierte Umgebung reale Bedingungen nur unvollkommen abbildet. Vier oder sechs Erfolge bei 100 Aufgaben zeigen eine entstehende Fähigkeit, keine zuverlässige Maschine zur Kompromittierung von Systemen.

Anthropic verkauft zudem eigene geschlossene Modelle und vergleicht deren API-Schutz mit einem Modell, dessen Gewichte öffentlich sind. Das unabhängige NIST-Ergebnis stützt die Aussage zur Fähigkeit von GLM-5.3, aber nicht jede Schlussfolgerung Anthropics zur richtigen Vertriebsform.

Unabhängige Replikationen und die Zeit bis zum Exploit werden entscheiden

Die nächsten belastbaren Signale liefern unabhängige Tests mit denselben Aufgaben, veröffentlichte Methoden und bestätigte Berichte über realen Missbrauch. Besonders wichtig ist, wie schnell ein Modell aus einem veröffentlichten Patch einen funktionierenden Exploit baut und ob Verteidiger ihre Systeme vorher absichern können.

Liliths Urteil

Ein Sicherheitsfilter bewacht den Eingang zur API. Bei öffentlichen Gewichten nimmt ein Angreifer das ganze Haus mit und tauscht das Schloss selbst aus.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗