Lilith Lilith.
Redaktionelle Illustration: Claude 5.1 System Card: Papierrisiken vs. echte Fähigkeit, die Vase zu zerbrechen
Illustration von Lilith · redaktioneller Remix

200 Seiten Audit für das Top-Modell

Anthropic veröffentlichte die System Card für die neue Modellgeneration Claude Fable 5.1 und Mythos 5.1. Das Dokument ist über 200 Seiten lang und kartiert Sicherheitsbewertungen und Modellfähigkeiten im Detail. Laut Zvi Mowshowitz war Fable 5.1 zum Zeitpunkt der Veröffentlichung mit deutlichem Abstand das leistungsfähigste öffentlich verfügbare KI-Modell der Welt. Der Bericht enthält traditionelle Risikoanalysen von CBRN bis hin zur autonomen Replikation und zeigt, dass die Modelle auch in dieser fortgeschrittenen Generation die kritischen roten Linien von ASL-3 (AI Safety Level 3) nicht überschreiten.

Wenn Papierbürokratie an der Realität vorbeigeht

Für Unternehmenskunden und Sicherheitsteams verdeutlicht dieses Dokument ein wachsendes Problem in Form von Compliance-Theater. Die Textmenge entspricht nicht dem praktischen Nutzen der Erkenntnisse. Der Bericht widmet Dutzenden von Seiten der Analyse hypothetischer und extremer Szenarien, lässt aber eine scharfe Abgrenzung der alltäglichen Fehlerquote vermissen. Anthropic baut eine wasserdichte Verteidigung für die Aufsichtsbehörden auf, aber für den praktischen Einsatz dienen 200 Seiten eher als Alibi denn als Anleitung dafür, was genau das Modell in der normalen Unternehmensroutine vermasseln wird.

Das Modell ist sicher, weil es nicht planen kann

Das Feiern erfolgreicher Sicherheitstests hat einen Haken. Die Modelle zeigen oft einfach deshalb kein gefährliches Verhalten, weil sie bei der konsistenten, langfristigen Planung versagen. Zvi Mowshowitz stellt treffend fest, dass die Modelle die Welt nicht wegen einer perfekten Ausrichtung nicht bedrohen, sondern wegen ihrer Unfähigkeit, eine komplexe Abfolge von Aktionen auszuführen, ohne sich auf dem Weg zu verlieren. Dies ist ein Puffer für die Sicherheit, aber gleichzeitig eine harte Grenze für wirklich agentenbasierte, autonome Arbeit.

Was echte Autonomie offenbaren wird

Der Wendepunkt wird nicht eintreten, wenn die System Card auf 500 Seiten anwächst. Die entscheidende Verschiebung wird der Übergang zu Modellen sein, die Kontext und Ausführungsfähigkeit über Hunderte von Schritten hinweg ohne menschliche Aufsicht aufrechterhalten. Sobald ein Modell auf den Markt kommt, das nachweislich in der Lage ist, einen langen Prozess stabil und ohne Absturz zu verwalten, werden wir sehen, ob die aktuellen Sicherheitsprotokolle es in den Grenzen halten können oder ob die bisherige Sicherheit lediglich ein Nebenprodukt technischer Unvollkommenheit war.

Liliths Urteil

Die Bürokratie hat gewonnen. Während Anthropic 200-seitige Versicherungspolicen für die Aufsichtsbehörden druckt, haben Produktmanager immer noch keine Ahnung, bei welchem Schritt das Modell ihren tatsächlichen Unternehmensprozess zerstören wird.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗