2026-09-27 · ← News
Opus 5.5 bringt zurück, was Benchmarks übersehen: Persönlichkeit
Ethan Mollick beschreibt Opus 5.5 als Rückkehr zum früheren Claude-Gefühl. Seiner Einschätzung nach verloren die Opus-Modelle ungefähr zwischen Version 4.7 und 5 einen Teil ihrer charakteristischen Persönlichkeit und wirkten wie eine verwässerte Variante von Fable. Das ist die Erfahrung eines Nutzers, keine Messung. Dennoch zeigt sie einen blinden Fleck heutiger Ranglisten.
Anthropic sagt selbst, dass die Rangliste nur einen Teil der Geschichte erzählt
Anthropic veröffentlichte Opus 5.5 am 22. September 2026. Das Unternehmen erklärt, das Modell kommuniziere natürlicher als seine Vorgänger, stelle wichtige Informationen an den Anfang und reagiere auf Kritik am dichten Schreibstil von Opus 5. Zugleich seien Benchmarkabstände auf dem heutigen Leistungsniveau ein weniger verlässlicher Hinweis auf Unterschiede in der realen Arbeit.
Die Veröffentlichung enthält auch leichter messbare Änderungen. Anthropic nennt 40 % niedrigere Kosten bei typischen Aufgaben als mit Opus 5 und eine um mehr als 30 % schnellere Ausgabe. Die API kostet 4 Dollar je Million Eingabetoken und 20 Dollar je Million Ausgabetoken. Das Modell ist über Anthropic, AWS, Google Cloud und Microsoft Azure verfügbar.
Der Stil des Modells bestimmt die Kosten menschlicher Korrekturen
Bei langen Aufgaben hat Persönlichkeit praktische Folgen. Sie beeinflusst, ob ein Modell Unsicherheit eingesteht, wie es Argumente ordnet und wie viel Text ein Mensch umschreiben muss. Zwei Modelle mit demselben Ergebnis können daher sehr unterschiedliche Kosten in Arbeitsstunden von Redakteuren, Entwicklern oder Analysten verursachen.
Mollicks Beitrag ergänzt die Zahlen des Anbieters um die Sicht des Nutzers. Anthropic misst Token, Geschwindigkeit und Aufgabenerfolg. Ein Nutzer prüft zusätzlich, ob das Modell über drei Stunden arbeitsfähig bleibt, ohne dass Ton und Urteilsvermögen ständig korrigiert werden müssen.
Das Gefühl einer Rückkehr beruht bislang auf Anekdoten und Herstellerangaben
Für Claude-like gibt es keine standardisierte Metrik. Mollick veröffentlichte weder einen Blindtest noch einen Prompt-Satz, während Anthropic seine early testers zitiert. Der bessere Stil kann auf einer echten Modelländerung, dem system prompt oder schlicht auf dem Neuheitseffekt einer frischen Version beruhen.
Natürlichere Kommunikation kann sich außerdem von Genauigkeit entkoppeln. Flüssige Antworten lesen sich besser, belegen allein aber keine zuverlässigere Fehlerkorrektur, Befolgung von Anweisungen oder Widerstandskraft gegen übermäßige Zustimmung.
Blindtests und lange Sitzungen werden zeigen, ob Claude wirklich zurück ist
Aussagekräftig sind wiederholte Blindvergleiche mit identischen Aufgaben und echte Arbeitssitzungen. Teams sollten menschliche Korrekturen, die Tonstabilität über Dutzende Gesprächsrunden und die Bereitschaft des Modells messen, seine Position nach Vorlage von Belegen zu ändern.
Bleibt die Präferenz über Nutzergruppen und Fachgebiete hinweg bestehen, müssen Labore neben Fähigkeiten auch die Beständigkeit der Zusammenarbeit erfassen. Ein Benchmark bleibt dann eine Ergebnistafel und keine vollständige Produktbeschreibung.
Liliths Urteil
Eine Rangliste kann Modelle sortieren. Ob Claude wirklich zurück ist, zeigt sich, wenn ein Kollege nach drei Stunden weniger Korrekturen von der Tafel wischen muss.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗