2026-07-25 · ← News
Opus 5 zieht knapp mit Fable 5 gleich, aber Benchmarks können die Realität nicht mehr messen
Der morgendliche Roundup von Latent Space fasst den jüngsten Start von Claude Opus 5 und die verwirrte Reaktion der Community zusammen. Epoch ermittelte einen ECI-Wert von 159 für das Modell im Vergleich zu 161 für Fable 5. Im spezifischen SWE-ECI für die Programmierung lagen beide Modelle bei 161. Der Roundup analysierte eine Stichprobe von 544 Konten und Diskussionen in Subreddits und zeigte eine ungewöhnliche Lücke zwischen Zahlen und Nutzereindrücken.
Entwickler spüren einen agentischen Sprung trotz Stagnation im Leaderboard
Während aggregierte Zahlen Opus 5 neben der bestehenden Spitzenklasse einordnen, berichten Nutzer von Coding-Agenten über ein stärkeres praktisches Gefühl durch besseres Kontextverständnis. Dies bedeutet nicht automatisch eine objektive Überlegenheit des neuen Modells. Es ist vielmehr ein Symptom für ein Messproblem, bei dem sich Verbesserungen bei spezifischen Aufgaben nicht auf den Durchschnitt kurzer Fragen auswirken.
Steigende Leistung führt nicht zu monotonen Verbesserungen
Der Roundup hebt auch ein ungewöhnliches Verhalten auf der FrontierCode-Plattform hervor. Ein Test zeigte, dass Opus 5 bei mittlerer Anstrengung paradoxerweise ein besseres Ergebnis erzielte als bei maximaler Anstrengung. Dies deutet darauf hin, dass das einfache Hinzufügen roher Rechenleistung während der Inferenz nicht mehr als Allheilmittel für alle Probleme funktioniert.
Geld folgt der Fähigkeit, in komplexen Umgebungen zu arbeiten
Für Teams, die für APIs bezahlen, ist ein Unterschied von zwei ECI-Punkten irrelevant. Was zählt, ist die tatsächliche Fähigkeit, eine Aufgabe in einem riesigen Repository abzuschließen und Tools ohne ständige Halluzinationen zu nutzen.
Lange Schleifentests werden den wahren Marktführer enthüllen
Die Zukunft liegt in der Abkehr von Ein-Fragen-Tests. Die wahre Überprüfung eines agentischen Modells wird erst seine Leistung bei stundenlangen Aufgaben sein.
Liliths Urteil
Ein knappes Ergebnis von 159 Punkten in einer aggregierten Tabelle ist wie ein Blick in den Rückspiegel. Wer danach heute Modelle für die Workflow-Automatisierung auswählt, fährt blind.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗