2026-09-22 · ← News
Opus 5.5 verbrauchte auf max 128.000 Token für einen einzigen Pelikan
Simon Willison gab Claude Opus 5.5, GPT-6 Sol und GPT-6 Luna dieselbe Aufgabe: ein SVG eines Pelikans auf einem Fahrrad zu erzeugen. Der Test misst keine allgemeine Intelligenz. Er macht aber Unterschiede zwischen reasoning-effort-Stufen innerhalb einer Modellfamilie sichtbar, weil der Prompt gleich bleibt.
Eine Woche voller Modellstarts entfachte den Preiskampf unterhalb der absoluten Spitze
GPT-6 Sol kostet in der API 2 Dollar pro Million Eingabe-Token und 10 Dollar pro Million Ausgabe-Token. GPT-6 Luna liegt bei 0,10 beziehungsweise 0,50 Dollar. In Willisons Vergleich kosten beide ungefähr halb so viel wie ihre Gegenstücke aus der GPT-5.6-Familie.
Claude Opus 5.5 wurde gegenüber Opus 5 um 20 % günstiger und kostet 4 Dollar für Eingabe sowie 20 Dollar für Ausgabe. Cache-Lesezugriffe sanken um 60 % auf 0,20 Dollar. Der Preiskampf konzentriert sich damit auf die Ebene unter GPT-6 Astra und Claude Fable 5.1, die weiterhin bei 10 und 50 Dollar liegen.
Dieselbe absurde Aufgabe zeigte ein Verhalten, das Benchmark-Tabellen verbergen
Willisons Pelikan ist keine Rangliste der Anbieter. Als wiederholbare Sonde zeigte er jedoch ein Betriebsproblem: Opus 5.5 dachte bei max effort bis zum Limit von 128.000 Ausgabe-Token und lieferte kein fertiges SVG. Das geschah zweimal. Jeder Versuch kostete 2,56 Dollar und dauerte fast 20 Minuten.
Für Anwendungsentwickler ist das nützlicher als ein weiterer Bruchteil eines Benchmark-Punkts. Darf ein Modell den effort frei erhöhen, braucht die Anwendung zugleich Grenzen für Zeit, Kosten und Schritte. Sonst kauft sie teureres Schweigen.
Ein Pelikan entwertet nicht die gesamte max-Einstellung
Der Test ist bewusst ungewöhnlich und belegt kein Versagen von Opus 5.5 bei langen Programmieraufgaben. Anthropic meldet bessere Ergebnisse beim agentic coding und geringere Kosten für typische Workloads. Diese Zahlen stammen allerdings vom Anbieter und frühen Testern, nicht aus einer universellen Garantie.
Der Fall zeigt einen konkreten failure mode: Mehr reasoning erzeugt nicht automatisch ein besseres Ergebnis. Ohne passende stop condition kann ein Modell sein gesamtes Budget für die Planung eines Details verbrauchen, das dem Nutzer keinen Wert liefert.
Produktionslogs müssen die Kosten einer erledigten Aufgabe messen
Künftige Vergleiche sollten Erfolgsquote, gesamte Tokenzahl, Dauer und Kosten pro erledigter Aufgabe über verschiedene effort-Stufen erfassen. Der Listenpreis pro Million Token verrät nicht, wie viele ein Agent vor der Antwort verbraucht.
Für Teams zählen der Anteil der Aufgaben innerhalb eines festen Budgets und die Häufigkeit menschlicher Eingriffe. Ein laut Preisliste günstigeres Modell kann im Betrieb teurer sein, wenn es zu lange über einem einzelnen Pelikan kreist.
Liliths Urteil
In der Preisliste wirkt max effort wie ein stärkerer Motor. Ohne Begrenzer verbrannte Opus 5.5 zweimal 2,56 Dollar und fast 20 Minuten, bevor der Pelikan überhaupt aus der Garage kam.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗