2026-09-22 · ← Aktualności
Opus 5.5 na poziomie max zużył 128 000 tokenów na jednego pelikana
Simon Willison zlecił nowym modelom Claude Opus 5.5, GPT-6 Sol i GPT-6 Luna to samo zadanie: przygotować SVG pelikana jadącego na rowerze. Taki test nie mierzy ogólnej inteligencji. Dobrze pokazuje jednak różnice między poziomami reasoning effort w jednej rodzinie modeli, bo prompt pozostaje niezmienny.
Tydzień premier odsłonił wojnę cenową tuż poniżej absolutnego szczytu
GPT-6 Sol kosztuje w API 2 dolary za milion tokenów wejściowych i 10 dolarów za milion wyjściowych. GPT-6 Luna kosztuje odpowiednio 0,10 i 0,50 dolara. W zestawieniu Willisona oba modele są mniej więcej o połowę tańsze od swoich odpowiedników z rodziny GPT-5.6.
Claude Opus 5.5 potaniał względem Opus 5 o 20 % do 4 dolarów za milion tokenów wejściowych i 20 dolarów za milion wyjściowych. Odczyt cache potaniał o 60 % do 0,20 dolara. Walka cenowa skupia się więc poniżej GPT-6 Astra i Claude Fable 5.1, które nadal kosztują 10 i 50 dolarów.
To samo absurdalne zadanie pokazało zachowanie niewidoczne w tabeli benchmarków
Pelikan Willisona nie jest rankingiem dostawców. Jako powtarzalna sonda ujawnił jednak problem operacyjny: Opus 5.5 przy ustawieniu max rozumował aż do osiągnięcia limitu 128 000 tokenów wyjściowych i nie zwrócił gotowego SVG. Sytuacja powtórzyła się dwa razy. Każda próba kosztowała 2,56 dolara i trwała prawie 20 minut.
Dla twórcy aplikacji to bardziej przydatna informacja niż kolejny ułamek punktu w benchmarku. Jeżeli aplikacja pozwala modelowi swobodnie zwiększać effort, musi jednocześnie ograniczać czas, koszt i liczbę kroków. W przeciwnym razie kupi droższą ciszę.
Jeden pelikan nie przekreśla całego ustawienia max
Test jest celowo dziwny i nie dowodzi, że Opus 5.5 zawodzi przy długich zadaniach programistycznych. Anthropic raportuje lepsze wyniki w agentic coding i niższe koszty typowych workloadów. Nadal są to dane producenta i wczesnych testerów, a nie uniwersalna gwarancja.
Przypadek ujawnia konkretny failure mode: więcej reasoning nie daje automatycznie lepszego wyniku. Bez odpowiedniego stop condition model może zużyć cały budżet na planowanie szczegółu, który nie daje użytkownikowi żadnej wartości.
Logi produkcyjne muszą mierzyć koszt ukończonego zadania
Kolejne porównania powinny śledzić skuteczność, łączną liczbę tokenów, czas i koszt ukończonego zadania dla różnych poziomów effort. Cena za milion tokenów nie mówi, ile agent zużyje przed dostarczeniem odpowiedzi.
Dla zespołów właściwym sygnałem jest odsetek zadań zakończonych w stałym budżecie oraz częstotliwość interwencji człowieka. Model tańszy w cenniku może kosztować więcej w produkcji, jeśli zbyt długo krąży nad jednym pelikanem.
Werdykt Lilith
W cenniku max effort wygląda jak mocniejszy silnik. Bez ogranicznika Opus 5.5 dwa razy spalił 2,56 dolara i prawie 20 minut, zanim pelikan w ogóle wyjechał z garażu.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗