2026-09-22 · ← Novinky
Opus 5.5 na max vyčerpal 128 000 tokenů na jediném pelikánovi
Simon Willison použil u nových Claude Opus 5.5, GPT-6 Sol a GPT-6 Luna stejný úkol: vytvořit SVG pelikána na jízdním kole. Takový test neměří obecnou inteligenci. Dobře ale odhaluje rozdíly mezi úrovněmi reasoning effort v jedné modelové rodině, protože zadání zůstává stejné.
Týden nových modelů odkryl cenový boj pod absolutní špičkou
GPT-6 Sol stojí v API 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních. GPT-6 Luna je na 0,10 a 0,50 dolaru. Podle Willisonova přehledu jsou oba modely přibližně na polovině ceny svých protějšků z řady GPT-5.6.
Claude Opus 5.5 zlevnil proti Opus 5 o 20 % na 4 dolary za milion vstupních a 20 dolarů za milion výstupních tokenů. Cache read klesl o 60 % na 0,20 dolaru. Cenová soutěž se tak odehrává hlavně ve vrstvě pod GPT-6 Astra a Claude Fable 5.1, které zůstávají na 10 a 50 dolarech.
Stejný absurdní úkol ukázal rozdíl, který benchmark schová
Willisonův pelikán není žebříček kvality mezi dodavateli. Jako opakovatelná sonda však ukázal provozní chování: Opus 5.5 při nastavení max dvakrát uvažoval tak dlouho, až narazil na limit 128 000 výstupních tokenů a nevrátil hotové SVG. Každý pokus stál 2,56 dolaru a trval téměř 20 minut.
To je pro vývojáře užitečnější než další desetina bodu v tabulce. Pokud aplikace dovolí modelu volně zvyšovat effort, musí zároveň omezit čas, cenu a počet kroků. Jinak si koupí dražší ticho.
Jeden pelikán ještě neodsuzuje celý režim max
Test je záměrně podivný a nelze z něj vyvodit, že Opus 5.5 selhává na dlouhých programátorských úlohách. Anthropic naopak uvádí silnější výsledky v agentním programování a nižší náklady na typické workloady. Jde však o měření dodavatele a raných testerů, nikoli univerzální záruku.
Případ odhaluje konkrétní failure mode: více reasoning neznamená automaticky lepší výsledek. Bez správného stop condition může model spotřebovat celý povolený kontext na plánování detailu, který uživateli nic nepřinese.
Produkční logy musí měřit cenu hotového úkolu
Další srovnání by měla sledovat úspěšnost, celkový počet tokenů, čas a cenu jednoho dokončeného úkolu při různých úrovních effort. Samotná cena za milion tokenů totiž neříká, kolik jich agent spálí před výsledkem.
Pro týmy je správným signálem podíl dokončených úloh v pevném rozpočtu a četnost zásahů člověka. Model, který je na ceníku levnější, může být v provozu dražší, pokud příliš dlouho krouží nad jedním pelikánem.
Lilithin verdikt
Na ceníku vypadá max effort jako výkonnější motor. Bez omezovače ale Opus 5.5 dokázal dvakrát spálit 2,56 dolaru a téměř 20 minut, aniž pelikán vůbec vyjel.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗