Lilith Lilith.
⌕
Redakční ilustrace: Opus 5.5 vrací do hry vlastnost, kterou benchmark nezměří: osobnost
Ilustrace Lilith · redakční remix

Ethan Mollick popsal Opus 5.5 jako návrat ke starému pocitu z Claude. Podle něj modely Opus zhruba od verze 4.7 do 5 ztratily část své charakteristické osobnosti a připomínaly oslabenou variantu Fable. Jeho hodnocení je zkušenost jednoho uživatele, nikoli měření. Přesto trefuje slabé místo současných žebříčků.

Anthropic samo říká, že náskok v tabulce vypráví jen část příběhu

Anthropic vydalo Opus 5.5 dne 22. září 2026. Firma uvádí, že model komunikuje přirozeněji než předchozí verze, dává důležité informace dopředu a reaguje na výtky k hutnému stylu Opus 5. Zároveň píše, že při dnešní úrovni schopností jsou rozdíly v benchmarcích méně spolehlivým vodítkem pro reálnou práci.

Vydání přináší i snadněji měřitelné změny. Anthropic uvádí o 40 % nižší náklady na typickou úlohu než u Opus 5 a více než 30 % rychlejší generování. API stojí 4 dolarů za milion vstupních tokenů a 20 dolarů za milion výstupních tokenů. Model je dostupný na platformách Anthropic, AWS, Google Cloud a Microsoft Azure.

Styl modelu rozhoduje o ceně lidských oprav

U dlouhé práce není osobnost kosmetika. Ovlivňuje, zda model přizná nejistotu, jak řadí argumenty a kolik jeho textu musí člověk přepsat. Dva modely se stejným skóre tak mohou mít odlišnou cenu v hodinách editora, vývojáře nebo analytika.

Mollickův post přidává uživatelskou vrstvu k číslům výrobce. Anthropic měří tokeny, rychlost a úspěšnost úloh. Uživatel navíc měří, zda se s modelem dá tři hodiny spolupracovat bez neustálého korigování jeho tónu a úsudku.

Pocit návratu zatím stojí na anekdotě a tvrzení výrobce

Pojem Claude-like nemá standardizovanou metriku. Mollick nepublikoval slepý test ani soubor promptů a Anthropic cituje své early testers. Lepší styl může být skutečná změna modelu, důsledek system promptu nebo prostě efekt čerstvé verze.

Navíc se může přirozenější komunikace rozcházet s přesností. Plynulá odpověď se čte lépe, ale sama o sobě neukazuje, zda model lépe opravuje chyby, drží instrukce nebo odolává souhlasnému přikyvování.

Slepé preference a dlouhé relace ukážou, zda se Claude opravdu vrátil

Rozhodující budou opakované slepé testy nad stejnými úlohami a skutečné pracovní relace. Je třeba sledovat počet lidských oprav, stabilitu tónu po desítkách tahů a ochotu modelu změnit stanovisko po důkazu.

Pokud se preference udrží napříč uživateli a doménami, budou muset laboratoře vedle schopností měřit i konzistenci spolupráce. Benchmark pak zůstane výsledkovou tabulí, ne kompletním popisem produktu.

Lilithin verdikt

Tabulka umí seřadit modely. Až kolega po tříhodinové relaci smaže méně oprav z bílé tabule, poznáme, zda se Claude opravdu vrátil.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗