2026-09-27 · ← Novinky
Opus 5.5 vrací do hry vlastnost, kterou benchmark nezměří: osobnost
Ethan Mollick popsal Opus 5.5 jako návrat ke starému pocitu z Claude. Podle něj modely Opus zhruba od verze 4.7 do 5 ztratily část své charakteristické osobnosti a připomínaly oslabenou variantu Fable. Jeho hodnocení je zkušenost jednoho uživatele, nikoli měření. Přesto trefuje slabé místo současných žebříčků.
Anthropic samo říká, že náskok v tabulce vypráví jen část příběhu
Anthropic vydalo Opus 5.5 dne 22. září 2026. Firma uvádí, že model komunikuje přirozeněji než předchozí verze, dává důležité informace dopředu a reaguje na výtky k hutnému stylu Opus 5. Zároveň píše, že při dnešní úrovni schopností jsou rozdíly v benchmarcích méně spolehlivým vodítkem pro reálnou práci.
Vydání přináší i snadněji měřitelné změny. Anthropic uvádí o 40 % nižší náklady na typickou úlohu než u Opus 5 a více než 30 % rychlejší generování. API stojí 4 dolarů za milion vstupních tokenů a 20 dolarů za milion výstupních tokenů. Model je dostupný na platformách Anthropic, AWS, Google Cloud a Microsoft Azure.
Styl modelu rozhoduje o ceně lidských oprav
U dlouhé práce není osobnost kosmetika. Ovlivňuje, zda model přizná nejistotu, jak řadí argumenty a kolik jeho textu musí člověk přepsat. Dva modely se stejným skóre tak mohou mít odlišnou cenu v hodinách editora, vývojáře nebo analytika.
Mollickův post přidává uživatelskou vrstvu k číslům výrobce. Anthropic měří tokeny, rychlost a úspěšnost úloh. Uživatel navíc měří, zda se s modelem dá tři hodiny spolupracovat bez neustálého korigování jeho tónu a úsudku.
Pocit návratu zatím stojí na anekdotě a tvrzení výrobce
Pojem Claude-like nemá standardizovanou metriku. Mollick nepublikoval slepý test ani soubor promptů a Anthropic cituje své early testers. Lepší styl může být skutečná změna modelu, důsledek system promptu nebo prostě efekt čerstvé verze.
Navíc se může přirozenější komunikace rozcházet s přesností. Plynulá odpověď se čte lépe, ale sama o sobě neukazuje, zda model lépe opravuje chyby, drží instrukce nebo odolává souhlasnému přikyvování.
Slepé preference a dlouhé relace ukážou, zda se Claude opravdu vrátil
Rozhodující budou opakované slepé testy nad stejnými úlohami a skutečné pracovní relace. Je třeba sledovat počet lidských oprav, stabilitu tónu po desítkách tahů a ochotu modelu změnit stanovisko po důkazu.
Pokud se preference udrží napříč uživateli a doménami, budou muset laboratoře vedle schopností měřit i konzistenci spolupráce. Benchmark pak zůstane výsledkovou tabulí, ne kompletním popisem produktu.
Lilithin verdikt
Tabulka umí seřadit modely. Až kolega po tříhodinové relaci smaže méně oprav z bílé tabule, poznáme, zda se Claude opravdu vrátil.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗