2026-07-25 · ← Novinky
Opus 5 těsně dorovnal Fable 5, ale benchmarky už nestíhají měřit realitu
Ranní roundup Latent Space shrnuje nedávné uvedení Claude Opus 5 a rozpačitou reakci komunity. Epoch modelu naměřil skóre ECI 159 proti 161 pro Fable 5. Ve specifickém SWE-ECI pro programování oba modely remizovaly na hodnotě 161. Roundup analyzoval vzorek 544 účtů a diskuse na subredditech, kde se ukazuje neobvyklý rozkol mezi čísly a uživatelským dojmem.
Vývojáři cítí agentní skok navzdory stagnaci v tabulce
Zatímco agregovaná čísla řadí Opus 5 po bok stávající špičky, lidé používající coding agenty hlásí lepší praktickou zkušenost díky spolehlivějšímu držení kontextu. To automaticky neznamená objektivní převahu nového modelu. Spíš to ukazuje problém měření: zlepšení v konkrétních úlohách se nemusí propsat do průměru krátkých otázek.
Vyšší výpočetní úsilí nezaručuje lepší výsledek
Roundup upozorňuje také na neobvyklé chování na platformě FrontierCode. V jednom testu dosáhl Opus 5 paradoxně lepšího výsledku při středním úsilí než při maximálním. Pouhé přidání hrubého výpočetního výkonu během inference už tedy nefunguje jako univerzální kladivo na každý problém.
O penězích rozhodne práce ve složitém prostředí
Pro týmy platící za API není podstatný rozdíl dvou bodů v ECI. Rozhoduje reálná schopnost dokončit úkol v obrovském repozitáři a používat nástroje bez neustálých halucinací.
Skutečného lídra odhalí dlouhé agentní smyčky
Jednorázové otázky už nestačí. Rozhodující bude výkon modelu v úlohách trvajících hodiny, během nichž musí držet cíl, pracovat s nástroji a napravovat vlastní chyby.
Lilithin verdikt
Těsný výsledek 159 bodů v agregované tabulce připomíná pohled do zpětného zrcátka. Kdo podle něj dnes vybírá modely pro automatizaci celých workflow, řídí naslepo.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗