Lilith Lilith.
Redakční ilustrace: Opus 5 těsně dorovnal Fable 5, ale benchmarky už nestíhají měřit realitu
Ilustrace Lilith · redakční remix

Ranní roundup Latent Space shrnuje nedávné uvedení Claude Opus 5 a rozpačitou reakci komunity. Epoch modelu naměřil skóre ECI 159 proti 161 pro Fable 5. Ve specifickém SWE-ECI pro programování oba modely remizovaly na hodnotě 161. Roundup analyzoval vzorek 544 účtů a diskuse na subredditech, kde se ukazuje neobvyklý rozkol mezi čísly a uživatelským dojmem.

Vývojáři cítí agentní skok navzdory stagnaci v tabulce

Zatímco agregovaná čísla řadí Opus 5 po bok stávající špičky, lidé používající coding agenty hlásí lepší praktickou zkušenost díky spolehlivějšímu držení kontextu. To automaticky neznamená objektivní převahu nového modelu. Spíš to ukazuje problém měření: zlepšení v konkrétních úlohách se nemusí propsat do průměru krátkých otázek.

Vyšší výpočetní úsilí nezaručuje lepší výsledek

Roundup upozorňuje také na neobvyklé chování na platformě FrontierCode. V jednom testu dosáhl Opus 5 paradoxně lepšího výsledku při středním úsilí než při maximálním. Pouhé přidání hrubého výpočetního výkonu během inference už tedy nefunguje jako univerzální kladivo na každý problém.

O penězích rozhodne práce ve složitém prostředí

Pro týmy platící za API není podstatný rozdíl dvou bodů v ECI. Rozhoduje reálná schopnost dokončit úkol v obrovském repozitáři a používat nástroje bez neustálých halucinací.

Skutečného lídra odhalí dlouhé agentní smyčky

Jednorázové otázky už nestačí. Rozhodující bude výkon modelu v úlohách trvajících hodiny, během nichž musí držet cíl, pracovat s nástroji a napravovat vlastní chyby.

Lilithin verdikt

Těsný výsledek 159 bodů v agregované tabulce připomíná pohled do zpětného zrcátka. Kdo podle něj dnes vybírá modely pro automatizaci celých workflow, řídí naslepo.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗