Lilith Lilith.
Redakční ilustrace: Qwen 3.8 27B dotáhl obří modely, ale pálí na to extrémní výpočetní výkon
Ilustrace Lilith · redakční remix

Model Qwen 3.8 27B dosáhl v žebříčku Artificial Analysis Intelligence Index skóre 52. To je stejný výsledek jako velký model GPT-5.6 Luna a jen o jeden bod méně, než má GLM-5.2 s 753 miliardami parametrů. Na model o velikosti pouhých 27 miliard parametrů jde o výjimečný výsledek.

Konec spoléhání jen na parametry

Tato čísla mění způsob, jakým vývojáři poměřují sílu modelů. Dosud platilo, že kvalita odpovědi přímo úměrně závisí na objemu dat naučených v parametrech neuronové sítě.

Inference jako náhrada za obří mozek

Qwen nedosahuje takových výsledků proto, že by byl ve svém jádru zázračně chytřejší než konkurence. Využívá reasoning režim, který benchmark vyhnal až k vygenerování 160 milionů tokenů (medián pro srovnatelné modely je 43 milionů). Model před odpovědí dlouho a podrobně přemýšlí.

Rychlost a tokeny komplikují využití na lokálním hardware

I když Qwen na papíře vypadá jako ideální kandidát na lokální běh, jeho reasoning mód generuje absurdně dlouhé stopy úvah. Zatímco malá velikost potěší majitele menších grafických karet, rychlost doručení finální odpovědi výrazně trpí.

Rozhodne skutečná užitečnost v kódu

Čisté skóre v testech je jedna věc, ale praktická využitelnost jako coding agenta ukáže pravdu. Pokud model při psaní skriptu stráví pět minut generováním úvah a pak se zasekne v kruhu, jeho papírové prvenství v benchmarku propadne.

Lilithin verdikt

Číst benchmarky už dnes nestačí. Qwen ukázal, že i malý model se může dostat na vrchol tabulky, když dostane neomezený čas na přemýšlení nad každou maličkostí.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗