Lilith.
⌕
Redakční ilustrace: Qwen bez reasoning trefil jen 23,57 % slovních součtů
Ilustrace Lilith · redakční remix

Qwen3.8 27B dostal jednoduché zadání: sečíst dvě kladná celá čísla a výsledek napsat pouze anglickými slovy. Simon Willison spustil kvantizovaný model Qwen3.8-27B-Q4_K_M lokálně na DGX Spark a bez reasoning otestoval 5 070 příkladů. Správně jich bylo 1 195, tedy 23,57 %.

Model zvládl formu, ale ztratil čísla

Formát přitom dodržel v 96,17 % případů. U operandů s jednou až třemi číslicemi dosáhl přesnosti 97,04 %, zatímco u deseti až třinácti číslic spadl na 6,44 %. Výsledek tedy nevypadá jako náhodné ignorování instrukce. Model většinou věděl, jak má odpověď vypadat, ale nezvládl výpočet.

Willison navázal na starší experiment Colina Frasiera s GPT-4o. Tentokrát mohl běh na lokálním hardwaru plně řídit a zveřejnil i mřížku výsledků.

Reasoning změnil výsledek i cenu pokusu

S reasoning nastaveným na střední úroveň vyřešil Qwen správně 167 ze 169 příkladů. Tento běh ale obsahoval jen jeden pokus pro každou dvojici délek operandů, nikoli 30 pokusů jako test bez reasoning, protože jednotlivé odpovědi trvaly výrazně déle. Čísla proto ukazují silný rozdíl, ne čisté srovnání dvou stejně velkých vzorků.

Pro vývojáře evalů je důležitější konstrukce úlohy než samotné pořadí modelů. Součet je snadný ověřit programem, ale zákaz kalkulačky nutí model držet mezivýsledky v generování textu. Test tak odhaluje rozdíl mezi instrukční poslušností a spolehlivým výpočtem, který souhrnný benchmark snadno schová.

Dvě chyby v malém vzorku ještě nejsou spolehlivost

Výsledek 167 z 169 vypadá přesvědčivě, jenže reasoning varianta má proti základnímu běhu třicetkrát méně pokusů na buňku. Sám Willison upozorňuje, že při opakování by chyby nejspíš dopadly jinam. Experiment také neměří latenci ani spotřebu energie, přestože delší doba byla důvodem pro menší vzorek.

Jde o jeden kvantizovaný model na jednom stroji a jednu úzce vymezenou úlohu. Z výsledku nelze vyvozovat obecnou matematickou převahu reasoning režimu ani srovnání s GPT-4o, protože podmínky obou experimentů nebyly stejné.

Opakované běhy ukážou, zda reasoning drží výkon

Další užitečný krok je zopakovat všech 169 kombinací vícekrát, zveřejnit latenci a rozdělit chyby na špatný součet a špatný slovní přepis. Teprve pak půjde určit, zda reasoning stabilně opravuje výpočet, nebo jen výrazně zvyšuje šanci na správnou odpověď.

Pro praktické nasazení zůstává nejbezpečnější předat aritmetiku kalkulačce a model nechat formulovat výsledek. Experiment totiž ukazuje, že uhlazená anglická číslovka může být pořád jen elegantně vyslovená chyba.

Lilithin verdikt

Model bez reasoning přinesl správně nadepsanou krabici, jenže uvnitř byl špatný součet. V produkci proto patří aritmetika kalkulačce, ne jazykovému modelu s přesvědčivou dikcí.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗