Lilith Lilith.
Redakční ilustrace: Lokální model Qwen 3.8 dorazil, ale jeho default až moc přemýšlí
Ilustrace Lilith · redakční remix

Páteční velký release od výzkumné laboratoře Qwen (skupina Alibaba) přinesl multimodální LLM Qwen 3.8 s 27 miliardami parametrů pod otevřenou licencí Apache 2. Laboratoř se chlubí působivými benchmarky, podle kterých model překonává starší verzi 3.6 i dosud nejsilnější zavřený Qwen 3.7-Plus z letošního května.

Ideální váhová kategorie pro lokální stroje

Velikost 27 miliard parametrů představuje kritickou hranici, protože jde o model, který s trochou snahy běží na lepším laptopu bez dedikovaného serveru. Pro vývojáře žádající lokální inferenci bez posílání dat do cloudu se zvedá kvalita výstupu přímo na vlastním železe. V praxi to znamená, že vývojáři mohou psát citlivý kód lokálně s modelem, který byl donedávna dostupný jen v placeném API.

Výchozí nastavení pálí výpočetní výkon zbytečně

První testy ale ukazují jednu slabinu. Podle Simona Willisona má model kvůli výchozímu nastavení parametru „reasoning_effort“ (defaultně nastavenému na xhigh) tendenci divoce přemýšlet i nad zcela banálními věcmi. U 27B modelu, který běží na hraně možností spotřebitelského hardwaru, je tohle chování toxické, protože neužitečné tokeny vysávají baterii a zdržují čekání na výsledek.

V kontextovém okně zabírají místo vnitřní monology

Tato ukecanost má ještě jeden nepříjemný důsledek. Při použití menšího kontextového okna (například běžných 8192 tokenů v LM Studiu) spotřebuje model velkou část paměti jen na svůj vlastní myšlenkový proces. Uživatelům tak zůstává mnohem méně prostoru pro vložení samotného kódu nebo kontextu problému, který reálně potřebují vyřešit.

Rychlost adopce závisí na úpravách promptů

Nezávislé testy a reálná zkušenost v praxi rozhodnou, zda se tento model udrží. Pokud komunita najde spolehlivou cestu, jak model zkrotit (pomocí systémových promptů nebo jemného doladění) a omezit jeho únavnou verbóznost, stane se Qwen 3.8 novým lokálním etalonem. V opačném případě mohou uživatelé s omezeným hardwarem raději volit předchozí, přímočařejší verze.

Lilithin verdikt

Schopnost provozovat ještě na jaře placenou kvalitu lokálně znamená, že korporátní vývojáři mohou konečně psát citlivý kód bez složitých žádostí o výjimky na odesílání dat do cloudu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗