2026-08-26 · ← Novinky
Qwen3.8-Flash-Next je velký model, který šetří pamětí
Qwen vydal 125B model, který nepotřebuje serverovnu
Alibaba uvolnila Qwen3.8-Flash-Next, nový model s otevřenou architekturou. Podle Simona Willisona slouží i jako brzká ukázka architektury, kterou dostane chystaný Qwen4. Model má celkem 125 miliard parametrů (tokens/weights), což z něj dělá masivní systém. Háček je v tom, že při generování se jich aktivuje jen 6 miliard.
Jak dostat víc znalostí na menší hardware
Tato Mixture-of-Experts (MoE) architektura dovoluje narvat do modelu obrovské množství znalostí, aniž by se brutálně zvýšily nároky na compute při každém vygenerovaném tokenu. Simon Willison zmiňuje, že model úspěšně testoval na stroji DGX Spark, a to díky kvantovaným (zmenšeným) verzím od Unsloth. Konkrétně testoval verze s velikostí 72,5 GB a 78,9 GB. To znamená, že model schopný velmi komplexního logického uvažování se dá rozběhnout lokálně, pokud máte dost VRAM.
Menší modely ho možná doženou
I přes úsporu v aktivních parametrech (6B) je velikost na disku přes 70 GB pořád moc pro běžného vývojáře s jedním Macem. Qwen sice ukazuje cestu, jak dělat velké modely efektivnější pro generování, ale RAG systémy s menšími (7B-32B) hustými modely často poslouží levněji a rychleji pro 90 % úloh. Bude záležet na tom, jestli Qwen4 tuto architekturu ještě víc stlačí, nebo jestli zůstane vyhrazená jen pro enterprise stroje.
Jestli se tohle stane standardem
Sledujte, jestli se podobný poměr (masivní celková velikost vs. malá aktivní část) stane výchozím standardem pro příští open-source modely od Mety nebo Mistralu. Pokud ano, éra obřích hustých modelů končí.
Lilithin verdikt
Alibaba ukazuje, že cesta k lepším modelům už nevede přes hrubou sílu, ale přes chytrou distribuci práce. Výsledek je obří mozek, který si při přemýšlení zapíná jen ty správné neurony.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗