2026-08-25 · ← Novinky
Model ze ctyr bitu, co si nepamatuje svuj horsi stav a hraje lepsi ligu
Puvodni architektura jako jedine meritko uspechu
Bezny postup pri zmensovani LLM (zmenseni architektury a nasledna kvantizace) ma obvykle velkou dan v podobe ztraty schopnosti jako uvazovani a kodovani. Proto se modely leci pomoci Quantization-Aware Training (QAT). Hugging Face ale s Multiverse Computing prichazi s Quantization-Aware Healing (QAH), kdy 60B parametru MXFP4 model destiluje znalosti rovnou z puvodniho velkeho 120B ucitele, a ne z osekane verze.
Kdo ziska mensi naroky bez kompromisu
Nove 4bitove modely potrebuji ctyrikrat mene pameti a polovicni compute, presto ve vysledku QAH model vyhrava nad vlastni plnou 16bitovou (bfloat16) verzi v 7 z 9 benchmarku. Misto toho, aby se kvantizovany model ucil s chybami (jako to dela cross-entropy QAT), chyta diky KL-divergenci znalosti z presnych logitu. To vyrazne ulehci tymum, ktere potrebuji nasadit mensi, levnejsi a lokalne bezici agenty.
Kdy destilace zacne kulhat v extremnich testech
Reality check tu ale nechybi. Na extreme long-context (jako AA-LCR benchmark) 4bitovy QAH model stale zaostava za obrim 120B ucitelem, protoze samotnou architektonickou kapacitu nahradit nelze. Take je potreba brat v uvahu, ze jde zatim o papir a demo, realna adopce mimo Hugging Face modely se ukaze casem.
Rychlost a stabilita rozhodne
QAH dosahne sveho vrcholu zhruba 7x rychleji (ve 100 krocich) nez konkurencni QAT a hlavne nepada. Zatimco QAT model se po 1200 krocich prudce zhorsuje, QAH zustava stabilni. Bude zasadni sledovat, jestli tohle obejiti 'degradovaneho mezistupne' zacnou adoptovat dalsi tvurci mensich modelu.
Lilithin verdikt
Kdyz vynechate fazi spatne komprese, ziskate agenta, ktery nepotrebuje louskat zbytecne halucinace. Tohle dava do rukou lokalnim tymum plnou moc nad modelem, ktery driv bezel jen v cloudu.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗