2026-08-25 · ← Aktualności
4-bitowy model, ktory zapomnial o swoim gorszym stanie i gra w wyzszej lidze
Oryginalna architektura jako jedyne kryterium sukcesu
Standardowa procedura zmniejszania modeli LLM (redukcja architektury, a nastepnie kwantyzacja) zazwyczaj pociaga za soba ogromna cene w postaci utraty zdolnosci takich jak rozumowanie i kodowanie. Dlatego modele sa leczone za pomoca Quantization-Aware Training (QAT). Jednak Hugging Face i Multiverse Computing wprowadzaja Quantization-Aware Healing (QAH), w ktorym 60-miliardowy model MXFP4 destyluje wiedze bezposrednio od oryginalnego, duzego 120-miliardowego nauczyciela, a nie od okrojonej wersji.
Kto zyska mniejsze wymagania bez kompromisow
Nowe 4-bitowe modele wymagaja 4-krotnie mniej pamieci i o polowe mniejszej mocy obliczeniowej, a mimo to model QAH pokonuje wlasna, pelna 16-bitowa (bfloat16) wersje w 7 z 9 testow. Zamiast uczenia sie kwantyzowanego modelu z bledami (jak to robi QAT oparty na cross-entropy), dzieki dywergencji KL chwyta on wiedze z precyzyjnych logitow. To znacznie odciazy zespoly, ktore musza wdrazac mniejsze, tansze, lokalnie dzialajace agenty.
Kiedy destylacja zaczyna kulec w ekstremalnych testach
Ale nie brakuje tu weryfikacji. W scenariuszach z ekstremalnie dlugim kontekstem (jak benchmark AA-LCR), 4-bitowy model QAH nadal ustepuje gigantycznemu 120-miliardowemu nauczycielowi, poniewaz samej pojemnosci architektonicznej nie da sie zastapic. Nalezy rowniez pamietac, ze na razie jest to tylko publikacja naukowa i demo; rzeczywista adopcja poza modelami Hugging Face wyjdzie z czasem.
Szybkosc i stabilnosc zadecyduja
QAH osiaga swoj szczyt okolo 7 razy szybciej (w 100 krokach) niz konkurencyjny QAT i, co najwazniejsze, nie zalamuje sie. Podczas gdy model QAT gwaltownie traci jakosc po 1200 krokach, QAH pozostaje stabilny. Kluczowym sygnalem do obserwacji bedzie to, czy inne firmy tworzace mniejsze modele zacza adoptowac to obejscie 'zdegradowanego posrednika'.
Werdykt Lilith
Pomijajac faze zlej kompresji, otrzymujesz agenta, ktory nie musi radzic sobie z niepotrzebnymi halucynacjami. To daje lokalnym zespolom pelna kontrole nad modelem, ktory wczesniej dzialal tylko w chmurze.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗