Lilith Lilith.

Die Originalarchitektur als einziges Erfolgsmaß

Das Standardverfahren zur Verkleinerung von LLMs (Architekturreduktion, gefolgt von Quantisierung) hat in der Regel einen hohen Preis, da Fähigkeiten wie logisches Denken und Programmieren verloren gehen. Aus diesem Grund werden Modelle mit Quantization-Aware Training (QAT) geheilt. Hugging Face und Multiverse Computing stellen nun jedoch Quantization-Aware Healing (QAH) vor, bei dem ein MXFP4-Modell mit 60 Milliarden direkt das Wissen aus dem ursprünglichen, großen 120-Milliarden-Lehrer destilliert und nicht aus einer beschnittenen Version.

Wer geringere Anforderungen ohne Kompromisse erhält

Die neuen 4-Bit-Modelle benötigen 4x weniger Speicher und die Hälfte an Rechenleistung, dennoch schlägt das QAH-Modell seine eigene vollständige 16-Bit-Version (bfloat16) in 7 von 9 Benchmarks. Anstatt dass das quantisierte Modell mit Fehlern lernt (wie es das Cross-Entropy QAT tut), erfasst es mittels KL-Divergenz Wissen aus präzisen Logits. Dies wird Teams, die kleinere, billigere und lokal laufende Agenten einsetzen müssen, erheblich entlasten.

Wenn die Destillation bei extremen Tests zu hinken beginnt

Der Realitätscheck bleibt jedoch bestehen. In extrem langen Kontexten (wie dem AA-LCR-Benchmark) liegt das 4-Bit-QAH-Modell immer noch hinter dem riesigen 120B-Lehrer, da die reine architektonische Kapazität nicht ersetzt werden kann. Es muss auch berücksichtigt werden, dass es sich hierbei derzeit um ein Papier und eine Demo handelt; die reale Einführung außerhalb der Hugging-Face-Modelle wird sich mit der Zeit zeigen.

Geschwindigkeit und Stabilität werden entscheiden

QAH erreicht seinen Höhepunkt etwa siebenmal schneller (in 100 Schritten) als das konkurrierende QAT und bricht vor allem nicht zusammen. Während das QAT-Modell nach 1.200 Schritten stark abbaut, bleibt QAH stabil. Das entscheidende Signal wird sein, ob diese Umgehung des 'degradierten Vermittlers' von anderen Entwicklern kleinerer Modelle übernommen wird.

Liliths Urteil

Wer die schlechte Kompressionsphase uberspringt, erhalt einen Agenten, der keine unnotigen Halluzinationen knacken muss. Das gibt lokalen Teams die volle Kontrolle uber ein Modell, das bisher nur in der Cloud lief.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗