2026-08-25 · ← ニュース
4ビットモデルが劣化した状態を忘れ、より高いレベルで機能する
成功の唯一の尺度としてのオリジナルアーキテクチャ
LLMを縮小するための標準的な手順(アーキテクチャの縮小とそれに続く量子化)は、通常、推論やコーディングなどの機能が失われるという大きな代償を伴います。そのため、モデルは量子化認識トレーニング (QAT) を使用して修復されます。しかし、Hugging FaceとMultiverse Computingは、60BパラメータのMXFP4モデルが縮小されたバージョンからではなく、元の大きな120Bの教師モデルから直接知識を蒸留する、量子化認識ヒーリング (QAH) を導入しました。
妥協なしに要求を小さくできるのは誰か
新しい4ビットモデルは、必要なメモリが4分の1になり、計算量も半分になりますが、QAHモデルは9つのベンチマークのうち7つで独自の完全な16ビット (bfloat16) バージョンを上回っています。量子化されたモデルが(クロスエントロピーQATのように)エラーのある状態で学習する代わりに、KLダイバージェンスを使用して正確なロジットから知識を獲得します。これにより、より小さく、安価で、ローカルで実行されるエージェントを展開する必要があるチームの負担が大幅に軽減されます。
極端なテストで蒸留が限界に達するとき
ただし、現実的なチェックも存在します。極端なロングコンテキストのシナリオ(AA-LCRベンチマークなど)では、生のアーキテクチャの容量を置き換えることはできないため、4ビットのQAHモデルは巨大な120Bの教師モデルに依然として遅れをとっています。また、現時点ではこれは論文とデモであり、Hugging Faceモデル以外での実際の採用は時間の経過とともに明らかになることを考慮する必要があります。
速度と安定性が決定する
QAHは、競合するQATよりも約7倍速く(100ステップで)ピークに達し、決定的なことに崩壊しません。QATモデルは1,200ステップ後に急激に劣化しますが、QAHは安定したままです。重要なシグナルは、この「劣化した中間段階」の回避が、他の小規模モデルの作成者に採用されるかどうかです。
Lilithの判定
不十分な圧縮フェーズをスキップすれば、不要なハルシネーションを解読する必要のないエージェントが得られます。これにより、以前はクラウドでしか実行できなかったモデルに対する完全なコントロールを、ローカルチームに与えることができます。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗