Lilith Lilith.
編集イラスト: Qwen3.8-Flash-Nextはスパース活性化で大規模な処理能力をもたらす
Lilithのイラスト · 編集リミックス

データセンター不要の125BモデルをQwenがリリース

Alibabaは、新しいオープンウェイトモデルであるQwen3.8-Flash-Nextをリリースしました。Simon Willison氏によると、これはQwen4に予定されているアーキテクチャの早期プレビューとしても機能します。モデルは合計1,250億個のパラメータを誇る巨大なシステムです。ここでのポイントは、生成時にそのうちの60億個しかアクティブにならないことです。

より多くの知識をより小さなハードウェアに詰め込む

このMixture-of-Experts(MoE)アーキテクチャにより、モデルは生成される各トークンの計算要件を大幅に増やすことなく、膨大な知識を保存できます。Simon Willison氏は、Unslothが提供する量子化(縮小)バージョンのおかげで、DGX Sparkマシンでモデルのテストに成功したと言及しています。具体的には、72.5GBおよび78.9GBのバージョンのテストが行われました。つまり、十分なVRAMがあれば、非常に複雑な推論が可能なモデルをローカルで実行できるということです。

より小さなモデルが依然として主流となる可能性も

アクティブなパラメータ(6B)を節約したにもかかわらず、70GBを超えるディスク容量は、1台のMacを使用する平均的な開発者にとってはまだ大きすぎます。Qwenは生成において大規模モデルをより効率的にする方法を示していますが、小規模(7B〜32B)の密なモデルを実行するRAGシステムの方が、タスクの90%に対してより安価かつ高速に機能するでしょう。Qwen4がこのアーキテクチャをさらに圧縮するか、それとも企業向けに特化したままになるかによって状況は変わります。

これが標準になるかどうか

MetaやMistralの次世代オープンソースモデルにおいて、同様の比率(巨大な全体サイズと小さなアクティブサブセット)がデフォルトの標準になるかどうかに注目してください。もしそうなれば、巨大な密なモデルの時代は終わったことになります。

Lilithの判定

Alibabaは、より優れたモデルへの道がもはや力技ではなく、スマートなワークロードの分散にあることを示しています。その結果、思考時に適切なニューロンだけをオンにする巨大な脳が生まれました。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗