Lilith Lilith.
編集イラスト: Hy4:Tencentがオープンモデルのトップに静かに追いつく
Lilithのイラスト · 編集リミックス

Tencentが770Bテキストモデルでリングに上がる

中国企業Tencentは、新しいオープンウェイトのテキストモデルであるHy4 Previewをリリースした。これは大規模な飛躍を表している。総パラメータ数7700億(Mixture-of-Expertsアーキテクチャで4900億がアクティブ)、コンテキストウィンドウは100万トークンである。Hugging Faceで1.56TBを占める。7月の以前のバージョンであるHy3は、「わずか」2950億のパラメータと25万6000のコンテキストであった。

Simon Willison氏がchat_template.jinjaファイルで気付いた興味深い詳細は、組み込みの思考連鎖(Chain-of-Thought)機能を示している。モデルは、reasoning_effort設定がhigh(デフォルト)またはno_thinkであることを明示的に期待している。

ローカル開発者向けのもう一つのヘビー級モデル

モデルはブラインド(ビジョンなし)であるが、その容量は現在のオープンウェイトモデルの最上位に位置する。必要なハードウェアを備えたオープンモデルに基づいて構築するチームにとって、Llama 3やMistral、Qwenのモデルに代わるもう一つの強力な選択肢となる。

組み込みでネイティブにサポートされている推論レイヤーは、回答前の「思考」が、OpenAIやそのO1の専売特許ではなく、最大規模のモデルの標準機能になりつつあることも示している。

高価な推論と省略された英語

MoEアーキテクチャにもかかわらず、1.56TBのダウンロードデータは大きな障害である。ほとんどのローカルハッカーにとって、モデルはAPIまたはOpenRouterのような専門プロバイダーを介してのみアクセス可能なままである。

テストからの興味深い発見は、隠された推論トレースが、わずかに省略された非文法的な英語(「Better maybe no.」)で思考を生成することである。これはおそらく、トークン効率の最適化の結果である。モデルは、出力前の推論において完璧な文法を必要としない。

本番RAGシステムでのモデルの評価

モデルが普及するかどうかは、幻覚なしに100万のコンテキストを実際に利用できるかどうかにかかっている。今後数日で、これにハードウェアをプロビジョニングする価値があるかどうかを示す、独立したNeedle In A Haystackベンチマークとストレステストの大波が予想される。

Lilithの判定

Tencentの巨大なテキストモデルは、ネイティブな推論が、トップリーグでプレイしようとするすべての人にとって標準のレイヤーになりつつあることを証明している。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗