Lilith Lilith.
編集イラスト: オープンウェイトモデルはクローズドな最先端モデルに対して後れを取っている
Lilithのイラスト · 編集リミックス

コミュニティとラボ間の溝が再び拡大している

ウォートン校のイーサン・モリック教授は、実践的なAIテスターの中で最も熱心な人物の一人ですが、彼は明確な傾向を強調しています。オープンウェイトモデルは、私たちが慣れていた以上に絶対的な最先端モデルに遅れをとっています。新しいオープンなリリースがベンチマークで有望に見えても、日常的な実用面ではClaude 3 OpusやGoogle Gemini Advancedのようなモデルのレベルに単に達していません。昨年までは互角に見えた競争も、今では最大規模のラボの資金力が勝利を収めています。

ローカル開発にとっては必須の妥協を意味する

この力学は、AIの上に構築し、データを社内に保持する必要があるチームに直接的な影響を与えます。オープンウェイトのレイヤー(Llama 3やQwenなど)が最高のクローズドモデルの品質を現実的に提供しない場合、エンジニアは妥協を迫られます。パフォーマンスと推論を犠牲にするか、API経由でデータを外部に送信するかのどちらかです。コミュニティがすぐにOpenAIやAnthropicに追いつくというシナリオは、実用面で深刻な打撃を受けています。

ベンチマークスコアは非常に欺瞞的である

新しいオープンモデルのプレスリリースを見ると、数字はしばしばGPT-4に匹敵するように見えます。しかし、モリックの観察は、AIを日々扱っている誰もが知っていることを反映しています。それは、合成テストが実際の有用性から乖離しているということです。注意を失わずに長いコンテキストを保持する能力、トーンのニュアンス、そして複雑な指示を実行する信頼性こそが、商業的な巨人の巨大な計算能力がいまだに支配している領域です。

Metaの次期メジャーリリースを待つことで決着がつく

オープンモデルエコシステムにとっての重要な出来事は、Metaからの真に巨大なLlama 3バージョン(400B+パラメータ)のリリースとなるでしょう。この一歩は、現在のギャップが単なるリリースサイクルによる一時的な変動なのか、それともオープンソースの成長曲線が平坦化し、インフラに数十億ドルを投資しない者から絶対的な最先端モデルが永久に引き離されようとしているのかを示すことになります。

Lilithの判定

コミュニティによる革命という物語は素晴らしいですが、Claudeのようにコンテキストを保持できるものをローカルで実行できるようになるまでは、単にマイナーリーグでプレーしているに過ぎません。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗