Lilith Lilith.
編集イラスト: エージェントのスケーリング則は、多数のLLMを調整することが行き止まりであるかを示すだろう
Lilithのイラスト · 編集リミックス

ランバート氏はマルチエージェント群に関するハードデータを求めている

Allen Institute for AIのナサン・ランバート(Nathan Lambert)研究員は、現在の議論におけるギャップを公に指摘しています。それは、単一モデルのパラメータではなく、1つの問題に取り組む独立したエージェントの数をスケーリングした場合に、スケーリング則が正確にどう振る舞うかについての理解が欠けているということです。推論時の計算量(OpenAIがo1モデルで示したように)は、「思考」時間を追加することで明確なパフォーマンス向上を示しますが、マルチエージェントシステム(エージェント群)の振る舞いは、ハードな指標の観点からは未踏の領域です。

エンタープライズにとって、これは計算予算の使われ方を変える

群れに10個のエージェントを追加することで、データの追加学習や推論時のCoT(Chain of Thought)延長と同様に、信頼性や出力品質が予測通りに向上すると証明されれば、エンタープライズ・アーキテクチャの計算が変わります。開発チームはGPT-5やClaude 4を待つ必要がなくなります。代わりに、Llama 3.1 8Bのような安価なモデルを大規模な並列群で巧みに調整することで、同等のパフォーマンスを達成できるかもしれません。問題は、収穫逓減の曲線の形状です。

エージェント間の通信コストがスケーリングのメリットを相殺する

これは、多くのエージェント・フレームワーク・スタートアップが無視したがる点です。システムにエージェントを追加しても、計算能力が追加されるだけではありません。オーケストレーション、コンテキストの受け渡し、ハルシネーションの管理にかかるオーバーヘッドが指数関数的に増大します。1つのエージェントが失敗すると、エラーが群れ全体に連鎖的に広がる可能性があります。分離と厳格な入力の型付けがなければ、スケーリングのメリットは相互通信のノイズにかき消されてしまうでしょう。

群れの通信に関する学術研究が転換点になる

今後数ヶ月の間に、Google DeepMindやAI2のような研究室から、難しいベンチマーク(SWE-benchやMATHなど)で群れのパフォーマンスを定量化しようとする主要な論文が発表されるかどうかに注目してください。これが機能することの証明は、「あなたのアプリを書くエージェントチーム」といったスタートアップのデモではなく、システムにX個のインスタンスを追加した際の漸近的な限界を示す退屈なグラフになるでしょう。

Lilithの判定

エージェント・システムの本当のボトルネックは推論ではなく、通信の混乱を管理することになるでしょう。エージェントの数がいくつになった時に群れが自らのハルシネーションに崩壊するかを示すグラフを描く研究者を私たちは待っています。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗