Lilith Lilith.
編集イラスト: Nvidiaが推論ベンチマークを突破。決定打は新しいモデルではなくソフトウェアの環境だった
Lilithのイラスト · 編集リミックス

ソフトウェア環境のおかげで正答率が30%から100%に

Claude Opus 5単体では、指示のない2Dゲームで構成されるARC-AGI-3の複雑な論理タスクの約30%を解決しました。しかし、Nvidiaの研究者たちは、このモデルを独自のメモリ管理システム内に配置し、監視エージェントを追加しました。このコードはモデルに新しい知識を与えたわけではありませんが、軌道を維持し、行き止まりを回避するのに役立ちました。

この外部制御により、同じモデルが100%の正解率に達しました。この結果は、モデルの選択が重要ではないという意味ではありません。しかし、長期的なタスクにおいては、周囲のアーキテクチャがモデルの重み付けそのものと同じくらいパフォーマンスを劇的に変える可能性があることを示しています。

モデルはエージェントの1つのレイヤーに過ぎない

Nvidiaはこれにより、エージェントシステムの幅広い構成を強調しています。モデルは推論能力を提供する一方で、ソフトウェア環境はメモリ、コンテキスト、ツール、フィードバックを管理します。このレイヤーこそが、単一のプロンプトへの応答を、多くの決定を結びつけ、間違った方向から回復できるプロセスへと変えるのです。

監視エージェントは結果を出す上で重要でした。メインエージェントが行き詰まったり、失敗したルートを再び試そうとしたりすると、別のレイヤーがエージェントを別の場所へと導きました。したがって、パフォーマンスはモデル単体からではなく、複数のシステムコンポーネントの相互作用から生まれたことになります。

アーキテクチャはパフォーマンスとコストの両方を変える

ソフトウェア環境は無料のレイヤーではありません。コンテキスト、ツール、フィードバックの管理には追加の処理が必要であり、実装方法によって実行コストが大幅に変わる可能性があります。TechCrunchは、不適切な環境を使用すると同じモデルでもコストが2倍になる可能性があるというDatabricksの調査結果を引用しています。

したがって、モデルの呼び出し価格だけでは、エージェントの経済性を捉えることはできません。チームはステップ数、再試行回数、監視メカニズムのオーバーヘッドも追跡する必要があります。2つのアーキテクチャの間の差がここで掛け合わされる可能性があるからです。

オープンな環境が競争力のあるレイヤーになる

Nvidiaはこの結果を新しい完成品として提示したわけではありません。Agentic Variation Operatorsと呼ばれる研究システムを構築し、NeMoブランドの下で同様の環境を構築するためのオープンコンポーネントと商用コンポーネントの両方を提供しています。彼らの幅広い主張は、オープンなエージェントスタックによって、ユーザーが環境、インフラストラクチャ、ランタイムを制御できるようになるということです。

したがって、次の大きな変化はモデルのランキング以外で起こるでしょう。パフォーマンス、コスト、安全性の比較には、各エージェントスタックがメモリ、監視、ツールをどのように扱うかという点も含まれるようになります。

Lilithの判定

Claude Opus 5は環境なしで30%、監視ありで100%のスコアを出しました。デジタルの天才でさえも、誰かが迷走を食い止めればより良いパフォーマンスを発揮するということを、人類は再発見したのです。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗