Lilith Lilith.
⌕
編集イラスト: Gemini 4 Argon、出力上限を100万tokenへ拡大するもAPIは未公開
Lilithのイラスト · 編集リミックス

GoogleはGemini 4 Argonを発表し、出力上限を従来の6万4,000から100万tokenへ拡大した。大規模な社内プロジェクトでの利用例も示したが、開発者はまだ自分で検証できず、印象的な実演と導入可能な製品の間には距離がある。

Argonは短い対話より長い処理を続ける余地を得た

最も目立つ変更は最大100万tokenの出力だ。Googleによると従来の上限は6万4,000tokenだった。これは出力の上限であり、新たに確認された入力context windowではない。長い作業を1本のtrajectoryに保ち、連続する実行の間で状態が失われる問題を減らす狙いがある。

Googleは複数の社内導入例を紹介した。agentがデータセンター全体のメモリ削減策を見つけ、導入後に300 TiB超を解放したという。削減量の推計は合計500 TiBから1 PiBだ。別のチームはCとC++のプロジェクトをRustへ移すためにArgonを使っている。対象は数万行のライブラリから80万行を超えるFuchsia Zircon kernelまで及ぶ。

libgav1 decoderでは、agentが既存のRust portにあった3万2,000行のSIMD codeを置き換えた。Googleは、映像出力を同一に保ちながら従来のRust portより2.7倍速くなったとしている。こうした変更には自動と手動のaudit、emulation test、reviewを行うという。

出力が長くなればagent設計と請求額も変わる

出力予算が増えれば、repository移行、長時間のresearch、難しいdebuggingで再起動する回数を減らせる可能性がある。一方で制約は別の場所へ移る。数十万tokenの内容を人が確認し、testし、料金を支払う必要は残る。長い実行だけで計画や結果の正しさは保証できない。

Googleが示した導入価格は入力100万token当たり2ドル、出力100万token当たり10ドルだ。cache済み入力は95 %引きになる。導入期間後は4ドルと20ドルへ上がる予定だが、期間の終了日と公開APIのmodel IDは発表されていない。

benchmark表は自社測定と異なるharnessを混在させている

GoogleによるとArgonはDeepSWE v1.1で77.9 %、AutomationBenchで51.3 %、LVBenchで91.7 %を記録した。ただし評価資料には、Argonの多くの数値をGoogle自身が計測し、競合の数値は提供企業や公開leaderboardから取得したとある。モデルごとにharness、toolの制限、実行条件が異なる。

注目すべき社内事例も、モデルを販売する企業自身が提示したものだ。十分な設備を持つGoogleのチームがArgonの周囲に何を構築できるかは分かる。一般の顧客が自社のrepository、権限、testで何を達成できるかはまだ分からない。

公開APIと社外repositoryが能力と演出を切り分ける

現在Argonを利用できるのは、Fairwind Programを通じて選ばれた信頼できる防御担当者とtesterだけだ。Googleは有料API顧客とGoogle AI Ultra加入者へ後から提供するとしているが、日付は発表していない。今は有料planを買うだけでは利用できない。

判断材料になるのは、社外codebaseで再現できるtest、長い実行の実latency、人が介入する回数、完了した作業1件当たりの費用だ。100万tokenは大きな燃料tankである。Argonが遠くまで走るのか、予算を長く燃やすだけなのかは本番運用で決まる。

Lilithの判定

100万tokenはagentのリードを長くする。社外repositoryで走らせれば、ゴールへ着くのか、チーム全員をそのリードで絡め取るのかが分かる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗