Lilith.
⌕
編集イラスト: 2ドルと10ドルのモデルが並んだ週、価格競争が利用機会を追い越した
Lilithのイラスト · 編集リミックス

Zvi Mowshowitzの週刊まとめは、複数の出来事を無理に一つの大きな物語へまとめていない。最も有用な共通点は具体的だ。Gemini 4 ArgonとGPT-6.1 Solは、入力100万token当たり2ドル、出力100万token当たり10ドルで並んだ一方、実際のアクセス条件には差が残った。

Argonには価格とbenchmarkがあるが一般開発者のアクセスはまだない

GoogleはGemini 4 Argonを、software engineering、知識労働、サイバー防御の長時間タスク向けモデルとして発表した。最初はFairwind Programを通じて選ばれた防御側の組織へ提供し、その後、有料API顧客とGoogle AI Ultra加入者から対象を広げるとしている。

導入価格は入力100万token当たり2ドル、出力100万token当たり10ドルで、cache済み入力には95%の割引がある。導入期間の終了後は4ドルと20ドルへ上がる予定だ。Mowshowitzが魅力的な料金表と、自分で試せる製品を分けて論じるのは妥当だ。

同じ価格ならモデル選びはworkflowの比較になる

まとめによると、GPT-6.1 Solも同じ2ドルと10ドルで、より高価なGPT-6 Astraに近い性能を掲げる。一方、Mowshowitz自身は日常の作業でClaude Opus 5.5を引き続き好んでいる。この文章は一人の勝者を決める独立ランキングではなく、異なる選択肢の地図として読むべきだ。

2つのfrontierモデルが同じtoken単価に並ぶと、単価だけの比較は役に立たなくなる。チームにとって重要なのは、完了したタスク当たりのtoken消費、tool useの信頼性、latency、そして実際に使う地域と料金プランで利用できるかどうかだ。

ベンダーのグラフが未知のrepositoryでの実体験を代替している

GoogleはArgonについて、DeepSWE v1.1で77.9%、AutomationBenchで51.3%、LVBenchで91.7%と報告している。具体的な数値ではあるが、発表時点で一般の開発者は自分の仕事と比較できなかった。限定提供は情報の非対称を生む。ベンダーは数字とモデルの両方を持ち、読者が持つのは主に数字だけだ。

週刊まとめという形式にも同じ注意が要る。Mowshowitzは有用な案内図と一部モデルの使用経験を示しているが、Argon、Sol、Opusを同一条件で比べた統制実験ではない。

完了した仕事の請求額と開かれたアクセスが順位を決める

次の重要なシグナルは、GoogleがArgonを有料API顧客とGoogle AI Ultra加入者へ開放した時に出る。実際のcodebaseを使う独立evalsによって、異なるツール、権限、長時間タスクでも公称性能が維持されるかを確認できる。

導入価格が4ドルと20ドルへ上がる前に、実運用をどれだけ生むかも見どころだ。100万token当たりの価格は招待状にすぎない。供給元の選択は、完了しレビューされたタスクのコストで決まる。

Lilithの判定

ショーウィンドウには2ドルと10ドルが並ぶが、Argonの扉はまだ招待者名簿にある名前にしか開かない。価格、アクセス、完了した仕事の請求書が同時に届いて初めて、モデル市場は比較できる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗