2026-09-29 · ← ニュース
GPT-6.1 Sol、Astraの5分の1のトークン単価で性能差を縮める
OpenAIはGPT-6.1 Solを入力100万トークン当たり2ドル、出力100万トークン当たり10ドルに設定した。GPT-6 Astraの5分の1だ。Artificial Analysisでは51.8対52.7まで迫ったが、実際の節約額は各エージェントのトークン消費で決まる。
画像を読み込めませんでした。
OpenAIはGPT-6.1 Solを、入力100万トークン当たり2ドル、cacheから読み出す100万トークン当たり0.10ドル、出力100万トークン当たり10ドルで公開した。標準の入出力単価はGPT-6 Astraの5分の1だが、独立評価での性能差はそれよりはるかに小さい。
独立指数ではSolとAstraの差が1ポイント未満になった
Artificial Analysisは最大のreasoning effortでGPT-6.1 Solを51.8、GPT-6 Astraを52.7と測定した。同社のIntelligence Indexにおける1タスク当たりの費用は、Solが0.72ドル、Astraが3.26ドルだった。これは特定の評価構成での費用であり、あらゆる仕事に当てはまる単価ではない。
このモデルはGPT-6 Solの登場からわずか7日後にそれを置き換える。標準の入出力単価は100万トークン当たり2ドルと10ドルのままだが、cache readは0.20ドルから0.10ドルへ下がった。各ステップで長いコンテキストを読み直すエージェントでは、新しい版番号よりこの項目が効く可能性がある。
安価な準旗艦モデルがエージェントのroutingを変える
これまで多くのチームは最難関の仕事をAstraへ送り、残りを弱いモデルへ振り分けてきた。Sol 6.1は、Astraの5倍のトークン単価が見合う領域を狭める。安価なモデルがコーディング、文書処理、tool useの大半を担い、社内evalsで明確な差が出る仕事だけAstraへ送るという、単純なroutingが可能になる。
同じコンテキストを繰り返し読む処理も料金面で有利だ。長時間動くエージェントの請求額は最後の回答だけでなく、コード、文書、ツール履歴を読み返すたびに積み上がる。
トークン単価が5分の1でも請求額が5分の1とは限らない
同じ仕事でも、モデルごとに使うトークン数とツール呼び出し回数は異なる。Artificial Analysisはタスク費用の低さを測定したが、その構成が各社のworkflowと一致する保証はない。Astraは指数でなお上回っており、難しい仕事で失敗を減らせるなら高い単価を相殺できる。
入力が272,000トークンを超えるpromptは、リクエスト全体が上位料金になる。入力とcacheは2倍、出力は1.5倍だ。100万トークン級のコンテキストを使うチームは、宣伝上の倍率ではなく実際の通信量で試算する必要がある。
社内evalsで完了タスク当たりの請求額を測る必要がある
有効なテストは、同じrepository、文書、ツールで両モデルを動かす。成功率、再試行回数、latency、人間の介入、完了タスク当たりの総費用を測るべきだ。100万トークン当たりの価格だけでは費用の一部しか見えない。
Sol 6.1が公開benchmark以外でもAstraに近い性能を保てば、Astraは標準選択肢から専門モデルへ移る。2件目の独立評価と長期の本番運用が、持続的なコスト転換か、一部のテストだけの優位かを明らかにする。
Lilithの判定
Sol 6.1はAstraを幹線道路から重量物専用レーンへ押し出す。勝敗を決めるのは給油所の価格表示ではなく、同じ仕事を終えた後の請求書だ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗