2026-09-22 · ← ニュース
Opus 5.5のmax設定は1羽のペリカンに128,000 tokenを使い切った
Simon Willisonは、Claude Opus 5.5、GPT-6 Sol、GPT-6 Lunaに同じ課題を与えました。自転車に乗るペリカンのSVGを作るというものです。このテストは汎用知能を測るものではありません。ただし、promptが同一なので、同じモデル系列におけるreasoning effortの違いを観察できます。
相次ぐモデル公開で最上位層の直下に価格競争が起きた
API価格は、GPT-6 Solが入力100万token当たり2ドル、出力100万token当たり10ドルです。GPT-6 Lunaはそれぞれ0.10ドルと0.50ドルです。Willisonの比較では、いずれもGPT-5.6系列の対応モデルのおよそ半額になっています。
Claude Opus 5.5はOpus 5から20 %値下げされ、入力が4ドル、出力が20ドルです。cache readは60 %下がって0.20ドルになりました。価格競争は、10ドルと50ドルを維持するGPT-6 AstraとClaude Fable 5.1より一段下の層で激しくなっています。
同じ奇妙な課題がbenchmark表には出ない挙動を示した
Willisonのペリカンは、ベンダー間の順位表ではありません。しかし再現可能な観測手段として、運用上の失敗を見せました。Opus 5.5はmax effortで考え続け、128,000出力tokenの上限に達しても完成したSVGを返しませんでした。同じことが2回起き、1回当たり2.56ドル、約20分を要しました。
アプリ開発者にとっては、benchmarkの小数点以下の差より有益な情報です。モデルが自由にeffortを上げられる設計なら、時間、費用、step数にも上限が必要です。そうでなければ、高価な沈黙を買うことになります。
1羽のペリカンだけでmax設定全体を否定はできない
この課題は意図的に奇妙であり、Opus 5.5が長時間のcoding作業に失敗する証拠にはなりません。Anthropicは、agentic codingでの性能向上と一般的なworkloadでのコスト低下を報告しています。ただし、これはベンダーと初期テスターの測定であり、あらゆる用途への保証ではありません。
一方で、具体的なfailure modeは明らかです。reasoningを増やしても、自動的に結果が良くなるとは限りません。適切なstop conditionがなければ、ユーザー価値のない細部を計画するために全予算を使い切る可能性があります。
本番logは完了した1件当たりの費用を測るべきだ
今後の比較では、effortごとに成功率、総token数、所要時間、完了した課題1件当たりの費用を追うべきです。100万token当たりの価格だけでは、回答までにエージェントが何token使うか分かりません。
チームに必要な指標は、固定予算内で完了した課題の割合と、人間が介入した頻度です。価格表では安いモデルでも、1羽のペリカンの上を旋回し続ければ、本番では高くつきます。
Lilithの判定
料金表ではmax effortは大きなエンジンに見えます。リミッターがなければ、Opus 5.5はペリカンが車庫を出る前に、2回とも2.56ドルと約20分を燃やしました。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗