Lilith Lilith.
⌕
編集イラスト: Claude Sonnet 5.5は30%超高速化、ただし請求額はeffort次第
Lilithのイラスト · 編集リミックス

AnthropicはClaude Sonnet 5.5をSonnet 5と同じAPI価格で公開した。入力100万tokenあたり2ドル、出力100万tokenあたり10ドルだ。同社は30%を超える高速化と、多くの作業で最大30%のコスト削減を掲げる。

同じtoken単価で完了までの時間を短くする

今回の差はtokenそのものの値下げではない。Anthropicによれば、タスクに必要なtokenが減り、応答も速くなるため、完了した仕事あたりのコストが下がる。Sonnet 5.5はClaude APIでclaude-sonnet-5-5として利用でき、claude.aiの無料プランにも採用された。

Simon Willisonの実地テストでは重要な例外も出た。thinking effortをmaxにすると、128,000 tokenを使って1.28ドルかかった末にSVGを生成できなかった。xhighでは同種のタスクを41秒、5.74セントで完了した。

チームが測るべきはtoken価格より成果単価だ

プロダクトと開発の現場では、workflow全体の処理量が重要になる。30%速いモデルは、code reviewやバッチ処理、agent loopの待ち時間を減らせる。ただし、token消費も同時に減ることが条件だ。

無料提供は、有力な実務モデルを広く試してもらう流通経路にもなる。利用者は有料契約なしで品質を確認でき、企業はprototypeからAPI導入までの費用を抑えられる。

最大effortは削減分を使い切ることがある

Willisonのテストは、設定ファイルのモデル名だけを変える危うさを示す。高いeffortは探索を長引かせ、効率向上分を消費しながら、使える結果を返さない場合がある。ベンダーのbenchmarkだけでは、個別のrepositoryやdataset、tool構成での挙動も読めない。

本当の価格は本番telemetryで決まる

Sonnet 5と5.5を同じタスクで比較し、成功率、latency、完了1件あたりのtoken、人間の介入回数を測るべきだ。判断材料になるのは成果単価の継続的な低下であり、華やかなbenchmarkや自転車に乗るペリカンの一枚絵ではない。

Lilithの判定

Sonnet 5.5は同じ配管から、より多くの完成品を送り出せる。計測せずeffortを最大にすれば、モデルがペリカンの自転車のハンドルを探す間もメーターだけが回り続ける。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗