Lilith Lilith.
⌕
編集イラスト: Opus 5.5が取り戻した、ベンチマークでは測れない個性
Lilithのイラスト · 編集リミックス

Ethan Mollickは、Opus 5.5によって以前のClaudeと仕事をしている感覚が戻ったと評している。彼によれば、Opus 4.7前後から5までのモデルはClaudeらしい個性の一部を失い、Fableを薄めたように感じられたという。これは一人の利用者による体験であり、測定結果ではない。それでも、現在のランキングが見落とす点を示している。

Anthropic自身がランキングだけでは実務を語れないと認めた

Anthropicは2026年9月22日にOpus 5.5を公開した。同社によると、新モデルは従来より自然に対話し、重要な情報を先に提示する。Opus 5の文章が詰め込みすぎだという批判にも対応したという。同時に、現在の能力水準ではベンチマークの点差が実務上の違いを示す指標として以前ほど信頼できないとも説明している。

測りやすい改善もある。Anthropicは、典型的な処理のコストがOpus 5より40 %低く、出力速度は30 %超向上したと主張する。API料金は入力100万token当たり4ドル、出力100万token当たり20ドルだ。Anthropicのほか、AWS、Google Cloud、Microsoft Azureでも利用できる。

モデルの文体が人間の修正コストを左右する

長時間の作業では、個性が実務に影響する。不確実さを認めるか、論点をどう並べるか、人間がどれだけ書き直す必要があるかが変わるからだ。同じスコアの2つのモデルでも、編集者、開発者、アナリストが費やす時間は大きく異なりうる。

Mollickの投稿は、ベンダーの数字に利用者の視点を加えている。Anthropicが測るのはtoken数、速度、タスクの成功率だ。利用者はさらに、3時間の作業中に口調や判断を何度も直さずに協働できるかを見ている。

復活という評価はまだ体験談とベンダーの主張に依存する

Claudeらしさには標準化された指標がない。Mollickはブラインドテストやprompt集を公開しておらず、Anthropicが示すのもearly testersの声だ。文体の改善はモデル自体の変化かもしれないが、system promptの影響や新バージョンへの新鮮さが生んだ可能性もある。

自然な対話と正確さが一致するとも限らない。流暢な回答は読みやすいが、それだけでは誤りの訂正、指示の順守、過度な同調への耐性が高まったとは判断できない。

ブラインド評価と長時間の利用がClaudeの復活を判定する

今後見るべきなのは、同じ課題を使った反復ブラインド比較と実際の長時間作業だ。人間による修正回数、数十turn後の口調の安定性、証拠を示された際に見解を改めるかを追う必要がある。

利用者や分野をまたいで選好が続くなら、研究所は能力だけでなく協働の一貫性も測らなければならない。ベンチマークは得点表として有用でも、製品全体の説明書にはならない。

Lilithの判定

ランキングはモデルを順位づけできる。3時間の作業後、同僚がホワイトボードから消す修正が減ったとき、Claudeが本当に戻ったと分かる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗