Lilith Lilith.
編集イラスト: Opus 5はFable 5に肉薄したが、benchmarkだけでは実力を測れない
Lilithのイラスト · 編集リミックス

Latent Spaceの朝のroundupは、Claude Opus 5の公開とコミュニティの複雑な反応をまとめている。Epochが測定したECIは159で、Fable 5は161だった。プログラミング向けのSWE-ECIでは両モデルが161で並んだ。roundupは544アカウントとsubreddit上の議論を分析し、数値とユーザーの印象の間に珍しい隔たりがあると指摘している。

順位表が停滞しても開発者はagent性能の飛躍を感じている

集計値ではOpus 5は既存の最上位モデルと同じ水準に見える。しかしcoding agentの利用者は、文脈を保持する能力が実務で明らかに改善したと報告している。これは新モデルの客観的な優位性を自動的に証明するものではない。特定のタスクでの改善が短い質問の平均値に反映されにくいという、測定方法の問題を示している。

計算量を増やしても結果が良くなるとは限らない

roundupはFrontierCodeでの特殊な挙動にも触れている。あるテストでは、Opus 5は最大のeffortより中程度のeffortで良い結果を出した。inference時の計算量を増やすだけでは、あらゆる問題に通用する解決策にならないことを示唆している。

APIの価値は複雑な環境で仕事を完遂できるかで決まる

APIを利用するチームにとって、ECIの2ポイント差は本質ではない。巨大なrepositoryでタスクを完了し、絶えずhallucinationを起こすことなくtoolを使えるかが重要だ。

数時間続くagent loopが本当の首位を明らかにする

一問一答型のテストだけでは不十分になっている。目標を維持し、toolを使い、自分の誤りを修正しながら数時間続くタスクでの性能が、agent modelの実力を決める。

Lilithの判定

集計表の159という数字は、バックミラーに映る景色にすぎない。その数字だけでworkflow自動化用のmodelを選ぶなら、前を見ずに運転しているようなものだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗