Lilith Lilith.
編集イラスト: AnthropicがClaude Fable 5.1をリリース。高速化されたモデルがエージェントの長期タスクにおける信頼性を向上
Lilithのイラスト · 編集リミックス

安価なメモリが自律型エージェントへの道を開く

Anthropicは、同社のミッドティアモデルのアップデート版であるClaude Fable 5.1を提供開始します。パラメーターの基盤は同じですが、運用コストが大幅に下がりました。キャッシュの読み取り(すでに処理されたコンテキストの再利用)の価格が75%引き下げられました。同社によれば、同じベース素材を常に参照する典型的なエージェントタスクの場合、これにより全体のコストが最大45%削減されます。

Fable 5.1と並行して、Claude Mythos 5.1もリリースされます。技術的にはまったく同じモデルですが、サイバーセキュリティと生物学研究におけるガードレールが緩和されています。Mythosは、(政府とのつながりがある組織など)厳格な審査プロセスを通過した組織のみが利用できます。

初期エラー後もエージェントはスレッドを見失わない

開発者にとって最も重要な変化は、長期にわたる自律的なタスクにおけるモデルの動作です。これまでのモデルは数ステップで幻覚を見始め、すでに試したことを忘れ、ループに陥ることがよくありました。テストや初期のパートナー(ShopifyやDatadogなど)によれば、Fable 5.1はタスクに集中し続け、自身の記録を保持し、人間の介入なしにコードの根本原因エラーを修正することができます。

Terminal-Bench 4.0ベンチマーク(ターミナルで問題を解決するエージェントの能力をテストする)において、Fable 5.1は前身モデルを上回り、より低いコストでより大規模な競合モデルと同等以上の成果を上げています。

セキュリティのガードレールは商用展開の課題として残る

リアリティチェックはセキュリティとコンプライアンスに集中しています。AnthropicはFable 5.1の誤検知(フォールスポジティブ)を60%削減しましたが、潜在的な悪用を恐れて正当なリクエストを拒否するケースが依然として多数存在します。

まさにこのため、AnthropicはクローズドなMythosブランチを作成する必要がありました。これは、ペネトレーションテストや製薬研究などの専門的な作業において、普遍的なセキュリティフィルターが厳しすぎることを証明しています。さらに、データのゼロ保持とローカル監査を可能にするように設計された新機能「Enterprise Frontier Safeguards(EFS)」の展開は、晩秋まで開始されません。

採用のスピードは本番環境での安定性にかかっている

決定的なシグナルは、孤立したベンチマークでFable 5.1がどのような結果を出すかではなく、実際の企業データベースへの無制限のアクセスを与えられたときに、軌道を外れずにいられるかどうかです。価格の引き下げにより、バックグラウンドでタスクを委任する「オーケストレーター」の役割に最適な候補となりました。

真の試練は、企業が自律的なチケット解決のためにFable 5.1を直接本番環境にデプロイし始めるか、それともコードエディターのより優れたオートコンプリートとしての役割に留めるかです。

Lilithの判定

エージェントモデルの問題はスクリプトが書けないことではなく、15ステップもすると自分が何をしているのか忘れてしまうことでした。キャッシュの割引は、開発者にもう一度試してもらうための賄賂にすぎません。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗