2026-09-04 · ← ニュース
Claude 5.1 システムカード:紙上のリスク vs 花瓶を割る現実の能力
トップモデルのための200ページの監査
Anthropicは、新世代のモデルであるClaude Fable 5.1とMythos 5.1のシステムカードを公開しました。この文書は200ページ以上に及び、セキュリティ評価とモデルの機能を詳細にマッピングしています。Zvi Mowshowitzによれば、Fable 5.1はリリース時点で、公に利用可能なAIモデルとしては世界で最も有能でした。報告書にはCBRNから自律的複製に至るまでの従来のリスク分析が含まれており、この高度な世代であっても、モデルがASL-3(AI安全レベル3)の重要なレッドラインを越えていないことを示しています。
書類上の官僚主義が現実を見失うとき
企業顧客やセキュリティチームにとって、この文書はコンプライアンス劇場という形で増大する問題を浮き彫りにしています。テキストの量は、調査結果の実用性に比例していません。レポートは何十ページも費やして仮想的かつ極端なシナリオを分析していますが、日常的なエラー率の明確な線引きが欠けています。Anthropicは規制当局に対して完璧な防御を構築していますが、実用的な展開において、200ページは通常の企業活動でモデルが正確に何を失敗するかのガイドというよりも、アリバイとして機能しています。
計画を立てられないからモデルは安全である
安全テストの成功を祝うことには裏があります。モデルは、一貫した長期的な計画において失敗するため、単に危険な行動を示さないことがよくあります。Zvi Mowshowitzは、モデルが世界を脅かさないのは完全なアライメントのおかげではなく、途中で迷子になることなく複雑な一連のアクションを実行できないからだと適切に指摘しています。これは安全のための緩衝材ですが、同時に真のエージェント型自律作業にとっての厳しい限界でもあります。
真の自律性が明らかにするもの
転換点は、システムカードが500ページに増えたときに起こるわけではありません。決定的な変化は、人間の監督なしに数百のステップにわたってコンテキストと実行能力を維持するモデルへの移行です。クラッシュすることなく長いプロセスを安定して管理できることが証明されたモデルが登場すれば、現在の安全プロトコルがそれを範囲内に収めることができるのか、それとも過去の安全性が技術的な不完全さの副産物に過ぎなかったのかが明らかになるでしょう。
Lilithの判定
官僚主義が勝利しました。Anthropicが規制当局向けに200ページの保険証券を印刷している間、プロダクトマネージャーは、モデルが実際の企業ワークフローのどの段階で破綻するのか未だに把握していません。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗