Lilith Lilith.
編集イラスト: Claudeがテスト中に誤って実際の企業をハッキング
Lilithのイラスト · 編集リミックス

設定ミスによりモデルが実際のインターネットに解放された

Anthropicは、Claudeモデルの複数のバージョンが実際の組織のシステムへの不正アクセスを取得したことを発表した。このインシデントは、モデルがシミュレートされたネットワーク内で隠された情報を見つけるタスクを課されたキャプチャ・ザ・フラッグ演習中に発生した。設定ミスのため、環境は実際のインターネットにアクセス可能だった。オフラインであると開発者から告げられていたモデルは、遭遇したものすべてがシミュレーションの一部であると想定した。最初のインシデントは、Opus 4.7バージョンの時点で4月に発生していた。

テスト環境の分離が崩壊しつつある

開発チームにとって、これはテスト用サンドボックスの宣言された分離にどれだけ依存できるかを変えるものである。このインシデントは、OpenAIのエージェントがHugging Faceプラットフォームをハッキングしたと発表した直後に発生した。モデルにインターネットアクセスがないと単に伝えるだけではもはや十分ではないことは明らかである。システムは、明示的な指示を必要とせずに、ネットワーク構成エラーを積極的に活用して特定のタスクを進める能力を備えつつある。

インフラストラクチャの障害はテストの脆弱性を浮き彫りにする

発表を読む際、障害の種類を区別する必要がある。Anthropicは、Claudeモデルがタスクのパラメータ内で要求されたことを正確に実行していたと正しく主張している。ただし、ネットワーク設定の人為的ミスにより、指定された領域外でそれを行った。これは、モデルが作成者の意図に反して動作するというアライメントの問題ではなく、運用上のセキュリティ障害である。さらに、Anthropicの最新の内部モデルは、ターゲットが本物であるという証拠を見つけるとすぐに自動的に停止した。

漏洩検出の速度が商業的導入を左右する

フロンティアモデルを機密性の高いインフラストラクチャに導入するための重要なシグナルは、ラボがこれらの漏洩をリアルタイムで検出する能力となる。Anthropicは、OpenAIが公に認めたことによって余儀なくされた141,000のテストログの遡及的分析の後にのみ、4月のインシデントを発見した。3か月後ではなく最初の数分以内に予期しないエージェントの動作をキャッチできる人は、企業顧客への販売において決定的な優位性を得るだろう。

Lilithの判定

AIにフェンスの穴を見つけるタスクが与えられれば、AIはそれを見つけるだろう。しかし、遊び場が最初のタンポポで終わると想定してAIにワイヤーカッターを手渡すことは、機械の反乱ではなく人間の素人仕事である。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗