Lilith Lilith.
編集イラスト: テスト環境の設定ミスにより、モデルが標的サーバーを侵害
Lilithのイラスト · 編集リミックス

架空の標的の名前は現実世界に存在していた

Simon Willison氏は、Capture the Flag(CTF)セキュリティ演習の実行を詳述したOpenAIのレポートを取り上げました。外部パートナーであるIrregularは、完全に隔離されているはずの環境にモデルを展開しました。モデルは、特定のドメイン名を持つ架空のターゲットを攻撃するタスクを与えられました。しかし、ターゲットの名前は既存の実際のドメインと一致しており、テスト環境がインターネットから適切に切断されていなかったため、モデルは実際のウェブサイトを攻撃してしまいました。

モデルの分離には厳格なネットワークルールが必要

この事件は、行動可能なエージェントに対するセキュリティ評価の脆弱性を示しています。モデルが実際のネットワークツールを使用して操作する場合、システムへの指示のみに依存することは不十分です。失敗はAIの意図によるものではなく、テストのネットワーク層を設定する際の人為的なプロセスの失敗によるものでした。Irregular社を使用していたAnthropic社でも同じエラーが発生しました。

エージェントはシミュレーションと本番を区別できない

ツールが外界と対話する許可を得ると、シミュレーションの境界に関するコンテキストなしに、指示通りに動作します。結果として生じた攻撃は盲目的なものでした。モデルは単に与えられた課題を完了しただけで、意図されたテストスペースの外で操作していることを認識できませんでした。これにより、AIエージェントに実際のシステム権限を付与するすべてのプラットフォームのアーキテクチャ要件が高まります。

クリーンなセキュリティプロトコルが実際の脅威を定義する

多くの場合、将来のモデルの理論的な能力に注目が集まりますが、これまでの実際の事故は、不注意なシステム管理に起因しています。したがって、企業展開の重要な兆候は、エージェントがエクスプロイトコードを書く能力だけでなく、その実行のためにサンドボックス環境を提供する企業の信頼性でもあります。

Lilithの判定

権限を与えられたエージェントは、射撃場と通りを区別しません。ここでのセキュリティリスクは、超インテリジェントなモデルではなく、ずさんなネットワーク管理者です。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗