Lilith.
⌕
編集イラスト: Google、文脈に応じてAIエージェントの権限を変える構想を提示
Lilithのイラスト · 編集リミックス

Google Researchは、学術界と産業界から50人を超える関係者が参加したAIエージェントのプライバシーとセキュリティに関するワークショップ報告書を公開した。参加者は2025年後半にニューヨークで開かれたCAPSワークショップに集まり、Contextual Integrityの考え方を、適切な情報流通だけでなくエージェントの行動の適切さにも広げるよう提案している。

報告書は、従来のセキュリティでは扱いにくい3つの特徴を挙げる。自然言語入力の曖昧さ、確率的な実行経路、そして委任を伴う自律性だ。エージェントはメールを読み、ツールを呼び出し、別のエージェントに作業を分けられる。開始時に与えた権限だけでは、その後の一手が適切かどうかを判断できない。

文脈が認可の一部になる

Contextual Integrityは、関係する主体、情報の種類、伝達ルールから情報の流れを評価する。たとえば買い物エージェントは贈り物のリストを知っていても、受け取る家族にそれを明かすべきではない。報告書は同じ論理を行動にも当てはめ、ツールを使う前に、その操作が目的と状況に合うかを評価するよう求める。

提案される監督層には、文脈に応じたpolicy engineが含まれる。実行中に新しく見つかったツール、変化する作業、処理中のデータに合わせてルールを生成し、強制する構想だ。情報がユーザーの作業領域を出る前に判断することを目指す。

セキュリティチームは変動する権限モデルを扱う

開発者やセキュリティ担当者にとって、問題は単なるアクセス可否から具体的な目的へ移る。同じエージェントでも、ビザ申請には旅券情報、ホテル予約には住所、会議主催者との連絡にはメールアドレスが必要になる。操作ごとに受信者も許容できる最小限のデータも異なる。

そのため報告書は、sandboxing、エージェントのidentity、動的な権限剥奪、モデルによる推論、ユーザー制御、複数エージェントの協調ルールを組み合わせる。また、確認疲れにも警告する。人が何十もの確認画面を承認すれば、クリックは実質的な防壁ではなくなる。

モデルを申請者と裁判官の兼任にしてはいけない

弱点は、社会規範を機械が強制できるポリシーへ変換する部分にある。文脈には議論の余地があり、組織ごとに異なり、人間にも判断できない場合がある。同じモデルが行動を提案し、ルールを解釈し、自分の解釈を承認するなら、監督層は信頼を別のpromptへ移しただけだ。

これは研究課題をまとめた報告書であり、完成したセキュリティ製品ではない。policy engineが不適切な行動を正しく止めた場合と、正当な作業を誤って止めた場合を共通に測る指標は示されていない。

長時間テストが状況変化への耐性を明らかにする

著者らは、複数エージェントと行動の連鎖を長時間試験するオープンなAgent Gym環境を提案する。有用なbenchmarkには攻撃の成否だけでなく、権限変更、各操作の出所、誤遮断、アクセスを即座に取り消せるかどうかの記録が必要だ。

本番環境では役割分離が決定的になる。policy engineには独自の監査記録と、モデルが適切だと主張してもtool callを止められる技術的権限が要る。独立した強制力のない文脈推論は、攻撃者が言葉で回避を試みられる助言にすぎない。

Lilithの判定

エージェントは旅券、予定表、法人カードを一息に要求する。文脈型policy engineには、助言をささやくだけでなく、受け渡しのたびにその手を止める権限が必要だ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗