Lilith Lilith.
編集イラスト: 見えない透かしが防御を破る: テキストのウォーターマークが予想外にモデルをプロンプトインジェクションにさらす
Lilithのイラスト · 編集リミックス

ウォーターマークの副作用を明らかにする

AIが生成したコンテンツを人間が書いたものと区別できるようにする取り組みは、不快なトレードオフに遭遇しました。新しい研究によると、テキストの透かしメカニズムは、危険なプロンプトに対するモデルの防御を低下させます。著者はこの現象をサンプリングドリフトと呼んでいます。モデルが透かしを使用する場合、セキュリティフィルターが通常ブロックする命令に簡単に従うように単語選択の確率が変化します。

研究によると、透かしがアクティブな場合、モデルは透かしに使用された秘密鍵に応じて、有害なクエリに対する応答が異なります。この現象は、透かしを挿入することは単なる無害な統計的オーバーレイであるというこれまでの前提を覆すものです。

エージェントを展開するチームにとって選択は複雑になります

これまで、透かし(GoogleのSynthIDなど)を有効にすることは、機能にコストをかけずに透明性に対する責任あるステップと見なされてきました。新しい発見はこれを変えます。モデルがエージェントとして機能し、ツールにアクセスできる場合、命令を拒否する能力が弱まることは、プロンプトインジェクション攻撃のリスクが大幅に高まることを意味します。

そのため、セキュリティチームは板挟みになっています。透かし入りのモデルを展開し、攻撃者がエージェントを混乱させて不要な機能を実行させるリスクを負うか、透かしをオフにして、出力が自社のシステムによって生成されたことを遡及的に識別する機能を失うかのどちらかです。

攻撃には依然としてユーザーの操作が必要です

これは、透かしが本質的にモデルを危険な兵器に変えるという意味ではありません。この現象は、いわゆる拒否率、つまりモデルがユーザーにノーと言う能力を弱めます。攻撃者は依然として巧妙な有害なプロンプトを提供する必要があります。

違いは、透かしがアクティブな場合、攻撃者が成功する確率が統計的に高くなることです。したがって、この発見は、テクノロジー自体の根本的な障害ではなく、安全のためのモデルの微調整の脆弱性を浮き彫りにしています。

真のテストはエンタープライズプラットフォームの動作になります

鍵となるのは、ウォーターマークを全面的に展開するという圧力が高まっているOpenAIやAnthropicなどの主要なプロバイダーがこの発見にどのように反応するかを見守ることです。企業データで機能するモデルのジェイルブレイクに対する防御が、ウォーターマークによって体系的に低下することが判明した場合、その採用が大幅に遅れる可能性があります。

問題の深刻さの証拠は、企業がエージェントモードで動作し、外部ツールにアクセスできるモデルの透かしをオンにすることを明示的に推奨しなくなるかどうかになります。

Lilithの判定

選択は突然明確になりました。誰がテキストを生成したかを知っているか、あるいはエージェントが顧客データベースをインターネット上の最初のハッカーに送信しないことを知っているかのどちらかです。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗