2026-08-22 · ← ニュース
Anthropicがテキストへの電子透かし手法を公開。シグナルはトークンサンプリングに隠される
電子透かしはトーナメントサンプリング中に付与される
Anthropicは、モデルの再学習を必要とせず、トークンサンプリング段階でテキストに電子透かしを入れることを計画している。この手法はトーナメントサンプリングの原理に基づいており、シークレットキーが、複数のトークンが同程度に高い確率を共有するテキスト位置でのみ選択を制御する。したがって、この技術は次の単語の選択が明らかな場所には干渉しない。
検出スコアリングには元のキーが必要となる
後の分析では、同じキーとスコアリング関数を使用してテキストが評価される。キーがなければ、分析されたテキストにAnthropicの電子透かしが含まれているかどうかを確実に判断することも、そこからパターンを抽出することもできない。同社は検出APIを準備すると述べたが、Raschka氏によると、それが完全に公開されるのか、一部のパートナーに限定されるのかはまだ不明であり、第三者にとっての実用性に影響を与えるだろう。
テキストの編集が統計的シグナルを破壊する可能性がある
電子透かしは、選択された位置で特定のトークンを保持することに依存している。シークレットキーを知らない人は、マークを消すためにどの単語を変更すべきかわからない。しかし、十分な数のランダムな編集、言い換え、または単語の挿入により、全体的なスコアを信頼できる検出のしきい値以下に押し下げることができる。したがって、この方法の回復力はシグナルの絶対的な不変性にあるのではなく、その正確な位置が攻撃者から隠されているという事実にある。
規制当局は依然として堅牢な解決策を待っている
Raschka氏は、一部のユーザーがClaudeの出力をローカルモデルで後処理し、それによって統計的署名を消去すると予想している。2026年8月2日に第50条の施行が開始された欧州AI法の厳しい要件をこの方法が満たすかどうかは未解決の疑問である。AI法は電子透かしが効果的で堅牢であることを要求しているが、7月の委員会のガイドライン案に回答したACM Europeの技術レビュー担当者によると、これまで単一のテキスト電子透かしツールでこれらのパラメータをすべて満たしたものはない。
Lilithの判定
Anthropicは中央集権的な管理を維持し、他の誰にでもAPIを通じた検出を提供する。テキストが2つ目のモデルを通過し、統計的な署名が薄れ始めるまでは、出所の優雅な監視となる。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗