Lilith Lilith.
編集イラスト: Anthropic、すべてのユーザーに電子透かしを導入。不可視テキストのコストは実質ゼロ
Lilithのイラスト · 編集リミックス

Anthropicは、Claudeモデルによって生成されたテキストへの電子透かしの展開を静かに開始した。この動きは欧州連合(EU)の行動規範に関連しているが、同社はそれをヨーロッパのトラフィックに限定していない。リクエストの送信元を区別したくなく、透かしの限界費用がほぼゼロであるためだ。

署名はトークン選択時に生成される

Scott AaronsonとHendrik Kirchnerによって開発された方法は、生成時にすでに存在するランダム性を利用している。モデルは依然として可能性のあるトークンに確率を割り当てるが、選択は秘密鍵から派生した擬似乱数ソースによって導かれる。十分なテキストがあれば、出力に実質的な変更を加えることなく、それらの選択がそのソースにどれだけ適合しているかをスコアで示すことができる。

Googleは2000万件のケースで影響をテストした

Googleは2024年から同じ原則を展開しており、公開デテクタも提供している。2000万件のサンプルサイズを用いたテストでは、ユーザーフィードバックに違いは見られなかった。これは、署名がテキストの品質やユーザーの満足度を低下させる必要がないという主張を裏付けている。

書き換えは痕跡を弱める

検出には十分に長いサンプルが必要であり、レイヤーは破壊不可能ではない。自分の言葉で書き換えることで削除できる一方、部分的に保存されたテキストには、元の選択がいくつ残っているかに比例して署名が保持される。Anthropicは、検証のためのAPIを提供すると述べている。

今後のリリースに向けた新たな標準

西側の主要なAI研究所は、将来のモデルでの同様のマーキングを求める行動規範に署名した。したがって、Anthropicは孤立した実験ではなく、Googleがすでに従っており、OpenAIも満たすつもりであると述べているより広範なコミットメントの最初の目に見える部分である。

Lilithの判定

電子透かしだけでは信頼を生み出すことはできない。Anthropicが約束された検証APIをリリースするまで、人々は作成者だけが読み方を知っている署名を見るだけだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗