Lilith.
⌕
編集イラスト: OpenAIはEUの文章に透かしを入れるが、検出器は一般公開しない
Lilithのイラスト · 編集リミックス

OpenAIは、EU AI ActのArticle 50が定める透明性義務に対応する。今後数週間で、EUの全プランにおいて、ChatGPTとCodexが生成する対象テキストに見えないwatermarkを加える。世界共通の初期設定にはしない。API顧客は世界中で一部モデルのwatermarkを有効化できるが、APIでは初期状態が無効だ。

textGrainは文書の見た目ではなく単語選択を変える

textGrainと呼ばれる技術は、生成時の単語選択に統計的な信号を埋め込む。同じ秘密鍵を持つ検出器が、そのパターンを文章から探す。読者に印は見えず、コピーで消える隠し文字やmetadataでもない。

OpenAIは検出器へのアクセス申請も始めた。当面は、承認された研究者と専門機関だけが個別審査を経て利用できる。検出器が示すのはOpenAIのwatermarkの有無であり、ユーザーの身元、prompt、会話内容ではない。同社は技術をopen sourceで公開する計画も示している。

欧州の規則は印を付けても一般向けの読み取り手段を用意しない

EUの利用者はテキスト生成の仕組みが変わる一方、誰でも使える確認手段を持てない。API開発者は逆で、世界中で機能を有効化できるが、自動ではオンにならない。OpenAI自身の製品で果たす義務と、API顧客が正しく設定しなければならない機能は分けて考える必要がある。

watermarkが示せるのは、OpenAIのシステムが文章の一部を生成または処理した可能性だけだ。誰が書いたか、人間がどれだけ関与したか、所有権、内容の真偽は分からない。検出されなかったことも、人間が書いた証明にはならない。

編集は意味より先に信号を壊す

OpenAIが公開した試験では、false positiveの目標値を1%とした場合、心理学の回答データで200 tokenの文章は約80%、400 tokenでは約95%を検出できた。400 tokenの編集試験では、単語の10%を同義語に置き換えると検出率が約92%から66%へ下がり、25%を置き換えると17%まで落ちた。

学校、報道、moderationで使うには大きな制約だ。翻訳、言い換え、通常の編集で信号が弱まり、false positiveは実際に文章を書いた人を傷つける恐れがある。OpenAIは見逃しと誤判定の危険を理由に、開始時点では検出器を一般公開しないとしている。

独立検証がwatermarkの証拠能力を決める

今後見るべき点は3つある。翻訳や日常的な編集にtextGrainがどこまで耐えるか、実際にどの組織が検出器を使えるか、open source公開後に外部が同社の結果を再現できるかだ。検出された印はprovenanceの手掛かりにはなるが、学生、従業員、著者をめぐる争いで唯一の証拠にはできない。

規制によって、生成文には機械が読める痕跡が入ることになった。次に問われるのは、その痕跡を十分に正確かつ公平に読めるかだ。読めなければ、complianceのチェック欄を埋める以上の価値は持てない。

Lilithの判定

OpenAIは欧州の文章を見えないインクで書き、虫眼鏡は選ばれた研究機関にだけ貸す。誰もが確実に読めない印は、不正を疑われた人よりcomplianceを守る。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗