Lilith.
⌕
編集イラスト: textGrain、長文では検出率95%でも25%の編集で17%に低下
Lilithのイラスト · 編集リミックス

OpenAIは今後数週間で、EUの全プランを対象に、ChatGPTとCodexの該当するテキスト出力へ見えないwatermarkのtextGrainを導入する。単語選択を調整し、文章に統計的な信号を残す仕組みだ。世界のAPI顧客は一部モデルで有効にできるが、世界共通の初期設定にはならない。

検出器は開始時点では一般公開されない。承認された研究者と専門機関が個別審査で利用できる。結果はOpenAIのwatermarkを検出したかどうかだけを示し、ユーザー、prompt、会話を明かすものではない。

EUでは標準の印、他地域では任意の選択になる

地域限定の導入は、生成コンテンツを機械で読み取れる形で識別するEUの規則への対応だ。APIでは一部モデル向けの任意機能にとどめ、OpenAIはcloud partner経由での提供も予定している。

同社は、textGrainがSynthID for textを含む他の手法と同等以上の成績だったと説明する。公開したbenchmarkでは、watermarkの有無による品質の有意な差は確認されなかったという。

長く自由度の高い文章ほど信号が増える

偽陽性率を1%に設定した場合、心理学分野では200 tokenの回答の約80%、400 tokenの回答の約95%からwatermarkを検出した。単語選択の自由度が小さい数学では、検出率が大幅に低かった。

ここに実用上の範囲がある。長く、編集の少ない文章が対応モデルから出たことを提供者が示す助けにはなる。しかし、著者、内容の正確さ、人間の寄与率、文章の所有者は判定できない。

日常的な編集で統計的な痕跡は崩れる

400 tokenの文章を使った試験では、単語の10%を類義語に置き換えると検出率が約92%から66%へ下がった。25%を置き換えると17%まで落ちた。翻訳、短縮、大幅な書き直しも別の形で信号を弱めうる。

したがって、陰性でも人間が書いた証明にはならない。OpenAI自身が偽陽性と偽陰性を警告しているため、陽性も個人への断定には使えない。検出器への限定アクセスは乱用を抑える一方、一般の学校、報道機関、企業による独立確認を難しくする。

印の有無より不確実性の扱いが価値を決める

重要なのは、承認機関がスコア、文章の長さ、信頼性の限界をどう伝えるかだ。その説明なしに二択の結果だけを示せば、弱い統計信号が根拠の薄い告発へ変わりやすい。

OpenAIは技術報告書を拡充し、将来は技術をopen sourceで公開するとしている。言語、分野、翻訳、実際の編集工程をまたぐ再現可能な試験によって、textGrainが相互運用できるprovenance層になるのか、未編集出力に付ける規制対応ラベルにとどまるのかが明らかになる。

Lilithの判定

文章が2人の編集者を通るだけで、信号は92%から17%へ縮む。その痕跡を有罪の判子に使うのは、実験室の指紋を著者の身分証と取り違えることだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗