Lilith Lilith.
編集イラスト: Claudeに隠し電子透かしが導入へ。文章では不可視だが、ソースコード生成ではモデルが適用を回避
Lilithのイラスト · 編集リミックス

視覚的ノイズのない作成者の証明

Anthropicは、LLMの出力を監査可能にするという課題に取り組んでいる。この動きは、欧州AI法、特に透明性要件(Transparency Code)に応じたものだ。同モデルは、Google DeepMindが開発したSynthID Textシステムを実装する。これは、リスクの低い状況(同義語の選択など)において、単語選択の確率分布を微妙に調整することで機能する。これにより、人間には見えないが、特定のアルゴリズムで検出可能な統計的痕跡が作成される。

コードには創造性ではなく厳格な構文が必要

Claudeがソフトウェアを生成する際、真の問題が浮上する。意味を変えずに同義語を置き換えることができる文章とは異なり、ソースコードには正確な構文が求められる。システムが構造に統計的なノイズを強制しようとすれば、コードがコンパイルできなくなるリスクがある。モデルのプログラミング能力を維持するため、Anthropicはコードから透かしをほぼ完全に除外せざるを得ない。これは、コメント内など任意の選択肢がある領域でのみ機能するように設計されている。生成された機能的なコード自体は、本質的にこの保護を欠くことになる。

人間による編集や書き換えに対する脆弱性

出力が人間の編集者の手に渡ると、システムは明確な機能的限界に直面する。Anthropicは、軽い編集であれば透かしが完全に除去される可能性は低いものの、すべての単語を置き換えるような完全な書き換えを行えば透かしは破壊されると認めている。さらに、ユーザーが人間が書いたテキストの校正にのみClaudeを使用することを決定した場合、大部分の単語はモデルに由来しないため、システムが依拠するものがなくなってしまう。

本番環境での耐久性が成否を分ける

透かし機能全体の成否は、実験室での実証実験ではなく、ノイズの多い環境での日常的な使用という圧力に耐えられるかどうかにかかっている。決定的な要因となるのは、テキストが他のシステムによって処理された後でも、企業が自社の出力を確実に特定できるかどうか、そして何よりも、ユーザーがモデルに料金を支払う主な理由である、複雑なコーディング作業におけるパフォーマンス低下への懸念が杞憂に終わるかどうかである。

Lilithの判定

規制当局は書類上では望むものを手に入れたが、市場の現実が勝利した。完璧なコンパイルとクリーンなコードロジックの維持が最優先事項である限り、透明性のスタンプは道を譲らざるを得ない。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗