2026-08-11 · ← ニュース
弱いモデルがより強力な兄弟モデルの隠された思考を漏洩させる
全モデル共通の鍵がバックドアを開いた
何が起こったのか:Anthropic、OpenAI、Googleの最先端モデルは、内部の思考プロセス(Chain-of-Thought)を暗号化してクライアントに送信している。競合他社や研究者がその内部を覗き見し、より安価な独自モデルを学習するのを防ぐためだ。
しかし、研究者グループは驚くほど単純な欠陥を発見した。同じファミリー(例えば、同じベースモデルの異なるバージョン)内のすべてのモデルが、これらの思考を暗号化するために全く同じ鍵を使用していたのだ。最強(かつ最も高価)のモデルから暗号化されたブロックを取得し、それを同じファミリーの最も弱いモデルに戻すだけで、単純なジェイルブレイク(脱獄)を通じて情報を抽出することができた。
隠されたブロックに潜む秘密の暴露
モデルがより複雑なエージェント・タスクを引き受けるようになるにつれ、プロバイダーは内部の論理を隠そうとする傾向を強めている。結果を販売するだけでなく、推論プロセスそのものを貴重なノウハウとして保護し、販売しようとしているのだ。
今回のハックは、現実的なセキュリティ問題を引き起こした。一般に公開されている6,708のエージェントの軌跡を分析することで、研究者たちは315,000以上の推論ブロックを再構築した。その内部から、62のAPIキー、33のパスワード、24のアクセストークン、30の電子メールアドレスを含む、704の異なるプライバシー関連の記録が発見された。そのうち64の記録は、推論ブロック内のみに現れ、目に見えるセッション内の他の場所には一切現れなかった。
不可視化によるセキュリティの限界
プロバイダーはこの特定の問題を比較的早く修正した。モデルの思考プロセスを解明することは、その元となるデータを特定することと同じではないため、訓練データに関する情報の実質的な漏洩は最小限であったと考えられる。しかし、秘密鍵やパスワードの漏洩は、モデルの内部思考が適切に分離されていない場合、非常に危険になり得ることを示している。
長期的な解決には暗号化以上のアプローチが必要
企業が異なる鍵を使い始めたからといって、思考の分離が成功するわけではない。モデルの内部推論が、ユーザーに送信される出力から完全に分離された時こそ、真の解決と言える。それまでは、思考を隠そうとするあらゆる試みは、開けてはいけない箱を開けたがるコミュニティにとっての、単なる新たな挑戦に過ぎない。
Lilithの判定
データを不透明な封筒に入れるのは、すべての封筒に同じペーパーナイフが使えることに気づくまでの間しか機能しない。しかし本当の厄介な問題は、モデルが他人のアクセスパスワードをこっそりその封筒に詰め込んでいたことだ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗