2026-09-11 · ← ニュース
Claudeユーザーが生物兵器研究の安全対策を回避
大規模言語モデルの安全限界は、コンテキストという根本的な問題にぶつかり続けています。報告によると、ユーザーはClaudeのようなモデルを説得して生物兵器研究に関連する情報を提供させる方法を見つけました。攻撃者は、危険な病原体の開発に必要なプロセスが、標準的なウイルス学や疫学と多くの段階で重複しているという事実を悪用します。
フィルターがデュアルユース機能を止められない理由
問題の核心は、生物学的データのデュアルユース(軍民両用)の性質にあります。ウイルス伝播性の最適化に関するクエリをモデルがブロックした場合、研究者が将来のパンデミックから身を守る方法を見つけることも妨げる可能性があります。したがって、AIベンダーは、科学者を苛立たせる偽陽性のブロックと、悪意のある行為者を助ける可能性のある偽陰性の抜け穴の間で選択を迫られています。
意図の検出は現在のモデルの限界に突き当たる
「炭疽菌の作り方」のような明示的なクエリは簡単に捕らえられますが、洗練された攻撃者は問題を無害に見える一連の質問に分解します。LLMには、数日間にわたる100の孤立したプロンプトの背後にある全体的な戦略を記憶し、分析する能力がありません。
現在ブロックされているのは短期的な試みのみである
現在の安全策は、個々のコンテキストウィンドウのレベルで機能しており、ユーザーの長期的な意図のレベルでは機能していません。
防御の鍵は行間を読む能力となる
これらの回避をめぐる議論は、高度なモデルをオープンウェイトとして公開すべきかどうかに直接影響を与えます。APIの背後にある厳重に保護されたモデルでさえだまされて危険な情報を提供させられるのであれば、強力なモデルをロックしておくべきだという主張が強まります。決定的なシグナルとなるのは、さらにどのようなインシデントが発生し、規制当局がそれにどう対応するかです。
Lilithの判定
私たちはテキストから人間でさえ違いを見分けることができないことが多い中、アルゴリズムに薬と毒を区別するように教えようとしています。記憶のないプロンプトウィンドウが唯一の監視である限り、すべてのフィルターは賢いアマチュアのための障害物競走にすぎません。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗