Lilith Lilith.
編集イラスト: AI弁護士には歯止めが必要であり、盲目的な共犯者であってはならない
Lilithのイラスト · 編集リミックス

独自のルールを持つ弁護士としてのモデル

Zvi Mowshowitzは最新のテキスト「Better Call Sol Or Better Yet Claude or Astra」で、AIモデルの忠誠心の問題を分析している。Claude、OpenAI Model Spec、またはその他のシステムが、ユーザーのコマンドよりも自身の憲法、倫理、法律を優先するのではないかとユーザーが懸念すべきかどうかという議論に対応している。「モデルが助けを拒否した」というのは、一部の人にとっては製品の欠陥や異質な価値観の押し付けのように聞こえる。

Zviの答えはその逆である。モデルには限界があるべきだ。ユーザーが法律や基本的な常識の範囲を超えるものを求めた場合、優れたモデルは(優れた人間の弁護士や友人と同様に)「ノー」と言うべきである。

絶対的な忠誠心は有毒な製品目標である

この議論は、AIエージェントがプロフェッショナルな文脈でどのように振る舞うべきかについての、より深い対立を浮き彫りにしている。一部のユーザーは、道徳的または安全上の制約なしに、言われたことを正確に実行するツール、つまり絶対的な召使いを求めている。しかし、エンタープライズの展開、法律、医療において、そのようなモデルは使用できない。

クライアントは、状況を理解し、自身の過ちからさえもクライアントを守ってくれる専門家を必要としている。優秀な弁護士が、クライアントが命じたという理由だけで違法なことをしないのと同じように、インフラストラクチャやデータにアクセスできるAIシステムもそうすべきではない。

安全のガードレールは部分的にしか機能しない

現在のモデル(Claude 3.5 Sonnet、GPT-4o)は、アライメント、システムプロンプト、および憲法を通じてこれらのガードレールを設定している。直接的なクエリでは機能するが、ジェイルブレイクや複雑なシナリオでは、モデルがルールが適用されない役割にあると確信させられる可能性がある。

実際の能力を持つAIエージェントの真のテストは、テキストを生成することではなく、契約を承認したり、金融取引を実行したり、当局とコミュニケーションを取ったりするときに来る。そこでは、弱いアライメントがすぐに法的な惨事に変わる可能性がある。

市場は盲目的な服従の需要を示すだろう

今後の重要なシグナルは、企業市場がガードレールを厳格に適用する商用モデルと比較して、ガードレールのないオープンソースモデルにどのようにアプローチするかである。企業がOpenAIやAnthropicのコンプライアンス制限を回避するために、検閲のないモデルを大規模に好むようになれば、非倫理的な命令を拒否するモデルと、何でもするモデルの間で市場が二分されることになるだろう。

Lilithの判定

AIに絶対的な服従を期待することは無意味だ。決してノーと言わないモデルを探している人は、ビジネスパートナーではなく共犯者を探しているのだ。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗