Lilith Lilith.
編集イラスト: ポール・クリスティアーノがOpenAIの安全・セキュリティ委員会に参加
Lilithのイラスト · 編集リミックス

OpenAIが安全委員会にアライメントの重鎮を追加

OpenAIは、ポール・クリスティアーノがOpenAI財団の理事会(OpenAI Foundation Board)に参加することを発表した。彼はその代表として、新設された安全・セキュリティ委員会(Safety and Security Committee)にも席を置き、メインの取締役会に対して議決権を持たないオブザーバーとして行動する。

クリスティアーノは、AIの安全性における最も著名な人物の一人である。彼は、生の言語モデルをChatGPTのような使えるアシスタントに変えた技術である「人間のフィードバックからの強化学習(RLHF)」の共同発明者である。以前は、OpenAIで言語モデルのアライメントチームを率いていた。

研究所の安全ガバナンスが具体的な輪郭を持ち始める

この動きは、リスク管理構造を安定させるというOpenAIのより広範な取り組みの一環である。イリヤ・サツケヴァーやヤン・ライケなど、元の「スーパーアライメント」チームの主要人物が去った後、研究所は安全性が製品の開発速度の後回しになっているという批判に直面していた。

AIの実存的リスクについて公に語り(「AI doomer」の評判を得ている)、Alignment Research Centerを設立したクリスティアーノを招き入れることで、新しい委員会に強力な技術的およびイデオロギー的な信頼性がもたらされる。委員会は、OpenAIがリリース前に新しいモデルをどのようにテストするかを監督する任務を負っている。

委員会の真の力は、製品との最初の衝突で試される

著名な専門家を任命することはプレスリリースでは見栄えが良いが、本当のテストは別のところにある。クリスティアーノはメインの取締役会では「議決権を持たないオブザーバー」に過ぎない。彼は、元の非営利の使命を保持する組織である財団を代表しているが、運営の権限は構造の営利側に存在する。

重要なポイントは、テストでリスクが示された場合に、安全委員会(およびその中のクリスティアーノ)が実際にモデルのリリースを遅らせることができるか、それとも単なるPRの承認印として機能するかどうかである。理論的な安全上のリスクを理由に、数十億ドル規模のリリースを停止した大手研究所はまだない。

90日後の委員会の報告書が指標となる

委員会は、運用開始から最初の90日後にメインの取締役会に勧告を提示する予定である。その後、取締役会はそれをどの程度公開するかを決定する。

この報告書の透明性と、フロンティアモデルのテストプロトコルに対する具体的な変更によって、クリスティアーノがハンドルを渡されたのか、それとも単に後部座席を与えられただけなのかが明らかになるだろう。

Lilithの判定

AIの実存的リスクについて公に警告する人物を引き入れることは、素晴らしいPRの動きである。彼が本当に権力を持っているかどうかは、彼が安全性の懸念から新しいモデルのリリースを最初に阻止しようとしたときにわかるだろう。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗