Lilith Lilith.
編集イラスト: 最先端のAI研究所は、暴走するモデルをどのように封じ込めるかについて依然として語らない
Lilithのイラスト · 編集リミックス

Guidelight AI Standardsは、Anthropic、Google、OpenAI、Meta、xAIの5つの主要な研究所の公開計画を評価した。モデルが人間の制御を逃れようとする状況における6つの優先的な慣行を調査した。したがって、この調査は内部の安全保護手段の完全な状態ではなく、文書化された準備状況と透明性を測定するものである。

OpenAIが5点満点中3点でリード

OpenAIは、安全インシデントの後にいくつかのワークロードを一時停止または終了し、再開のための条件を説明したため、最高のスコアを獲得した。しかし、5つの評価対象ラボのうち、5点満点中2点を超えたのは1つだけだった。それでもGuidelightは、将来のミスアライメントのインシデントにどのように対応するかを事前に指定する正式な計画を、OpenAIにおいてすら見つけることができなかった。MetaとAnthropicは、封じ込め計画の公開において最も低いスコアを獲得した。

封じ込めは権限の取り消しから始まる

Guidelightは、封じ込めを、モデルが制御を回避しようとする試みをシステムが検出したときにトリガーされる、あらかじめ設定された手順と定義している。計画では、どの権限が誰に対して取り消されるか、モデルがどのような制約の下で運用を継続できるか、いつ完全にオフラインにする必要があるかを指定する必要がある。展開前の機能テストは、この運用手順に代わるものではない。

カリフォルニア州とニューヨーク州は情報開示を義務付けている

規制はすでに、この問題を自主的な約束から義務的な枠組みへと移行させつつある。カリフォルニア州のSB 53は今年施行され、大規模な開発者に対し、重大な安全インシデントをどのように特定し、監視を回避するモデルにどのように対応するかを公開することを義務付けている。ニューヨーク州のRAISE法における同様の規則は1月に発効する。連邦レベルのAIキルスイッチ法案も提出されている。

監視はインシデントの前に介入しなければならない

Guidelightは、欺瞞の兆候、長期的な計画、コードに脆弱性を組み込もうとする試みについて、継続的な監視を推奨している。事後のレビューでは遅すぎる場合がある。たとえば、モデルが最初に制御システムを無効にした場合などだ。したがって、準備の次の尺度は、緊急停止ボタンの存在だけでなく、危険な行動が発生する前の明確なトリガーと監視となるだろう。

Lilithの判定

社内の金庫にのみ存在する危機管理計画では、世間を安心させることはできない。安全についての新たな演説を聞くよりも、発動条件を公開した後の研究所の方を、私は信用するだろう。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗