Lilith Lilith.
⌕
編集イラスト: OpenAI、frontierモデルの学習前にSafety Caseを求める
Lilithのイラスト · 編集リミックス

OpenAIは、frontierモデルのreinforcement learningを続行する前に、証拠に基づく構造化されたSafety Caseを用意すべきだとしている。完成したモデルを後から評価するのではなく、次の学習を実行してよいかという判断そのものに安全性を組み込む提案だ。

安全性の論証を次の学習より先に置く

提案された枠組みは、alignment training、containment、monitoringという技術層の3領域を扱う。さらに、運用手順、説明責任、社内透明性、停止やロールバックの仕組み、misalignment事案の調査も含む。

OpenAI自身もSafety Caseを目標と位置づけ、航空や原子力と同等の厳密な標準が完成したとは主張していない。一次ページは独立検証時にブロックされたため、詳細はOpenAIの検索インデックスと関連分析に転載された引用に基づいている。

評価項目の追加より判断ゲートが重要になる

研究チームにとって重要なのは順序だ。高コストの学習を始める前に、主張、証拠、前提、残余リスクを結び付けた論証を完成させる必要がある。安全性は完成後に添付する報告書ではなく、作業開始の条件になり得る。

この仕組みを採用する研究所は、リスクの責任者、必須の承認者、技術的な異論が計算を止める地点を明示しなければならない。

独立した反証がなければ社内文書の弱さは残る

同じ組織が作成し承認するSafety Caseには、慎重に書かれていても利益相反が残る。どの証拠を公開するのか、誰が異議を唱えられるのか、経営陣が技術的な拒否権を覆せるのかは未確定だ。

個々には無害に見える行動が長い連鎖で危険になる場合も、monitoringは捉える必要がある。OpenAIは従来の事前evalsが見逃したlong horizonモデルの失敗をすでに報告している。

最初に中止される学習が枠組みの重さを示す

公開されるSafety Case、外部評価者の参加、明確な拒否権の規則に注目したい。証拠が足りないため予定された学習が延期または中止される事例が、最も強い指標になる。その時初めて、文書は決定を説明するだけでなく、実際に決定を動かす。

Lilithの判定

Safety Caseの価値は、高額な学習の途中で誰かが本当に赤い停止ボタンを押せるかで決まる。押せない文書は、同じ計算施設へ入るための丁寧な通行証にすぎない。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗