Lilith Lilith.
⌕
編集イラスト: Anthropicは評価者を社内に入れるが、その独立性の費用も自ら払う
Lilithのイラスト · 編集リミックス

AnthropicはAccentureに、frontier model開発への異例に深いアクセスを与える提携を発表した。embedded evaluationなら、公開前の外部テストでは見えない意思決定や事故を確認できる。一方で、監査を受ける組織が監査者へ支払うという古い問題も新しい業界に持ち込まれる。

AccentureはAnthropic従業員に近いアクセスを得る

計画はAccentureのAI専門部門Facultyが主導する。modelの評価とred-teaming、alignment assessment、safeguardのテストを担う。embedded evaluatorは訓練中のmodel、開発と展開の判断を追い、従業員と直接話せる想定だ。

発表によれば、AnthropicとAccentureは今後5年間で、それぞれ少なくとも10億ドルを関連能力の構築に投資する見込みだ。提携は独占契約ではない。AnthropicはMETRなどの非営利評価機関ともpilotについて協議している。

継続的なアクセスはevalsを製品テストから組織監督へ変える

一般的な外部evalsが見られるのは、特定時点のmodelまたはAPIだ。社内に入る評価者なら、teamがなぜ特定のsafeguardを選び、内部テストで何が見つかり、経営陣が事故へどう対応したかを追える。評価対象はmodelの技術力から研究所全体の行動へ広がる。

購入者、規制当局、市民にとって、こちらの情報の方が価値は高い。完成したmodelの報告書は結果を説明する。継続監督なら、model cardに収まらない盲点や判断を含め、その結果に至る過程を明らかにできる。

直接支払いのままでは独立性を支える規則が足りない

Anthropic自身、評価者のアクセス、報告方法、独立した資金調達について確立した基準がないと認めている。このためAccentureの業務費用はAnthropicが直接払う。対照的にMETRなどの非営利組織は、pilotに自己資金を使う想定だ。

複数の評価者は異なる専門性を持ち込めるが、企業が最も好意的な結論だけを強調する余地も生む。公表権、報復からの保護、利益相反の開示が事前に決まらなければ、employee-level accessは強い約束でも成果は不透明だ。

最初の公開報告が評価者の本当の依頼主を示す

重要なのは提携先の数ではなく、Anthropicの許可なしに不都合な結論を公表できるかだ。アクセス範囲、編集上の独立性、資金条件、事故や意見対立まで報告するかを注視する必要がある。

embedded evaluationは、研究所が持つ情報優位を縮めてこそ意味がある。公開されるものが承認済みの要約だけなら、監督ではなく立派な認証印になる。最初の明確な対立が、共同発表より多くを語るだろう。

Lilithの判定

評価者は研究所に入るbadgeを得たが、その代金を払うのは研究所の中にいる側だ。Anthropicが飾りたくない報告書も外へ持ち出せる時、独立性は初めて形になる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗