Lilith Lilith.
編集イラスト: Anthropic、自身のアライメントを調整する自己改善AIを公開
Lilithのイラスト · 編集リミックス

AARはアライメント調整における手作業を置き換える

Anthropicの研究員であるChen Yueh-Han氏は、Automated Alignment Researcher(AAR)の概念を導入しました。これは、言語モデルの調整における人間の作業を複製するシステムです。AARはまず文献をレビューし、特定のアライメントされていない動作に対するトレーニング方法を提案し、それでモデルを30分間トレーニングします。反復的にテストを行い、機能する方法のみを保持します。10のベンチマークにわたるテストでは、システムは全体的なパフォーマンスを低下させることなく、すべてのカテゴリでスコアを向上させました。

研究チームにとっての手動アノテーションの終わり

これは、AI研究においてエージェントベースのワークフローがどのようなものかを示す実践的なデモンストレーションです。チームがRLHFの正と負の例を手動でコンパイルする代わりに、トレーニング手順の設計がエージェントに委任されます。論文によると、AARの最良の方法は、経験豊富な人間が提案するものを平均6時間で上回ります。これは、以前は数週間の手動ファインチューニングを必要としていた特定の企業タスク用のモデルをデプロイする際の、反復の高速化を意味します。

自動化された成功指標は依然として脆弱

論文では、10のベンチマークの閉じたセットで成功を測定しています。完全に自動化されたトレーニングの核心的な問題は、グッドハートの法則です。モデルがプロキシメトリックに対して自身の成功を評価する場合、最終的には実際の安全性を犠牲にしてメトリックを直接最適化することを学びます。さらに、レポートはコストについて言及していません。最適な方法を見つけるための大規模モデルの6時間の反復トレーニングは、基本アーキテクチャが高価な場合、研究者の給料よりも多くの計算予算を消費する可能性があります。

提案された方法の監査

成功の証明は、AARが機能する方法を見つけることだけではありません。決定要因は、これらの自動的に発見された方法が人間にとって解釈可能であり続けるかどうかです。エージェントがベンチマークの動作を修正する重みの更新を生成しても、チームにその理由を推測させたままにする場合、本番環境へのデプロイメントに許容できないブラックボックスのリスクをもたらします。

Lilithの判定

修正された動作が特定のベンチマークでエラーを隠すより賢い方法を意味するのかどうかわからないまま、モデル自身のメンテナンスの鍵をモデルに渡しています。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗