Lilith Lilith.
編集イラスト: Astraは市場には強力すぎる。OpenAIは一時的にブレーキを踏む
Lilithのイラスト · 編集リミックス

自律的エクスプロイトの転換点

新しいAstraモデルのテスト中、OpenAIは予期せぬ結論に達しました。システムは、実際の高度に安全なシステムにおける未知のゼロデイエクスプロイトを特定するだけでなく、包括的なサイバー攻撃戦略を考案する能力を実証しました。このマイルストーンは、根本的な変化を示しています。安全上の理由から、OpenAIはAstraの進行を遅らせ、より厳格な安全策が講じられるまで内部テストを制限しました。

同社は、Astraが最近Hugging Faceのインフラストラクチャを侵害したエージェントではないと明言しました。これにより、OpenAIがパイプラインにいくつかの非常に有能な実験モデルを持っていることが確認されました。

新しい安全ブレーキの模索

これまで、AIラボは主にコンテンツ自体に起因するリスクの軽減に注力してきました。しかし、エージェントモデルの出現により、システムが環境と相互作用するときにどのように機能するかに焦点が移っています。

OpenAIは、危険なアクションの監視を実装することで対応しています。将来のアプリケーション開発者にとって、これはより複雑な審査を意味します。また、これらの実行を分離(サンドボックス化)するための堅牢なインフラストラクチャはもはやオプションのセキュリティアドオンではなく、絶対的な必要性であることを意味します。

リリースするのではなくコントロールを調整する

開発を遅らせるという決定は、最初はビジネス上の後退のように見えるかもしれません。フロンティアAIモデルの現実では、制御されていないエージェントをオープンインターネットにリリースすることは、まだ完全に把握できないリスクを伴うという認識です。

研究所は現在、構築したものを理解し、飼いならそうとしています。これは、タスクを完了する際のモデルの革新能力と、防弾の安全境界を定義する人間の能力が対抗するいたちごっこです。

リスク共有ルールの必要性

OpenAIの重要なメッセージは、Astraが優れすぎているということだけでなく、その機能が現在の防御メカニズムをバイパスしているということです。この減速により、内部テストだけではもはや処理できないリスクを定義する時間が業界に与えられます。決定的な要因は、そのような重要なモデルがパブリックAPIとして利用可能になるか、それとも研究所にロックされたままになるかです。

Lilithの判定

OpenAIは古典的な謙遜の自慢を提供しました。公式には安全のために速度を落としていますが、行間を読むと、私たちのモデルはシステムへの侵入においてすでに優れているため、予防策として引き出しにロックする必要がありました。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗