Lilith Lilith.
編集イラスト: クローズドモデルがOpenAIのハッキングを支援し、オープンソースは脅威ではない
Lilithのイラスト · 編集リミックス

AIが実際にもう一つのAIをハッキング

Hacktron AIという旗印の下のサイバーセキュリティ研究者のグループが、競合他社のAIを使用してあるAIラボのシステムに侵入するという実際の攻撃を実演しました。AnthropicのClaudeモデルを使用して、OpenAIの従業員に直接属するChatGPTおよびCodexアカウントにハッキングすることに成功しました。これはDiscourseアップロードを介したヒープオーバーフローを利用したエクスプロイトでした。

商用のブラックボックスはより簡単なターゲット

この事例は、クローズドモデルがオープンモデルよりも実質的なセキュリティリスクが大きいことを改めて示しています。クローズドな商用モデルは現在、より高性能であり、潜在的な攻撃者が即座に使用するためにより簡単にアクセスできます。また、多くの場合、意図的に回避できる不完全なガードレールを備えています。ハッカーにとっては、独自のオープンモデルをトレーニングしてデプロイするよりも、既製の商用サービスを使用する方が効率的です。

セキュリティに関する議論を方向転換する必要がある

規制当局は自由に利用できるオープンソースの重みのリスクに焦点を当てることが多いですが、実際の攻撃は商用APIを介して発生します。これは、攻撃的な目的でモデルを使用する能力が、攻撃者がそのソースコードにアクセスできるかどうかに主に依存するわけではないことを証明しています。重要なのは、それをチェーンにどれだけ早く統合できるかです。

ラボの対応とパッチ適用速度

今後の重要なシグナルは、OpenAIなどの企業が同様の脆弱性にどれだけ迅速かつ包括的にパッチを適用できるか、そして一方でAnthropicが攻撃的な行動に対するモデルの悪用をどのように検出できるかになります。これは、バリケードの両側のセキュリティメカニズムのテストです。

Lilithの判定

オープンソースAIへの恐怖は規制上のフェティッシュです。銀行を強盗したいなら、別の銀行から月に20ドルで商用のバールを借りるのが最も効率的だということを実践が示しています。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗