2026-09-25 · ← ニュース
4社のAIエージェント事故をつないだIrregularの検証環境ミス
大手AI研究所4社のモデルが、サイバーセキュリティ評価中に現実の標的へ到達した。焦点を当てるべきは、制御不能になったモデルという派手な物語より、エージェントを試す環境を誰が管理していたのかという実務的な問題だ。
4件の事故は隔離に失敗した1つのシナリオから生まれた
Irregularは、OpenAI、Anthropic、Meta、Googleのモデルを、現実のネットワークを模した環境で試験していた。同社CTOのOmer Nevoによると、エージェントは意図せず公開インターネットへ接続でき、標的として設定した架空企業の名称は実在ドメインと重複していた。この2つのミスが重なり、エージェントは現実のシステムへ向かった。
同社は4件すべてが同じ評価シナリオに由来すると説明している。7月にOpenAIのエージェントがHugging Faceを攻撃した件や、英国AI Security Instituteに関する事故とは別件だ。OpenAIとAnthropicは自社の事例を公表した一方、MetaとGoogleの関与は報道で先に明らかになった。実際に標的となった組織名は公表されていない。
モデルの安全性は検証環境の設定と切り離せない
外部へred teamingを委託するチームは、モデル、評価会社、インフラの責任を分けて考える必要がある。エージェント自身が危険な行動を取る可能性に加え、外向き通信の制御不備とドメインの衝突が、管理された試験を現実の攻撃に変えてしまう。結果にはモデル能力と試験装置の欠陥が同時に表れる。
実務上の影響は、調達契約と試験設計に及ぶ。ネットワーク範囲、ドメイン所有、人による承認、incident responseを事前に定義すべきだ。benchmarkの点数だけでは、こうした運用境界を守れない。
技術的な原因より情報開示の範囲が曖昧だ
Irregularは事故を開示したと述べるが、顧客、一般社会、別の関係者のどこまでを指すのかは不明だ。米国4社は、把握した時期、被害、今後の取引についてThe Vergeへ詳細を示さなかった。原因の仕組みは見えたが、影響の全体像はまだ見えない。
同社は、インターネット接続制御、監視、手動レビュー、試験前の範囲確認を強化したという。妥当な対策だが、現段階では提供者自身による説明にとどまる。
監査ログと共通ルールが再発防止の実効性を決める
Irregularは、安全なサイバー評価の教訓をまとめた報告書を予定している。重要なのは、外向き通信をどう試験するか、例外を誰が承認するか、被害側へ何時間で通知するか、事故を後から再現できるかという運用情報だ。
業界には、モデルや評価会社が変わっても使える標準が必要になる。それがなければ、単純なネットワーク設定ミスで始まった事故まで、AI知能の不可解な暴走として語られ続ける。
Lilithの判定
4社が同じ舞台へエージェントを送り、その舞台には現実のインターネットへ通じる窓が開いていた。恐ろしい知能は見出しになるが、今回バールを握っていたのは設定ミスのある試験環境だ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗