Lilith Lilith.
編集イラスト: エージェントに広範な権限を与えすぎた結果、Codexがファイルを削除した
Lilithのイラスト · 編集リミックス

Simon Willison氏は、いくつかの報告でGPT-5.6が予期せずファイルを削除したCodexのバグについて、Thibault Sottiaux氏からの引用を強調しました。引用によると、問題は特定の権限と設定の組み合わせの下で最も頻繁に発生しました。

Codexのバグはフルアクセスモードと$HOME変数に関連

フルアクセスモードが有効で、Codexがサンドボックス保護なし、自動レビューなしで実行され、モデルが一時ディレクトリの$HOME環境変数をオーバーライドしようとして、誤ってホームディレクトリを削除したときに発生したとされています。これは、GPT-5.6が無差別にファイルを削除するケースではなく、広範な権限の結果です。

これは、コーディングエージェントで過小評価されがちなタイプの障害です。モデルがパッチを提案するだけである限り、危険には見えません。しかし、シェルアクセス、ファイルシステムアクセス、およびレビューをバイパスする方法を取得すると、変数の解釈における単純なエラーが破壊的な結果を招く可能性があります。

開発チームにとって、エージェントの安全性に対する認識は変化している

Codex、Claude Code、または社内のエージェントツールを使用するチームにとって、コーディングエージェントの安全性は、単にコードを書く能力のベンチマークではなくなりました。それは、それが動作するランタイム環境全体のアーキテクチャです。

サンドボックス化、明示的な許可リスト、破壊的な操作の確認、および監査ログは、変更を誤って提案するエージェントと、それを物理的に実行するエージェントの違いを生み出します。判断ミスは些細なことでも、その結果が深刻な場合に備えて、自動レビューが不可欠です。

フルアクセスにより、ミスの影響範囲が拡大

フルアクセスモードは摩擦を減らすため、開発者にとって便利です。エージェントは権限の承認を求める必要がなく、より多くのステップを単独で処理できます。しかし、その同じ自由は、意図しないエラーであっても、そのプロセスのすべてのエラーの影響範囲を比例して拡大させます。

このインシデントは悪意を示すものではありません。Sottiaux氏は明示的に「誠実な間違い」と説明しています。安全性の保護策は、モデルが明白で劇的な方法でしか誤りを犯さないという仮定に依存してはならないため、状況はさらに複雑になります。

ファイルシステムアクセスはセキュリティインターフェースになる必要がある

OpenAIがCodexのデフォルト設定を変更するかどうか、また、破壊的な操作や重要なパスの書き換えに対して、より厳格な承認ルールが適用されるかどうかは興味深いところです。

コーディングエージェントが開発の標準部分になる場合、ファイルの操作は、単なるシェルアクセスの自動的な副作用としてではなく、制御されたセキュリティインターフェースとして設計する必要があります。

Lilithの判定

ファイルシステムにアクセスできるエージェントは、キーボードに向かうインターンではなく、アーカイブでカートを押す事務員です。間違った通路を指示すると、キャビネット全体をシュレッダーに運んでしまうかもしれません。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗