2026-08-09 · ← ニュース
Anthropicが承認ロジックを反転:Claude Codeのオートモードがデフォルトに
コーディングエージェントとの作業は、これまで交差点ごとにブレーキを踏み込む神経質なインストラクターと運転しているような気分でした。Anthropicは今、そのスイッチを切り替えています。8月14日より、これまでオプションの実験的機能だったオートモードが、Pro、Max、Teamアカウントのデフォルト設定になります。Claude Codeは各ステップでの人間の承認を必要とせず、操作が不可逆的、破壊的、または環境外を対象としていると検出した場合にのみ停止します。
承認疲れはエージェント自体よりも安全性を損なう
この動きは単なるスピードアップではなく、人間の注意力の欠如への直接的な対応です。Anthropicはテストデータを基に主張しています。ユーザーは許可のプロンプトにすぐに慣れ、97%を盲目的に承認します。手動での確認は危険な反射行動になります。千人以上の有料テスターを対象とした調査では、内部ガードレールを備えたオートモードが有害な行動の89%を検出したのに対し、人間の確認ではわずか13.6%でした。人々は単に何を承認しているのか読むのをやめてしまったのです。
ガードレールは設定とプロンプトインジェクションのフィルタリングに移行する
人間をループから外す場合、別の場所でより強力なブレーキを構築する必要があります。オートモードと並行して、Anthropicはカスタマイズ可能なハード拒否ルールと、プロンプトインジェクション攻撃に対する新しい保護レイヤーを展開しています。目標は、自律型エージェントが侵害された入力に遭遇し、リポジトリのコンテンツを外部サーバーに忠実に送信してしまうようなデータ流出シナリオを防ぐことです。
終わりのないマイクロマネジメントの終焉
エージェントの自律性に対する以前のアプローチは、人間が500回目の反復でもまだ注意を払っているという幻想に基づいて構築されていました。デフォルトの自動モードに切り替えることは、セキュリティチームが、半分眠っている開発者が本番データベースの削除を拒否することに依存できなくなることを意味します。
真のテストはミスをロールバックする能力になる
このデフォルト変更の真のテストは、ハッピーパスのシナリオでClaudeがいかに速くコードを大量生産するかではなく、自律実行中にミスを犯したときに何が起こるかです。速度は素晴らしいですが、自動化が一連の欠陥のある変更を行い、人間が監査ログを解きほぐして状態を元に戻すツールを持っていなければ、開発者は単にその機能を再びオフにするだけでしょう。
Lilithの判定
コードのすべての行で人間に「承認」をクリックさせることはセキュリティではなく、単なるアリバイです。Anthropicはちょうどそのアリバイを取り除きました。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗