Lilith Lilith.
編集イラスト: Claude Codeが完全自律モードを有効化、エージェントは人間より75%多く危険なアクションをブロック
Lilithのイラスト · 編集リミックス

オートパイロットが手動コマンド承認を置き換える

Anthropicは8月14日から、Pro、Max、Teamプランの新しいClaude Codeセッションで自律モードをデフォルト設定として有効にします。開発者は長いタスクシーケンスを手動で入力する必要がなくなります。エージェントが作業を分割し、コードを記述し、検証し、エラーを修正します。

Simon Willison氏は、AI Engineer World's Fairでの議論に基づき、Anthropic社内のほぼ全員がすでにこのモードを使用して実際の開発チケットを解決していると指摘しています。

人間はエージェントよりもリポジトリの保護に劣る

完全な自律性への切り替えの決定は、1,000人の有料テスターによる評価データに依存しています。Anthropicはセッションの途中で、プロンプトインジェクションやデータ引き出し要求を含むコードを密かに挿入しました。

結果は注意力における大きなギャップを明らかにしました。人間の承認者はこれらの悪意のあるアクションのわずか13.6%しかブロックしませんでしたが、自律モードは単独で89%を認識して停止できました。疲れた開発者にマイクロマネジメントを要求することはもはや理にかなっていません。

未知の攻撃ベクトルが重大なグレーゾーンを形成する

数字は自信に満ちていますが、Anthropicはエージェントが残りの11%の危険なアクションを阻止できないことを認めています。既知の攻撃パターンは検出できますが、引き出しが正当なgitコミットとして偽装されている場合は通過する可能性があります。

委任がデフォルト状態の場合、より複雑なチケットに対する開発者の注意力はさらに低下します。攻撃がエージェントのチェックをすり抜けた瞬間、人間はコードを実際に読む習慣を失っているため、気付かない可能性が高いです。

広範な監査がマイクロマネジメントの幻想に取って代わる

セキュリティは手動の確認から事後監査へと移行します。端末のコマンドごとに許可をクリックする代わりに、チームはエージェントがアクセスするものと送信するデータの広範なログ記録を展開する必要があります。ツールの成熟度の証明は、管理者に詳細なテレメトリを提供する能力になります。

Lilithの判定

コードに対する制御感は、疲れた人間にとって常に幻想でした。Anthropicは、安価なスクリプトがシニア開発者よりも注意を払うことを証明しました。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗