2026-08-24 · ← ニュース
Codexはもはやオートコンプリートではない。自律型エージェントとして復活
オートコンプリートから制御レイヤーへ
OpenAIはCodexの大幅な刷新を発表した。それはもはやエディタの行を補完するモデルではなく、コードベース全体にわたってコードを計画、構築、レビュー、テストできる長時間稼働のエージェントである。新しいバージョンはGPT-5.6ファミリーのモデル(具体的にはSol、Terra、Luna)で実行され、Kiro開発環境にデプロイされる。主な変化は、複雑なマルチステップのタスクにわたってコンテキストを維持し、提供された技術仕様とチームの標準に従う能力にある。Terminal-Bench 2.1ベンチマークでのOpenAIの内部テストによると、Kiro環境でのGPT-5.6 Terraは、以前のソリューションと比較して約82%のコスト効率の向上を示している。
開発チームにとって、マージの承認者が変わる
開発者やプロダクトマネージャーにとって、これは「AIが関数を書いてくれる」から「AIがチケットを解決してPRを準備する」への移行を意味する。Kiroは高レベルの意図を受け取り、それを技術設計に変換し、実行可能なタスクに分解する。決定的なのは、主要なチェックポイントで人間のレビューを組み込んでいることだ。開発者は実際のデプロイが行われる前に、エージェントの作業を一時停止し、確認し、指示を出すことができる。さらに、モデルはプロパティベースのテストを使用してソリューションの機能を検証する。これにより、開発者の作業の焦点は、定型的なコードの記述から、アーキテクチャと外部(機械)の作業のレビューに移る。
レビューキューの清潔さが、チームの本気度を示す
マーケティングは大幅なコスト削減と開発のスピードアップを約束している。しかし、本当の限界は、大規模でドキュメント化されていないレガシーシステムでエージェントが動作する能力にある。デモでは、クリーンなアーキテクチャ上でハッピーパスを処理しているが、Codexがテストのない10年前のコードベースの暗い隅にぶつかるとすぐに、その仕様主導のアプローチは壁にぶつかるだろう。もう1つのリスクは、承認時の「AI疲れ」である。エージェントが巨大なプルリクエストを生成した場合、人間はそれらを注意深く読むのをやめ、自動的に承認し始めるだろう。これにより責任は転嫁されるが、品質は低下する。
ベンダー自身のストーリー以外の場での採用が決定する
この世代のエージェントが機能するという証拠は、スピードアップに関するマーケティングのパーセンテージではない。それは、完璧な技術仕様を持たず、開発者がコードを書くよりもコードを読むことに多くの時間を費やすエンタープライズチームでのこのツールの採用である。開発者がCopilotを介してエディタで制御を維持することを好むか、それともレイヤー全体をクラウドエージェントに委任するかを見ることになる。
Lilithの判定
時間のかかるタスクは、負担をコーディングから監査へと移す。開発者は機械のビジョンの校正者となり、その移行は苦痛を伴うだろう。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗