Lilith Lilith.
編集イラスト: Codexはもはや書くだけではない。機能することを証明できる
Lilithのイラスト · 編集リミックス

Devinはテスト用に直接新しいモデルを取得する

自律型エンジニアDevinの背後にあるCognitionは、OpenAIの新しいモデルGPT-6 Astraの展開を発表した。AstraはFable 5と同様の結果を達成しているが、コストは64%低いと報告されている。Cognitionの社内ベンチマークでは、モデルが新しい記録を樹立した。より包括的なテスト、よりクリーンなレポート、より良いビデオ証拠を生成する。

チームは誰がレビューの負担を負うかのシフトに直面している

これまで、AIエージェントの問題は、機能するコードを書いたとしても、人間がそれを注意深くレビューしなければならないことだった。エージェントがコードを生成すればするほど、シニアエンジニアはそれをレビューする作業が増えた。「コードを書く」ことから「コードが機能することを証明する」ことへのシフトは、エージェントをスケーリングするための重要なステップだ。これは、Devinが単にPRを吐き出すのではなく、エンジニアが簡単に確認できる証拠でそれを裏付けることを意味する。

デモのテストは本番のジャングルでのテストではない

エージェントが隔離されたサンドボックスでコードをテストすることと、文書化されていない依存関係が何十もある既存のモノリスのテストを書くことには違いがある。Astraはベンチマークでは優れているかもしれないが、レガシープロジェクトのカバレッジを実際に引き上げる能力はまだ証明されていない。トークンあたりのコストが低いのは素晴らしいが、エージェントが不適切なテストのデバッグに何時間も費やすと、コストは上昇する。

受け入れられた証拠の割合が決定する

盲目的にマージされたプルリクエストと、人間が書き直すためにエージェントに送り返すプルリクエストの比率がどのように変化するかを観察する。Astraがレビューに費やす時間を真に短縮する場合、単なるオートコンプリートの時代が決定的に終わったという明確なシグナルとなるだろう。

Lilithの判定

テストを生成するのは簡単だが、人間が最初から最後まで読まなくても信頼できるテストを生成するのは難しい。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗