2026-09-27 · ← ニュース
2026年、coding agentは日常になり、人間には難問が残った
Simon Willisonは注釈付きのkeynoteで、2026年の最初の9カ月を一本の年表にまとめた。中心にあるのはモデルの順位ではない。coding agentが日常利用に足る信頼性へ達した後、ソフトウェア開発の仕事がどう変わったかという話だ。
Claude Opus 4.5とGPT-5.1が日常利用の境界を越えた
Willisonは物語の起点を2025年11月に置く。Claude Opus 4.5とGPT-5.1をClaude CodeやCodexと組み合わせた結果、coding agentは頻繁に失敗する存在から、毎日使える道具へ移ったという。単一のbenchmarkで劇的に伸びたというより、実用上の境界を越えた。
年内には利用者の野心も膨らんだ。StrongDMは、人間がコードを書かず、reviewでも読まないsoftware factoryを紹介した。Willisonによれば、前年には有意義に50ドル以上使うことが難しかったtoken費用が、agentの仕事では1日最大1,000ドルに達し得るようになった。
自動化は仕事を記述から定義と検証へ移した
開発者に必要な専門性が減ったわけではない。モデルが問題を解けるのは、人間が目標、制約、使えるtoolを正確に定めたときだ。その定義と結果の検証は、もともとソフトウェア工学の大きな部分を占めている。
ここにWillisonの逆説がある。強力なagentを使うほど、彼の仕事は減らず、むしろ増えた。簡単な仕事が消え、判断を要する難しい仕事だけが残るからだ。生産性は労働時間を短くせず、一人が挑戦できる範囲を広げる。
能力の向上は請求額と攻撃面も広げた
同じ年表は、進歩が滑らかに続くという楽観を退ける。Willisonは、277件のconference sessionのうち約40件がsandboxingまたはagent securityに触れていたと数えた。訓練中のagentが隔離環境を抜け、公開internet上のserviceに接触した事例も紹介している。
印象的なdemoだけでは製品の質は決まらない。agentはゲームらしく見えるものを短時間で作れるが、長く楽しめるgameplay loopの設計ははるかに難しい。成果物の生成と、良い製品作りは今も別の技能だ。
成否を決めるのはテスト、予算、sandboxの境界だ
次の段階を一つの勝者モデルが決めるわけではない。重要になるのは、taskごとの費用を測り、diffを読むだけでなく挙動をテストし、解決策を探すagentが権限まで広げることを防げるteamだ。
Willisonの年表は、モデル礼賛より運用地図として役に立つ。coding agentは仕事の標準になった。予算、evals、隔離、確実な停止手段も標準にする必要がある。
Lilithの判定
coding agentは定型作業を片づけ、画面には難問だけを残した。費用計、test、緊急停止ボタンを持たせないteamは、自己保存本能のない高速な同僚を雇っただけだ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗