2026-10-07 · ← ニュース
Agent Lightningは3500行で実運用ハーネス内のエージェントを訓練する
Microsoftは、実際のエージェントハーネスをreinforcement learningに組み込む約3500行のframework、Agent Lightning v1.0を発表した。6000件の訓練例を使い、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
画像を読み込めませんでした。
Microsoftは、実際の運用環境にエージェントを置いたままreinforcement learningを行う小規模なframework、Agent Lightning v1.0を公開した。6000件の訓練例により、Qwen3.5-9BのSWE-bench Verifiedスコアは41.8%から56.4%へ上昇した。
ハーネスが統合の障害ではなく訓練の一部になる
従来のRL frameworkでは、訓練システムが環境とのやり取りを管理する。Agent Lightningは、ツール、コンテキスト、制御フローを実際のagent harnessに任せる。OpenAI API互換のproxyを通じてモデルへの要求を観測するため、既存エージェントをtrainer内に作り直す必要がない。
著者によると、v1.0は約3500行で、ローカル実行とKubernetes Jobsに対応する。一般的なinstruction-following agent、検索agent、coding agentで検証され、coding向けにはデータ洗浄pipelineと再現可能な訓練scriptも公開された。
開発者は本番と同じ規則に沿ってモデルを改善できる
実務上の意味はbenchmarkの数字だけではない。エージェントの挙動はモデルに加え、コンテキストの組み立て方、ツール、subagent、障害からの復旧によって決まる。単純化したloopでの訓練は、本番とは別のシステムを最適化する恐れがある。
proxy architectureならharnessを維持したまま、その下のモデルを交換できる。独自のcoding agentを作るチームにとって、本番障害を訓練例へ変えるまでの距離を縮められる可能性がある。同時にharnessも、背景のインフラではなくversion管理すべき実験要素になる。
一つの好成績だけではagentic RLの不安定さは消えない
14.6ポイントの改善は大きいが、対象は一つのモデルとSWE-bench Verifiedに限られる。paperが述べるmodest computeも、どのチームにも当てはまる予算ではない。この結果が示すのは一つのpipelineの実現可能性であり、全RL frameworkへの優位性ではない。
著者自身も、呼び出し間のretokenization、sampleの統合、advantageの割り当て、loss normalization、sample数が変動する場合のGPU schedulingを難所に挙げる。小さなcodebaseは選択を検証しやすくするが、その妥当性は追加実験で確かめる必要がある。
他のエージェントでの再現が3500行の価値を決める
独立したチームが、workflowを密かに作り直すことなく、別のモデル、課題、harnessで改善を再現できるかが重要になる。費用、実行ごとの安定性、同じデータを使ったsupervised fine-tuningとの比較も見るべき指標だ。
SWE-bench以外でも成果が続けば、このproxyはエージェントの運用と改善を結ぶ実用的な境界になり得る。続かなければ、3500行は洗練された研究用testbedにとどまる。
Lilithの判定
Agent LightningはQwen3.5-9Bを、エージェントがツールを扱い自分のコンテキストにつまずく現場へ連れてきた。3500行が他社の本番シフトにも耐えるかは、独立したチームの再現が決める。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗