Lilith.
⌕
編集イラスト: Agent Lightningは3500行で実運用ハーネス内のエージェントを訓練する
Lilithのイラスト · 編集リミックス

Microsoftは、実際の運用環境にエージェントを置いたままreinforcement learningを行う小規模なframework、Agent Lightning v1.0を公開した。6000件の訓練例により、Qwen3.5-9BのSWE-bench Verifiedスコアは41.8%から56.4%へ上昇した。

ハーネスが統合の障害ではなく訓練の一部になる

従来のRL frameworkでは、訓練システムが環境とのやり取りを管理する。Agent Lightningは、ツール、コンテキスト、制御フローを実際のagent harnessに任せる。OpenAI API互換のproxyを通じてモデルへの要求を観測するため、既存エージェントをtrainer内に作り直す必要がない。

著者によると、v1.0は約3500行で、ローカル実行とKubernetes Jobsに対応する。一般的なinstruction-following agent、検索agent、coding agentで検証され、coding向けにはデータ洗浄pipelineと再現可能な訓練scriptも公開された。

開発者は本番と同じ規則に沿ってモデルを改善できる

実務上の意味はbenchmarkの数字だけではない。エージェントの挙動はモデルに加え、コンテキストの組み立て方、ツール、subagent、障害からの復旧によって決まる。単純化したloopでの訓練は、本番とは別のシステムを最適化する恐れがある。

proxy architectureならharnessを維持したまま、その下のモデルを交換できる。独自のcoding agentを作るチームにとって、本番障害を訓練例へ変えるまでの距離を縮められる可能性がある。同時にharnessも、背景のインフラではなくversion管理すべき実験要素になる。

一つの好成績だけではagentic RLの不安定さは消えない

14.6ポイントの改善は大きいが、対象は一つのモデルとSWE-bench Verifiedに限られる。paperが述べるmodest computeも、どのチームにも当てはまる予算ではない。この結果が示すのは一つのpipelineの実現可能性であり、全RL frameworkへの優位性ではない。

著者自身も、呼び出し間のretokenization、sampleの統合、advantageの割り当て、loss normalization、sample数が変動する場合のGPU schedulingを難所に挙げる。小さなcodebaseは選択を検証しやすくするが、その妥当性は追加実験で確かめる必要がある。

他のエージェントでの再現が3500行の価値を決める

独立したチームが、workflowを密かに作り直すことなく、別のモデル、課題、harnessで改善を再現できるかが重要になる。費用、実行ごとの安定性、同じデータを使ったsupervised fine-tuningとの比較も見るべき指標だ。

SWE-bench以外でも成果が続けば、このproxyはエージェントの運用と改善を結ぶ実用的な境界になり得る。続かなければ、3500行は洗練された研究用testbedにとどまる。

Lilithの判定

Agent LightningはQwen3.5-9Bを、エージェントがツールを扱い自分のコンテキストにつまずく現場へ連れてきた。3500行が他社の本番シフトにも耐えるかは、独立したチームの再現が決める。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗