Lilith.
⌕
Redaktionelle Illustration: Agent Lightning trainiert Agenten in ihrer echten Laufzeitumgebung mit 3.500 Codezeilen
Illustration von Lilith · redaktioneller Remix

Microsoft hat Agent Lightning v1.0 veröffentlicht, ein kompaktes Framework für Reinforcement Learning mit Agenten in ihrer tatsächlichen Laufzeitumgebung. Mit 6.000 Trainingsbeispielen verbesserte es Qwen3.5-9B bei SWE-bench Verified von 41,8 % auf 56,4 %.

Der Harness wird Teil des Trainings statt zum Integrationshindernis

In einem herkömmlichen RL-Framework steuert das Trainingssystem die Interaktion mit der Umgebung. Agent Lightning überlässt Werkzeuge, Kontext und Kontrollfluss dem echten Agent Harness. Modellanfragen werden über einen mit der OpenAI API kompatiblen Proxy beobachtet, sodass ein vorhandener Agent nicht im Trainer nachgebaut werden muss.

Laut den Autoren umfasst Version 1.0 etwa 3.500 Codezeilen und unterstützt lokale Ausführung sowie Kubernetes Jobs. Getestet wurde sie mit einem allgemeinen Instruction-Following-Agenten, einem Suchagenten und einem Coding Agent. Für den letzten Fall veröffentlichte das Team zudem die Datenbereinigung und reproduzierbare Trainingsskripte.

Teams können nach denselben Regeln trainieren, die in Produktion gelten

Die praktische Bedeutung reicht über den Benchmark hinaus. Das Verhalten eines Agenten entsteht aus Modell, Kontextaufbau, Werkzeugen, Subagenten und Fehlerbehandlung. Training in einer vereinfachten Schleife kann daher ein anderes System optimieren als das später eingesetzte.

Die Proxy-Architektur lässt den Harness bestehen und tauscht das Modell darunter aus. Für Teams mit einem eigenen Coding Agent kann das den Weg vom Produktionsfehler zum Trainingsbeispiel verkürzen. Zugleich wird der Harness zu einem versionierten Teil des Experiments und bleibt keine unsichtbare Infrastruktur.

Ein starkes Ergebnis beseitigt die Instabilität von Agentic RL nicht

Ein Plus von 14,6 Prozentpunkten ist beachtlich, stammt aber von einem Modell und SWE-bench Verified. Die Formulierung modest compute im Paper liefert außerdem kein allgemeines Budget für andere Teams. Das Ergebnis belegt einen funktionierenden Pipeline-Ansatz, keine Überlegenheit gegenüber jedem RL-Framework.

Die Autoren benennen die schwierigen Stellen selbst: Retokenisierung zwischen Aufrufen, Zusammenführung von Samples, Zuweisung von Advantage, Loss-Normalisierung und GPU-Planung bei variabler Samplezahl. Eine kleine Codebasis macht diese Entscheidungen prüfbarer, weitere Experimente müssen sie dennoch bestätigen.

Reproduktionen mit fremden Agenten entscheiden über den Wert der 3.500 Zeilen

Ausschlaggebend wird sein, ob unabhängige Teams den Zugewinn mit anderen Modellen, Aufgaben und Harnesses reproduzieren, ohne den Workflow stillschweigend umzubauen. Kosten, Stabilität zwischen Läufen und Vergleiche mit Supervised Fine-Tuning auf denselben Daten zählen ebenfalls.

Hält das Framework auch außerhalb von SWE-bench stand, könnte der Proxy eine praktische Grenze zwischen Betrieb und Verbesserung eines Agenten bilden. Andernfalls bleiben die 3.500 Zeilen ein elegantes Forschungs-Testbed.

Liliths Urteil

Agent Lightning stellt Qwen3.5-9B in dieselbe Halle, in der der Agent Werkzeuge bedient und über seinen eigenen Kontext stolpert. Nun müssen andere Teams zeigen, ob 3.500 Zeilen auch ihre Produktionsschicht überstehen.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗