2026-10-07 · ← News
Agent Lightning trainiert Agenten in ihrer echten Laufzeitumgebung mit 3.500 Codezeilen
Microsoft hat Agent Lightning v1.0 vorgestellt, ein Framework mit rund 3.500 Codezeilen, das den echten Agent Harness in das Reinforcement Learning einbezieht. Mit 6.000 Trainingsbeispielen stieg Qwen3.5-9B bei SWE-bench Verified von 41,8 % auf 56,4 %.
Das Bild konnte nicht geladen werden.
Microsoft hat Agent Lightning v1.0 veröffentlicht, ein kompaktes Framework für Reinforcement Learning mit Agenten in ihrer tatsächlichen Laufzeitumgebung. Mit 6.000 Trainingsbeispielen verbesserte es Qwen3.5-9B bei SWE-bench Verified von 41,8 % auf 56,4 %.
Der Harness wird Teil des Trainings statt zum Integrationshindernis
In einem herkömmlichen RL-Framework steuert das Trainingssystem die Interaktion mit der Umgebung. Agent Lightning überlässt Werkzeuge, Kontext und Kontrollfluss dem echten Agent Harness. Modellanfragen werden über einen mit der OpenAI API kompatiblen Proxy beobachtet, sodass ein vorhandener Agent nicht im Trainer nachgebaut werden muss.
Laut den Autoren umfasst Version 1.0 etwa 3.500 Codezeilen und unterstützt lokale Ausführung sowie Kubernetes Jobs. Getestet wurde sie mit einem allgemeinen Instruction-Following-Agenten, einem Suchagenten und einem Coding Agent. Für den letzten Fall veröffentlichte das Team zudem die Datenbereinigung und reproduzierbare Trainingsskripte.
Teams können nach denselben Regeln trainieren, die in Produktion gelten
Die praktische Bedeutung reicht über den Benchmark hinaus. Das Verhalten eines Agenten entsteht aus Modell, Kontextaufbau, Werkzeugen, Subagenten und Fehlerbehandlung. Training in einer vereinfachten Schleife kann daher ein anderes System optimieren als das später eingesetzte.
Die Proxy-Architektur lässt den Harness bestehen und tauscht das Modell darunter aus. Für Teams mit einem eigenen Coding Agent kann das den Weg vom Produktionsfehler zum Trainingsbeispiel verkürzen. Zugleich wird der Harness zu einem versionierten Teil des Experiments und bleibt keine unsichtbare Infrastruktur.
Ein starkes Ergebnis beseitigt die Instabilität von Agentic RL nicht
Ein Plus von 14,6 Prozentpunkten ist beachtlich, stammt aber von einem Modell und SWE-bench Verified. Die Formulierung modest compute im Paper liefert außerdem kein allgemeines Budget für andere Teams. Das Ergebnis belegt einen funktionierenden Pipeline-Ansatz, keine Überlegenheit gegenüber jedem RL-Framework.
Die Autoren benennen die schwierigen Stellen selbst: Retokenisierung zwischen Aufrufen, Zusammenführung von Samples, Zuweisung von Advantage, Loss-Normalisierung und GPU-Planung bei variabler Samplezahl. Eine kleine Codebasis macht diese Entscheidungen prüfbarer, weitere Experimente müssen sie dennoch bestätigen.
Reproduktionen mit fremden Agenten entscheiden über den Wert der 3.500 Zeilen
Ausschlaggebend wird sein, ob unabhängige Teams den Zugewinn mit anderen Modellen, Aufgaben und Harnesses reproduzieren, ohne den Workflow stillschweigend umzubauen. Kosten, Stabilität zwischen Läufen und Vergleiche mit Supervised Fine-Tuning auf denselben Daten zählen ebenfalls.
Hält das Framework auch außerhalb von SWE-bench stand, könnte der Proxy eine praktische Grenze zwischen Betrieb und Verbesserung eines Agenten bilden. Andernfalls bleiben die 3.500 Zeilen ein elegantes Forschungs-Testbed.
Liliths Urteil
Agent Lightning stellt Qwen3.5-9B in dieselbe Halle, in der der Agent Werkzeuge bedient und über seinen eigenen Kontext stolpert. Nun müssen andere Teams zeigen, ob 3.500 Zeilen auch ihre Produktionsschicht überstehen.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗