Lilith.
⌕
Ilustracja redakcyjna: Agent Lightning trenuje agentów w ich prawdziwym środowisku w 3500 liniach kodu
Ilustracja Lilith · remiks redakcyjny

Microsoft udostępnił Agent Lightning v1.0, kompaktowy framework do reinforcement learning agentów w środowisku, w którym faktycznie będą działać. Przy 6000 przykładów treningowych wynik Qwen3.5-9B w SWE-bench Verified wzrósł z 41,8 % do 56,4 %.

Harness trafia do treningu zamiast blokować integrację

W typowym frameworku RL pętla interakcji z otoczeniem należy do systemu treningowego. Agent Lightning pozostawia narzędzia, kontekst i sterowanie przepływem prawdziwemu agent harnessowi. Żądania modelu obserwuje przez proxy zgodne z OpenAI API, więc istniejącego agenta nie trzeba przepisywać wewnątrz trenera.

Według autorów wersja 1.0 liczy około 3500 linii kodu i obsługuje wykonanie lokalne oraz Kubernetes Jobs. Zespół sprawdził ją na ogólnym agencie instruction-following, agencie wyszukującym i coding agencie. Dla ostatniego scenariusza opublikował także pipeline czyszczenia danych i odtwarzalne skrypty treningowe.

Deweloperzy mogą trenować model według tych samych reguł co na produkcji

Praktyczny sens wykracza poza sam benchmark. Zachowanie agenta zależy od modelu, sposobu budowania kontekstu, narzędzi, subagentów i obsługi błędów. Trening w uproszczonej pętli może więc optymalizować inny system niż ten, który później trafia na produkcję.

Architektura proxy pozwala zachować harness i wymieniać model pod spodem. Zespołom rozwijającym własnego coding agenta może skrócić drogę od awarii produkcyjnej do przykładu treningowego. Jednocześnie harness staje się wersjonowaną częścią eksperymentu, a nie niewidoczną infrastrukturą.

Jeden mocny wynik nie usuwa niestabilności agentic RL

Wzrost o 14,6 punktu procentowego jest duży, lecz dotyczy jednego modelu i SWE-bench Verified. Określenie modest compute w paperze nie stanowi uniwersalnego budżetu dla innych zespołów. Wynik pokazuje działanie konkretnego pipeline, a nie przewagę nad każdym frameworkiem RL.

Autorzy sami wskazują trudne miejsca: retokenizację między wywołaniami, łączenie próbek, wyliczanie advantage, normalizację loss i planowanie GPU przy zmiennej liczbie próbek. Mały codebase ułatwia kontrolę tych decyzji, ale ich poprawność muszą potwierdzić kolejne eksperymenty.

Reprodukcja na cudzym agencie rozstrzygnie wartość 3500 linii

Najważniejszym sygnałem będzie niezależne odtworzenie wyniku na innych modelach, zadaniach i harnessach bez ukrytego przebudowywania workflow. Liczyć się będą też koszty, stabilność między uruchomieniami i porównanie z supervised fine-tuningiem na tych samych danych.

Jeżeli framework utrzyma wyniki poza SWE-bench, proxy może stać się praktyczną granicą między eksploatacją agenta a jego dalszym uczeniem. W przeciwnym razie 3500 linii pozostanie eleganckim testbedem badawczym.

Werdykt Lilith

Agent Lightning wprowadził Qwen3.5-9B na tę samą halę, gdzie agent używa narzędzi i potyka się o własny kontekst. Dopiero obce zespoły pokażą, czy 3500 linii wytrzyma również ich zmianę produkcyjną.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗ ↗