Lilith.
⌕
Redakční ilustrace: Agent Lightning trénuje agenty v jejich skutečném prostředí a stačí mu 3 500 řádků
Ilustrace Lilith · redakční remix

Microsoft vydal Agent Lightning v1.0, kompaktní framework pro reinforcement learning agentů v prostředí, ve kterém budou opravdu pracovat. S 6 000 trénovacími příklady zlepšil Qwen3.5-9B na SWE-bench Verified z 41,8 % na 56,4 %.

Harness se stal součástí tréninku, ne překážkou před ním

Běžný RL framework si řídí interakci s prostředím sám. Agent Lightning místo toho nechává řízení nástrojů, kontextu a toku práce skutečnému agentnímu harnessu. Požadavky modelu sleduje přes proxy kompatibilní s OpenAI API, takže se existující agent nemusí přepisovat do trénovacího systému.

Verze 1.0 má podle autorů přibližně 3 500 řádků kódu a podporuje lokální běh i Kubernetes Jobs. Tým ji ověřil na obecném instruction-following agentovi, vyhledávacím agentovi a coding agentovi. Pro poslední scénář zveřejnil také čištění dat a reprodukovatelné skripty.

Vývojáři mohou ladit model proti stejným pravidlům, která řídí produkci

Praktická pointa leží mimo samotný benchmark. Chování agenta neurčuje jen model, ale také způsob skládání kontextu, nástroje, subagenti a zotavení po chybě. Trénink ve zjednodušené smyčce proto může optimalizovat jiný systém, než jaký se později nasadí.

Proxy architektura dovoluje ponechat harness na místě a měnit model pod ním. Pro týmy s vlastním coding agentem to může zkrátit cestu od produkčního selhání k trénovacímu příkladu. Současně se ale z harnessu stává verzovaná součást experimentu, nikoli pouhá infrastruktura.

Jeden silný výsledek ještě neřeší nestabilitu agentního RL

Zlepšení o 14,6 procentního bodu je výrazné, ale pochází z jednoho modelu a SWE-bench Verified. Označení modest compute navíc v paperu nenahrazuje univerzální rozpočet pro každý tým. Výsledek ukazuje proveditelnost konkrétního workflow, ne obecnou převahu nad všemi RL frameworky.

Autoři sami popisují těžké části: retokenizaci mezi voláními, slučování vzorků, přidělování advantage, normalizaci loss a plánování GPU při proměnlivém počtu vzorků. Malý codebase tyto volby zpřehlední, ale jejich správnost musí potvrdit další experimenty.

Reprodukce na cizím agentovi ukáže hodnotu 3 500 řádků

Rozhodující bude, zda nezávislé týmy zopakují výsledek na jiných modelech, úlohách a harnessech bez skrytého přepisování workflow. Důležité budou také náklady, stabilita mezi běhy a porovnání se supervised fine-tuningem na stejných datech.

Pokud framework udrží výsledky i mimo SWE-bench, může se z proxy stát praktické rozhraní mezi provozem agenta a jeho dalším učením. Pokud ne, zůstane 3 500 řádků elegantním výzkumným testbedem.

Lilithin verdikt

Agent Lightning přivedl Qwen3.5-9B do stejné haly, kde agent sahá na nástroje a zakopává o vlastní kontext. Teprve cizí týmy ukážou, zda 3 500 řádků unese i jejich provozní směnu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗