2026-10-07 · ← Novinky
Agent Lightning trénuje agenty v jejich skutečném prostředí a stačí mu 3 500 řádků
Microsoft představil Agent Lightning v1.0, framework o zhruba 3 500 řádcích, který zapojuje skutečný agentní harness přímo do reinforcement learning. Na Qwen3.5-9B zvedl výsledek SWE-bench Verified z 41,8 % na 56,4 % s 6 000 trénovacími příklady.
Obrázek se nepodařilo načíst.
Microsoft vydal Agent Lightning v1.0, kompaktní framework pro reinforcement learning agentů v prostředí, ve kterém budou opravdu pracovat. S 6 000 trénovacími příklady zlepšil Qwen3.5-9B na SWE-bench Verified z 41,8 % na 56,4 %.
Harness se stal součástí tréninku, ne překážkou před ním
Běžný RL framework si řídí interakci s prostředím sám. Agent Lightning místo toho nechává řízení nástrojů, kontextu a toku práce skutečnému agentnímu harnessu. Požadavky modelu sleduje přes proxy kompatibilní s OpenAI API, takže se existující agent nemusí přepisovat do trénovacího systému.
Verze 1.0 má podle autorů přibližně 3 500 řádků kódu a podporuje lokální běh i Kubernetes Jobs. Tým ji ověřil na obecném instruction-following agentovi, vyhledávacím agentovi a coding agentovi. Pro poslední scénář zveřejnil také čištění dat a reprodukovatelné skripty.
Vývojáři mohou ladit model proti stejným pravidlům, která řídí produkci
Praktická pointa leží mimo samotný benchmark. Chování agenta neurčuje jen model, ale také způsob skládání kontextu, nástroje, subagenti a zotavení po chybě. Trénink ve zjednodušené smyčce proto může optimalizovat jiný systém, než jaký se později nasadí.
Proxy architektura dovoluje ponechat harness na místě a měnit model pod ním. Pro týmy s vlastním coding agentem to může zkrátit cestu od produkčního selhání k trénovacímu příkladu. Současně se ale z harnessu stává verzovaná součást experimentu, nikoli pouhá infrastruktura.
Jeden silný výsledek ještě neřeší nestabilitu agentního RL
Zlepšení o 14,6 procentního bodu je výrazné, ale pochází z jednoho modelu a SWE-bench Verified. Označení modest compute navíc v paperu nenahrazuje univerzální rozpočet pro každý tým. Výsledek ukazuje proveditelnost konkrétního workflow, ne obecnou převahu nad všemi RL frameworky.
Autoři sami popisují těžké části: retokenizaci mezi voláními, slučování vzorků, přidělování advantage, normalizaci loss a plánování GPU při proměnlivém počtu vzorků. Malý codebase tyto volby zpřehlední, ale jejich správnost musí potvrdit další experimenty.
Reprodukce na cizím agentovi ukáže hodnotu 3 500 řádků
Rozhodující bude, zda nezávislé týmy zopakují výsledek na jiných modelech, úlohách a harnessech bez skrytého přepisování workflow. Důležité budou také náklady, stabilita mezi běhy a porovnání se supervised fine-tuningem na stejných datech.
Pokud framework udrží výsledky i mimo SWE-bench, může se z proxy stát praktické rozhraní mezi provozem agenta a jeho dalším učením. Pokud ne, zůstane 3 500 řádků elegantním výzkumným testbedem.
Lilithin verdikt
Agent Lightning přivedl Qwen3.5-9B do stejné haly, kde agent sahá na nástroje a zakopává o vlastní kontext. Teprve cizí týmy ukážou, zda 3 500 řádků unese i jejich provozní směnu.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗