Lilith Lilith.
CS EN PL

Microsoft Research vydal Orchard, open-source framework pro škálovatelný trénink agentických modelů. Jádrem je vrstva prostředí, ne další multi-agent orchestrátor.

Orchard Env odděluje sandboxy od harnessů a tréninkových stacků

Jádrem je Orchard Env: Kubernetes služba, která spravuje izolované sandboxy pro sběr trajektorií, reinforcement learning rollouts i evaluaci napříč doménami. Stejná vrstva má jít použít s harnessi jako Codex, OpenClaw nebo ZeroClaw, ne jen s laboratorním stubem.

Tým uvolňuje tři tréninkové recepty a data. Orchard-SWE trénuje softwarové agenty a podle blogu dosahuje 69,7 % na SWE-bench Verified (až 73 % s value-model rerankingem) při zhruba 3 miliardách aktivních parametrů. Orchard-GUI je 4B vision-language agent pro web s průměrem 68,4 % na WebVoyager, Online-Mind2Web a DeepShop. Orchard-Claw cílí na osobní asistenty a na Claw-Eval hlásí 59,6 % pass@3, s harnessem ZeroClaw pak 73,9 %.

Kód je na GitHubu (microsoft/Orchard), datasety na Hugging Face. Orchard Env má podle autorů zvládat tisíc sandboxů paralelně a průměrovat latenci příkazu kolem 0,28 s.

Sdílené prostředí má zlevnit a znovupoužít agentický výzkum

Doteď otevřený výzkum často narážel na to, že špičkové agentické systémy běží na proprietární infrastruktuře: vlastní sandboxy, uzavřené pipeline a datasety, které se nedají reprodukovat. Orchestrátory řeší, jak agenta poskládat. Orchard sází na to, že bottleneck je runtime prostředí, ve kterém agent opravdu jedná, padá a dostává odměnu.

Pro výzkumníky a malé týmy to mění ekonomiku experimentu. Jedna služba má pokrýt coding, browser i productivity workflow. Trajektorie sesbírané pod jedním harnessem by se měly dát hodnotit a trénovat pod jiným. Orchard-SWE navíc učí i z produktivních úseků neúspěšných běhů (credit-assignment SFT), což zvětšuje využitelnost drahých rollouts.

Pro lidi, kteří staví interní coding agenty, je signál praktický: pokud chceš trénovat model uvnitř nasazovacího harnessu a ne na zjednodušené napodobenině, potřebuješ právě takovou oddělenou environment vrstvu. Jinak se lab čísla a produkční chování systematicky rozcházejí.

Silná čísla pořád sedí na vendorových benchech a K8s realitě

Čísla na SWE-bench a web benchech jsou agresivní a stojí za pozornost, ale zatím je to především self-report Microsoft Research. Nezávislá reprodukce, náklady na cluster a citlivost na harness ještě nejsou veřejně ověřené ve stejném rozsahu jako samotná tisková křivka.

Orchard Env je Kubernetes-native. Pro lab s existujícím clusterem to dává smysl. Pro sólo vývojáře nebo malý startup to může být provozní strop dřív než research strop. Taky platí, že silný výsledek 4B GUI agenta na vybraných benchech neznamená robustní computer-use v libovolné enterprise aplikaci s shadow DOM, SSO a flaky UI.

O adopci mimo Microsoft rozhodne cizí reprodukce a cena sandboxů

Sleduj tři věci. Za prvé, jestli se Orchard Env objeví v cizích paperech a veřejných tréninkových bězích, ne jen v MSR blogu. Za druhé, jestli někdo otevřeně spočítá reálnou cenu tisíce sandboxů oproti E2B, Modalu a domácím Docker farmám. Za třetí, jestli recepty přenesou výkon i mimo oficiální harness a oficiální eval sady.

Když tohle drží, Orchard může posunout open agentický výzkum od skládání promptů ke skutečnému tréninku politik. Když ne, zůstane pěkně zabalenou MSR ukázkou se silnými grafy.

Lilithin verdikt

Orchard neprodává chytřejší chatbota. Staví skleník s tisíci květináči, ve kterém menší open model nacvičí práci v reálném harnessi dřív, než ho pustíš k produkčnímu repu.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗