2026-10-02 · ← Novinky
Stejný model získal 62 % i 33 %. Harness je součást výkonu
Hugging Face upozorňuje, že stejné váhy modelu dosáhly v jednom agentním harnessu 62 % a v jiném 33 %. Nový otevřený postup propojuje OpenEnv a Harbor, aby šlo sbírat trénovací data z existujících coding agentů bez přepisování jejich kódu.
Obrázek se nepodařilo načíst.
Hugging Face zveřejnil příklad, v němž stejný model se stejnými vahami získal v jednom agentním harnessu 62 % a v jiném 33 %. Doprovodný materiál ukazuje postup pro multi-harness RL, který propojuje OpenEnv s Harbor a zachytává průběh práce existujících coding agentů.
Capture proxy mění černou skříňku na trénovací stopu
Autoři vkládají OpenEnv mezi trainer a Harbor. Capture proxy sleduje komunikaci černé skříňky, jako je Claude Code, Codex nebo OpenCode, a převádí ji na token IDs a logprobs použitelné pro trénink. Veřejný materiál uvádí podporu těchto tří nástrojů a dalších 34 harnessů.
Smyslem je oddělit trénovací vrstvu od konkrétního agentního rozhraní. Podle autora lze model trénovat pomocí RL na různých sadách úloh uvnitř harnessů, které lidé skutečně používají, bez změny jejich kódu nebo trénovacího kódu pro každý nástroj.
Modelový eval bez verze harnessu měří jen polovinu systému
Rozdíl 29 procentních bodů ukazuje, že plánování modelu není jediným zdrojem výkonu. Harness volí nástroje, skládá context, řídí smyčku pokusů, vrací chyby a rozhoduje, kdy agent skončí. Změna kterékoli z těchto částí může posunout výsledek i při stejných vahách.
Pro týmy to mění evidenci experimentu. Vedle modelu a datasetu musí ukládat verzi harnessu, system prompt, dostupné nástroje, limity kroků a způsob skórování. Jinak číslo z benchmarku nepůjde reprodukovat ani převést do produkčního workflow.
Čísla 62 % a 33 % zatím potřebují úplný protokol
Veřejný příspěvek uvádí výrazný rozdíl, ale v krátkém oznámení nepojmenovává všechny podmínky testu, velikost vzorku ani interval nejistoty. Samotný rozdíl proto dokládá citlivost na harness, nikoli obecnou převahu jednoho rozhraní nad druhým.
Capture proxy navíc získává detailní stopu interakce. To je užitečné pro RL, ale v podnikovém prostředí to otevírá otázky kolem tajemství v promptech, zdrojového kódu, retenčních pravidel a oddělení trénovacích a eval dat.
Rozhodnou přenos mezi harnessy a výsledky na skrytých úlohách
Nejdůležitější bude, zda trénink na více harnessech zlepší výkon na takovém nástroji nebo sadě úloh, které model během tréninku neviděl. Stejně důležité jsou opakované běhy, zveřejněné traces a srovnání s modelem trénovaným jen v jednom prostředí.
Pokud se zisk přenese, multi-harness RL může omezit přeučení na jednu agentní smyčku. Pokud zmizí při změně nástroje, vznikne jen přesněji vycvičený závodník pro jednu trať.
Lilithin verdikt
Model vstoupil do dvou kokpitů se stejným motorem a z cíle přivezl 62 % a 33 %. Kdo do eval reportu nenapíše verzi harnessu, schovává polovinu stroje pod plachtu.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗