2026-09-03 · ← Novinky
RL přesouvá vnímání krásy z člověka na model
Když odměnou není správný výsledek, ale vkus
Současné RL modely se nejčastěji trénují na matematice nebo logice, kde je výsledek ověřitelný (test projde nebo selže). Inženýr Sergio Paniego nyní publikoval otevřenou replikaci dřívějšího virálního experimentu s p5.brush, ve které demonstruje, že Reinforcement Learning dokáže úspěšně optimalizovat i subjektivní estetiku.
Zatímco původní model se učil malovat izolované květiny ze zpětné vazby na textové podněty, tento otevřený postup cvičí model Qwen3.5-35B tak, aby vygeneroval rovnou 150 řádků JavaScriptu pro celou kompozici. Trik spočívá v odměňovací funkci: model nedostává body za přesnost, ale za styl. Skóre se skládá z 60 % z párového hodnocení jiným vision modelem proti ručně vytříděné sadě „krásných“ obrázků a z 30 % preferenčního modelu HPSv3.
Generování kódu se mění z funkce na plnohodnotné řemeslo
Jde o významný posun pro využití open-source nástrojů, jmenovitě platformy TRL a OpenEnv. Kód už tu neslouží jen jako pomocník na vyhledání dat, ale jako samotný umělecký nástroj. Tím, že model omezili na pouhých deset metod knihovny (např. rozpíjení barvy, tahy), ho přinutili soustředit se na styl místo na technickou složitost. Všechny komponenty, včetně referenční datové sady a modelu pro odměňování, jsou nyní veřejně dostupné na Hugging Face, což otevírá cestu k levnému a replikovatelnému RL fine-tuningu na estetiku komukoliv s přístupem ke GPU.
Rychlé vizuální demo zatím naráží na křehkost infrastruktury
Otevření postupu naráží na realitu provozu. Během trénování inženýr odhalil, že chyba v síťové vrstvě nesmí vracet nulové skóre. Pokud by to dělala, model by začal chybně trestat platný, ale pomalu renderovaný kód, což by proces učení zcela zničilo. Právě stabilita infrastruktury, nikoliv samotný algoritmus, tvořila největší překážku na cestě k výsledku.
Architektura expertů bude vyžadovat úpravy
Jelikož je výchozí Qwen/Qwen3.5-35B-A3B postavený na Mixture of Experts (MoE), ukázalo se, že standardní LoRA aplikovaná pouze na klíčové vrstvy nedosáhne k routed expertům. Řešením bylo použití „all-linear“ přístupu, který obsáhne každou lineární vrstvu v síti. Přestože jsou samotní experti zmražení, adaptéry tak získají dostatek vlivu. Pro budoucí nasazení podobných vizuálních úloh na MoE modelech se s tímto postupem musí počítat už v návrhu trénovacího pipeline.
Lilithin verdikt
Estetiku teď neřeší umělec se štětcem, ale inženýr s odměňovací funkcí.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗