2026-09-03 · ← Aktualności
RL przenosi postrzeganie piękna z człowieka na model
Kiedy nagrodą nie jest poprawny wynik, ale gust
Obecne modele RL najczęściej szkoli się na matematyce lub logice, gdzie wynik jest weryfikowalny (test kończy się pomyślnie lub nie). Inżynier Sergio Paniego opublikował otwartą replikację wcześniejszego wirusowego eksperymentu z p5.brush, w którym udowadnia, że uczenie ze wzmocnieniem (Reinforcement Learning) z powodzeniem może optymalizować nawet subiektywną estetykę.
Podczas gdy oryginalny model uczył się malować izolowane kwiaty na podstawie informacji zwrotnych z podpowiedzi tekstowych, ta otwarta procedura szkoli model Qwen3.5-35B tak, aby bezpośrednio generował 150 linii kodu JavaScript dla całej kompozycji. Sztuczka tkwi w funkcji nagrody: model nie dostaje punktów za precyzję, ale za styl. Na ocenę składa się w 60% weryfikacja w parach przez inny model wizyjny w stosunku do ręcznie wyselekcjonowanego zestawu „pięknych” obrazów oraz w 30% z modelu preferencji HPSv3.
Generowanie kodu ewoluuje z funkcji w pełnoprawne rzemiosło
Stanowi to znaczącą zmianę w wykorzystaniu narzędzi open source, a mianowicie platformy TRL i OpenEnv. Kod nie służy tu już tylko jako pomocnik do pobierania danych, ale sam w sobie staje się narzędziem artystycznym. Ograniczając model do zaledwie dziesięciu metod bibliotecznych (np. mieszanie kolorów, pociągnięcia), wymusili na nim skupienie się na stylu zamiast na złożoności technicznej. Wszystkie komponenty, w tym referencyjny zestaw danych i model nagród, są teraz publicznie dostępne na platformie Hugging Face, torując drogę do taniego i powtarzalnego dostrajania RL pod kątem estetyki dla każdego, kto ma dostęp do GPU.
Szybkie demo wizualne wciąż napotyka na kruchość infrastruktury
Udostępnienie procedury zderza się z rzeczywistością operacyjną. Podczas szkolenia inżynier odkrył, że błąd warstwy sieciowej nie może zwracać zerowego wyniku. W przeciwnym razie model zacząłby niesłusznie karać prawidłowy, ale wolno renderowany kod, co całkowicie zniweczyłoby proces uczenia. To właśnie stabilność infrastruktury, a nie sam algorytm, stanowiła największą przeszkodę na drodze do celu.
Architektura ekspertów będzie wymagała dostosowań
Ponieważ domyślny Qwen/Qwen3.5-35B-A3B jest zbudowany na bazie Mixture of Experts (MoE), okazało się, że standardowa metoda LoRA zastosowana tylko do warstw kluczowych nie dociera do właściwych ekspertów. Rozwiązaniem było zastosowanie podejścia „all-linear”, które obejmuje każdą linię w sieci. Mimo że sami eksperci są zamrożeni, adaptery zyskują w ten sposób wystarczające pole manewru. W przypadku przyszłych wdrożeń podobnych zadań wizualnych na modelach MoE, to podejście musi zostać uwzględnione już na etapie projektowania potoku szkoleniowego.
Werdykt Lilith
Estetyką zajmuje się teraz nie artysta z pędzlem, ale inżynier z funkcją nagradzania.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗