2026-09-03 · ← News
RL verlagert die Wahrnehmung von Schönheit vom Menschen auf das Modell
Wenn die Belohnung nicht ein richtiges Ergebnis ist, sondern der Geschmack
Aktuelle RL-Modelle werden meist auf Mathematik oder Logik trainiert, wobei das Ergebnis verifizierbar ist (ein Test besteht oder schlägt fehl). Der Ingenieur Sergio Paniego hat nun eine offene Replikation eines früheren viralen Experiments mit p5.brush veröffentlicht, in der er zeigt, dass Reinforcement Learning (Bestärkendes Lernen) auch subjektive Ästhetik erfolgreich optimieren kann.
Während das Originalmodell lernte, isolierte Blumen auf der Grundlage von Feedback aus Text-Prompts zu malen, trainiert dieses offene Verfahren das Qwen3.5-35B-Modell so, dass es direkt 150 Zeilen JavaScript für eine gesamte Komposition generiert. Der Trick liegt in der Belohnungsfunktion: Das Modell bekommt keine Punkte für Genauigkeit, sondern für Stil. Die Bewertung besteht zu 60 % aus der paarweisen Bewertung durch ein anderes Vision-Modell anhand eines handverlesenen Sets «schöner» Bilder und zu 30 % aus dem HPSv3-Präferenzmodell.
Die Code-Generierung entwickelt sich von einer Funktion zu einem vollwertigen Handwerk
Dies ist eine signifikante Verschiebung für die Nutzung von Open-Source-Tools, nämlich der TRL-Plattform und OpenEnv. Code wird hier nicht mehr nur als Helfer zum Abrufen von Daten verwendet, sondern als eigentliches künstlerisches Werkzeug. Indem sie das Modell auf nur zehn Bibliotheksmethoden (z. B. Farbverläufe, Striche) beschränkten, zwangen sie es, sich auf den Stil statt auf technische Komplexität zu konzentrieren. Alle Komponenten, einschließlich des Referenzdatensatzes und des Reward-Modells, sind nun auf Hugging Face öffentlich zugänglich, was jedem mit GPU-Zugang den Weg für eine kostengünstige und reproduzierbare RL-Feinabstimmung der Ästhetik ebnet.
Die schnelle visuelle Demo stößt nach wie vor auf die Fragilität der Infrastruktur
Die Öffnung des Verfahrens trifft auf die Realität des Betriebs. Während des Trainings entdeckte der Ingenieur, dass ein Netzwerkfehler keine Null-Bewertung zurückgeben darf. Wäre dies der Fall, würde das Modell anfangen, fehlerfrei arbeitenden, aber langsam rendernden Code fälschlicherweise zu bestrafen, was den Lernprozess komplett zunichtemachen würde. Es war die Stabilität der Infrastruktur und nicht der Algorithmus selbst, die das größte Hindernis auf dem Weg zum Ergebnis darstellte.
Die Architektur von Experten wird Anpassungen erfordern
Da das Standardmodell Qwen/Qwen3.5-35B-A3B auf einer Mixture of Experts (MoE) aufbaut, stellte sich heraus, dass eine Standard-LoRA, die nur auf Schlüsselebenen angewendet wird, die zugewiesenen Experten nicht erreicht. Die Lösung bestand in der Verwendung eines «All-Linear»-Ansatzes, der jede lineare Ebene im Netzwerk umfasst. Auch wenn die Experten selbst eingefroren sind, gewinnen die Adapter so genügend Einfluss. Für den zukünftigen Einsatz ähnlicher visueller Aufgaben bei MoE-Modellen muss dieser Ansatz bereits beim Entwurf der Trainingspipeline selbst berücksichtigt werden.
Liliths Urteil
Die Ästhetik wird nun nicht mehr von einem Künstler mit dem Pinsel gesteuert, sondern von einem Ingenieur mit einer Belohnungsfunktion.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗