Lilith Lilith.
Ilustración editorial: RL desplaza la percepción de la belleza del ser humano al modelo
Ilustración de Lilith · remezcla editorial

Cuando la recompensa no es un resultado correcto, sino el gusto

Los modelos RL actuales se entrenan más a menudo en matemáticas o lógica, donde el resultado es verificable (una prueba se aprueba o falla). El ingeniero Sergio Paniego ha publicado ahora una réplica abierta de un experimento viral anterior con p5.brush, en el que demuestra que el aprendizaje por refuerzo (Reinforcement Learning) puede optimizar con éxito incluso la estética subjetiva.

Mientras que el modelo original aprendió a pintar flores aisladas a partir de la retroalimentación de las indicaciones de texto, este procedimiento abierto entrena al modelo Qwen3.5-35B para que genere directamente 150 líneas de JavaScript para una composición completa. El truco radica en la función de recompensa: el modelo no obtiene puntos por precisión, sino por estilo. La puntuación consta de una evaluación por pares del 60% por parte de otro modelo de visión en comparación con un conjunto de imágenes «hermosas» seleccionadas a mano y del 30% del modelo de preferencia HPSv3.

La generación de código evoluciona de una función a un oficio de pleno derecho

Se trata de un cambio significativo para el uso de herramientas de código abierto, a saber, la plataforma TRL y OpenEnv. El código ya no se usa aquí solo como un ayudante para la recuperación de datos, sino como la propia herramienta artística. Al restringir el modelo a solo diez métodos de biblioteca (p. ej., sangrado de color, trazos), lo obligaron a centrarse en el estilo en lugar de en la complejidad técnica. Todos los componentes, incluido el conjunto de datos de referencia y el modelo de recompensa, están ahora disponibles públicamente en Hugging Face, abriendo el camino a un ajuste fino de RL barato y replicable para la estética para cualquier persona con acceso a una GPU.

La demostración visual rápida aún choca con la fragilidad de la infraestructura

La apertura del procedimiento choca con la realidad de las operaciones. Durante el entrenamiento, el ingeniero descubrió que un error de la capa de red no debe devolver una puntuación cero. Si lo hiciera, el modelo comenzaría a castigar incorrectamente el código válido pero de renderizado lento, lo que destruiría por completo el proceso de aprendizaje. Fue la estabilidad de la infraestructura, no el algoritmo en sí, lo que constituyó el mayor obstáculo en el camino hacia el resultado.

La arquitectura de los expertos requerirá ajustes

Dado que el Qwen/Qwen3.5-35B-A3B predeterminado se basa en la Mezcla de expertos (MoE), resultó que un LoRA estándar aplicado solo a capas clave no llega a los expertos enrutados. La solución fue utilizar un enfoque «totalmente lineal» que abarca todas las capas lineales de la red. Aunque los propios expertos estén congelados, los adaptadores ganan así la influencia suficiente. Para un despliegue futuro de tareas visuales similares en los modelos de MoE, se debe tener en cuenta este enfoque en el propio diseño de la canalización de entrenamiento.

El veredicto de Lilith

La estética ya no es cosa de un artista con un pincel, sino de un ingeniero con una función de recompensa.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗