Entrenar una IA para pintar escribiendo código: un proyecto de aprendizaje por refuerzo sobre tareas creativas

Fuentes: Training AI to Paint with Code: A Reinforcement Learning Approach to Creative Tasks

Surya Narreddi, estudiante, presenta un proyecto de investigación que aplica aprendizaje por refuerzo (RL) a tareas creativas como la generación de imágenes. La propuesta responde a una limitación habitual de los modelos generativos: la única forma de intervenir en una imagen es mediante el prompt, sin posibilidad de edición directa. El sistema entrena un modelo de lenguaje para producir imágenes escribiendo sketches en JavaScript sobre la librería p5.brush, de modo que el código se convierte en el artefacto y es editable.

El núcleo del trabajo es un problema de diseño: el RL requiere una recompensa verificable, pero la calidad estética no lo es. Para abordarlo, el equipo construyó un bucle de cuatro pasos (prompt, generación de código, renderizado en Puppeteer y juicio comparativo) ejecutado miles de veces durante el entrenamiento. Un modelo juez compara cada PNG resultante con dos pinturas de referencia escogidas al azar de un conjunto de 581 obras, todas generadas por modelos y valoradas a mano en tres niveles (117 "love", 266 "okay" y 198 suplementos). La señal se usa con GRPO para actualizar el modelo.

Otra pieza clave es la evolución del prompt del sistema mediante GEPA: las primeras versiones incluían 400 líneas de documentación de la API de p5.brush y el modelo inventaba funciones inexistentes. Tras 200 iteraciones, el prompt convergió a una lista cerrada de ocho métodos de pincel, sin documentación ni ejemplos, lo que redujo las alucinaciones de API y produjo las primeras flores visibles de manera consistente. El informe técnico completo se publicará en junio de 2026.