Un equipo independiente construyó un «ring de dibujo» en el que cuatro modelos de visión por computadora —GPT-5.6 Sol, Claude Fable 5, Grok 4.5 y Gemini 3.6 Flash— reciben un lienzo en blanco y un conjunto de herramientas que simulan lápices de colores: elegir tono, grosor y presión, trazar lotes de líneas, difuminar, borrar y consultar el lienzo en cualquier momento. Cada modelo debía reproducir dos obras de referencia (la Mona Lisa y La noche estrellada de Van Gogh, evaluadas con la métrica SSIM) o interpretar cinco descripciones textuales abiertas, como un pescador anciano al atardecer o un gato atigrado dormitando en una ventana.
El experimento, cuyo código está disponible en GitHub, registró cada trazo, cada gasto y cada resultado con el objetivo de mostrar cómo se comportan los modelos frontera en tareas creativas largas y no estructuradas, algo que los benchmarks habituales no capturan. Los autores aclaran que no se trata de una prueba objetiva de capacidad artística, sino de una observación visual del uso de herramientas y del coste real. Señalan que Claude Fable 5 fue el más caro y lento y ofreció peor resultado en esta tarea, mientras que los modelos de código abierto probados directamente «no eran utilizables» y varios devolvieron un lienzo vacío. Próximamente evaluarán Kimi K3 cuando se libere por completo.
