Un análisis experimental con 1.008 imágenes SVG generadas por siete modelos de IA de frontera concluye que no hay indicios de que los laboratorios estén optimizando sus modelos contra el popular test informal de Simon Willison: dibujar un pelícano en bicicleta. La prueba, conocida como "pelicanmaxxing", se ha convertido en uno de los benchmarks informales más citados en la comunidad de IA.
El autor construyó una matriz de 8 animales (pelícano, flamenco, garza, nutria, mapache, antílope, ballena y gato) por 6 vehículos (bicicleta, monociclo, patineta, patinete, avión y barco), sumando 48 combinaciones. Cada modelo generó tres muestras por indicación a temperatura 1,0, evaluadas después con GPT-5.6 Luna en criterios de animal, vehículo y coherencia, y procesadas con Gemini 3.1 Flash-Lite para extraer características visuales.
Los resultados muestran que el pelícano ocupa el sexto lugar entre ocho animales en la puntuación media, mientras que la bicicleta se sitúa penúltima entre los vehículos, por delante solo del avión. El ajuste estadístico mediante regresión de efectos fijos revela que ningún laboratorio presenta una mejora significativa específica en pelícanos, bicicletas ni en la combinación pelícano-bicicleta, con un único valor atípico en Gemini 3.5 Flash para bicicletas que se explica por azar estadístico. El código y los datos están disponibles en GitHub.
