Una comparativa independiente ha sometido a 18 modelos de inteligencia artificial de frontera a 153 ejecuciones autónomas sobre el benchmark de optimización nanoGPT, conocido por exigir eficiencia en el entrenamiento de modelos pequeños. El objetivo era medir cuál de estos sistemas consigue el mejor récord validado —la pérdida más baja— en un tiempo y con un presupuesto de cómputo comparables.
En la cabeza de la tabla se sitúa Fable 5, con un récord de 2.726, lo que sitúa su resultado un 81,7 % más cerca del récord humano de referencia (2.600) que la línea base de 3.290. Le siguen Opus 5 (2.920) y Kimi K3 (2.930), ambos con claude-code y prime-agent como entornos de ejecución. Modelos como GPT-5.6 Sol, Sonnet 5 o Grok 4.5 quedan en posiciones intermedias, mientras que Kimi K2.7 cierra la tabla con 3.240, un 7,2 % más cerca del récord humano.
La comparativa introduce una capa de igualdad de condiciones: a cada modelo se le asigna el mismo presupuesto de recursos y se mide el mejor récord validado alcanzado dentro de ese límite. Varias ejecuciones aparecen marcadas en gris porque terminaron antes del presupuesto seleccionado. El portal ofrece además 41 trazas completas de agentes con sus llamadas a herramientas y subagentes para inspección detallada.
