Grok 4.5 supera a GPT-5.5 y Claude en velocidad y coste en una prueba de generación de apps

Fuentes: We made Grok 4.5, GPT-5.5, and Claude build the same apps

xAI lanzó esta semana Grok 4.5, presentado como su modelo más avanzado, entrenado junto a Cursor para tareas de programación y agentic. La plataforma TryAI sometió a Grok 4.5, GPT-5.5, Claude Opus 4.8 y Claude Fable 5 a tres pruebas idénticas de generación one-shot de aplicaciones interactivas en un único archivo HTML, sin librerías ni llamadas de red, con un único reintento si la app no renderizaba.

En la primera ronda, un cubo de Rubik 3D con botones de mezclar y resolver, Claude Opus 4.8 y Claude Fable 5 entregaron un cubo coloreado correcto a la primera. Grok 4.5 falló en el primer intento (solo renderizó título y botones) pero acertó con el reintento. GPT-5.5 solo mostró una cara oscura y quedó fuera.

La segunda prueba consistió en un sandbox de partículas con gravedad y atracción al clic. Los cuatro modelos entregaron versiones funcionales; GPT-5.5 ganó por estética con atractores neón y rastros arremolinados.

En la tercera ronda, un Breakout jugable con paddle, ladrillos, puntuación y vidas, los cuatro modelos ofrecieron versiones pulidas y jugables a la primera, declarándose empate.

En métricas de velocidad y coste, Grok 4.5 lideró con un tiempo al primer token de 0,44 segundos, un throughput de 110 tokens/s y un coste de 0,002¢ por respuesta. GPT-5.5 registró 2,0 s de latencia mediana y 0,004¢; Opus 4.8, 2,6 s y 0,004¢; y Fable 5, 6,3 s y 0,009¢. En una ronda bonus con un SVG de un caballo montado sobre un astronauta, Fable 5 ganó por ingenio cómico, aunque Opus 4.8 entregó un SVG con un atributo duplicado que rompía parsers estrictos.