La plataforma Artificial Analysis publica una comparativa exhaustiva de modelos de inteligencia artificial que evalúa, sobre 164 modelos (93 de pesos abiertos y 120 con razonamiento), seis dimensiones clave: calidad de las respuestas, precio, velocidad de salida en tokens por segundo, latencia hasta el primer token, tiempo de respuesta de extremo a extremo y tamaño de la ventana de contexto. Las métricas se obtienen mediante prompts estandarizados y se agregan en el Artificial Analysis Intelligence Index.
En inteligencia, el modelo Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) lidera el índice con 60 puntos, seguido de GPT-5.6 Sol en sus variantes max (59), xhigh (58) y high (56), y de Kimi K3 (57). Entre los modelos de pesos abiertos, GLM-5.2 (max) ocupa la primera posición con 51 puntos, por delante de MiniMax-M3 (44) y DeepSeek V4 Pro en modo razonamiento (44).
En velocidad de salida, Mercury 2 alcanza 957,8 tokens por segundo, muy por encima de Gemini 3.5 Flash-Lite (462,6 t/s) y Granite 4.0 H Small (411,3 t/s). El menor tiempo hasta el primer token corresponde a Gemini 2.5 Flash-Lite en modo sin razonamiento, con 0,33 segundos, seguido de North Mini Code (0,37 s) y Command A+ (0,41 s). En precio, Gemma 3n E4B Instruct resulta el más económico, con 0,02 dólares por millón de tokens en tarifa combinada, seguido de Nova Micro y Sarvam 30B, ambos a 0,03 dólares.
La comparativa ofrece gráficos interactivos que permiten cruzar inteligencia frente a coste, inteligencia frente a tokens consumidos por tarea y tiempo total por tarea, además de un selector para personalizar los modelos mostrados en cada visualización.
