Artificial Analysis lanza la versión 4.2 de su Intelligence Index con nuevas pruebas de razonamiento

Fuentes: Announcing Artificial Analysis Intelligence Index v4.2

Artificial Analysis publicó el 4 de septiembre de 2026 la versión 4.2 de su Intelligence Index, una actualización intermedia que adelanta elementos del futuro lanzamiento v5 para mantener la relevancia del ranking ante el rápido avance de los modelos frontera. La nueva edición incorpora dos evaluaciones: AA-Briefcase, una prueba interna de tareas agénticas de trabajo de conocimiento con conjuntos de datos privados, y GDP.pdf, de Surge AI, que mide razonamiento documental sobre 4.592 páginas en 100 PDF de diez dominios profesionales. Además, elimina GPQA Diamond tras considerarlo saturado y eleva al 40 % la ponderación de conjuntos de datos privados held-out, el doble que en v4.1, para reducir la capacidad de los laboratorios de optimizar sus modelos contra las pruebas.

En los resultados, Claude Fable 5.1 de Anthropic lidera el índice, seguido por GPT-6 Astra de OpenAI, que mejora 4 puntos frente a GPT-5.6 Sol. Meta ocupa la tercera posición, seguida por SpaceXAI, Moonshot/Kimi, Z.AI y Google. Anthropic, OpenAI, Meta y Z.AI comparten la frontera de coste por tarea, mientras que GPT-6 Astra domina la eficiencia en tokens de salida, con Claude Fable 5.1, Grok 4.5 y Gemini 3.5 Flash-Lite en los extremos de la curva. En AA-Briefcase, Claude Fable 5.1 y Opus 5 encabezan la tabla, con GPT-6 Astra a unos 85 puntos Elo por encima de GPT-5.6 Sol. En GDP.pdf, GPT-6 Astra obtiene un 33,2 %, frente al 28,2 % de GPT-5.6 Sol y el 26,2 % de Claude Fable 5.1. La compañía también anunció mejoras en la infraestructura de calificación para AA-LCR, GDPval-AA, AA-Briefcase y SciCode.