El modelo GPT-6 Astra de OpenAI alcanzó el 62,7 % en la clasificación ARC-AGI-3 Semi-Private con un coste de 26.098 dólares usando el arnés estándar, y el 99,9 % por 18.817 dólares con el arnés Provider Adapter, en ambos casos récords del estado del arte. Al nivel máximo de razonamiento, Astra resolvió los juegos con menos acciones que la mediana de los humanos evaluados en el 96 % de los niveles, lo que redujo el coste total frente a otros niveles de esfuerzo de razonamiento. ARC-AGI-3 es la tercera generación de la serie de benchmarks ARC-AGI, diseñada para medir la inteligencia agéntica mediante entornos abstractos, novedosos y por turnos que evalúan exploración, modelado, fijación de objetivos y planificación. El benchmark se calibró con cerca de 500 participantes sin selección previa por experiencia en rompecabezas, y todos resolvieron el 100 % de los entornos. El análisis de las repeticiones muestra que Astra convierte mecánicas desconocidas en modelos simbólicos compactos: representa las reglas como enunciados lógicos y desarrolla un lenguaje algebraico propio específico del dominio para registrar el estado y planificar acciones. Entre los ejemplos figuran variables de estado del juego ("L8: hub q2"), planes multipaso ("extend8 to3; retract10 to2"), mapas de coordenadas de controles y notas de posición y turno ("Turn 5: P=(24,20), empty, facing west"). En términos de coste, los participantes humanos cobraron unos 12,78 dólares por partida intentada en sesiones de 90 minutos, mientras que Astra completó las tareas por una fracción de ese importe según el arnés empleado.
