ARC Prize publica la clasificación de la prueba ARC-AGI-3 con datos de eficiencia

Fuentes: ARC Prize Leaderboard ranks ARC-AGI-3 systems by cost and accuracy

La competición ARC Prize mantiene abierta la clasificación de ARC-AGI-3, una prueba diseñada para evaluar la capacidad de los agentes de inteligencia artificial de adaptarse en tiempo real a entornos interactivos desconocidos. ARC-AGI surgió como evolución de ARC-AGI-1 y ARC-AGI-2, que medían la inteligencia fluida pasiva, y ahora plantea retos que exigen adaptación dinámica ante problemas nunca vistos. La página de la clasificación presenta un diagrama de dispersión que cruza el coste por tarea con la puntuación obtenida, una métrica pensada para mostrar que la inteligencia no se reduce a acertar la respuesta, sino a hacerlo con el menor gasto computacional posible. En el gráfico se distinguen tres tipos de soluciones: los sistemas con razonamiento, cuyas líneas de tendencia conectan puntos de un mismo modelo evaluado con distintos niveles de cómputo y suelen mostrar un comportamiento asintótico al aumentar el tiempo de deliberación; los modelos de lenguaje de referencia, con inferencias en una sola pasada de modelos como GPT-4.5 o Claude 3.7 sin razonamiento extendido, que sirven como línea base; y los sistemas enviados a Kaggle, concebidos como métodos eficientes bajo un presupuesto de 50 dólares para 120 tareas de evaluación. La organización aclara que solo figuran sistemas cuyo coste de ejecución fue inferior a 10.000 dólares, que las tareas no resueltas por algunos modelos se contabilizan como incorrectas y que los resultados marcados como preview son oficiosos y pueden basarse en pruebas incompletas. La estimación de ARC-AGI-2 se apoya en pruebas parciales y en la tarifa de o1-pro, mientras que los costes provisionales de ARC-AGI-3 se calculan con la tarifa de Gemini 3 Pro a la espera de un reanálisis posterior.