DeepSeek presentó los resultados verificados de su modelo V4 Flash 0731 en los benchmarks ARC-AGI-1 y ARC-AGI-2, publicados el 31 de julio de 2026. El sistema ofrece tres variantes de razonamiento (Max, High y Low) que permiten ajustar el esfuerzo de cómputo según la dificultad de cada tarea. En su configuración de máximo esfuerzo, el modelo logra un 89,0% en ARC-AGI-1 Semi-Private con un coste de 0,02 dólares por tarea y un 61,4% en ARC-AGI-2 Semi-Private a 0,04 dólares por tarea, una relación rendimiento-coste que la compañía destaca como referencia en el leaderboard.
Los datos muestran una caída pronunciada al reducir el nivel de razonamiento: en ARC-AGI-2, la variante High baja al 56,0% y la Low al 46,0%, lo que evidencia la dependencia del modelo con respecto a la profundidad de cómputo en problemas abstractos complejos. En ARC-AGI-1, en cambio, la degradación es menor (87,0% en High y 84,0% en Low), ya que el benchmark más antiguo resulta más accesible. DeepSeek no publica aún puntuación en ARC-AGI-3. La entrada incluye además el desglose tarea a tarea de 120 pruebas públicas de ARC-AGI-2 y 400 de ARC-AGI-1, lo que permite reproducir y comparar los resultados frente a otros sistemas.
