Google actualiza Android Bench con nuevos LLM, pero Gemini sigue por detrás

Fuentes: Google updates Android Bench with new LLMs, but Gemini still lags behind

Google ha renovado Android Bench, su banco de pruebas para evaluar el rendimiento de los grandes modelos de lenguaje en el desarrollo de aplicaciones Android. La actualización incorpora ocho modelos adicionales, entre ellos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus y Qwen 3.7 Max, junto con nuevas métricas centradas en el coste y la eficiencia. Android Bench, presentado en marzo, evalúa a los agentes de IA sobre un conjunto de 100 tareas reales de programación para Android y, desde su lanzamiento, ya situaba a los modelos de OpenAI ligeramente por delante de los de Google. La nueva clasificación amplía esa brecha: Gemini 3.1 Pro ocupa la quinta posición, por detrás de GPT 5.4, Claude Sonnet 5 y Claude Fable 5. Claude Fable 5 lidera la prueba con un 84,5 % de precisión, mientras que GPT 5.4 y Claude Sonnet 5 completan el podio. Google ha sustituido además el marco de evaluación por una versión más sencilla de utilizar y ha invitado a los desarrolladores a ejecutar sus propias pruebas y enviar comentarios para seguir refinando la herramienta.