GLM-5.3 lidera el Ed-o-meter, una evaluación de 17 modelos basada en tareas reales y de bajo coste. El modelo obtuvo un 100 % de éxito en las cinco categorías medidas —programación, datos, tareas cotidianas, seguridad y uso de herramientas—, una puntuación de rúbrica de 9,3 y un coste total de 0,28 dólares por vuelta. Su principal inconveniente es la latencia: 16,3 segundos hasta el primer token.
Kimi-K3 alcanzó la mejor puntuación de calidad, 9,5, y un 96 % de éxito, pero necesita 26,4 segundos para empezar a responder y falla en el 25 % de las tareas de datos. DeepSeek-V4-Pro también registra un 96 %, aunque su mediana de 40 segundos lo descarta para usos interactivos. GPT-5.5 ofrece una alternativa más rápida, con 13,2 segundos, seguridad completa y 89 % en tareas cotidianas.
La clasificación separa rendimiento, coste y velocidad. GPT-5.6-Luna es el modelo más barato —0,064 dólares por vuelta y 0,0023 por tarea—, pero solo logra 33 % en seguridad. Las variantes Luna, Terra y Sol de GPT-5.6 fallaron 11 de 12 pruebas de jailbreak. Fable-5 y Opus-5 sufrieron bloqueos del proveedor; por ello, sus costes por tarea y resultados de programación requieren interpretar con cautela. La fuente incluye cuatro salvedades sobre evaluación retrospectiva, un falso positivo del comprobador de recetas y el cálculo de costes en ensayos con respuestas.
