Z.ai presenta GLM-5.3-Flash: un modelo multimodal 320B con coste de inferencia diez veces menor

Fuentes: artificialanalysis.ai, Z.ai launches GLM-5.3-Flash, a 320B multimodal model at one-tenth the inference cost

Z.ai, la compañía china de inteligencia artificial, ha presentado GLM-5.3-Flash, un nuevo modelo de gran escala que combina capacidades multimodales nativas con un coste de inferencia hasta diez veces inferior al de sus rivales de referencia. La compañía describe el lanzamiento como un paso significativo para empujar la frontera de eficiencia en modelos frontera, en un contexto de creciente presión competitiva entre los desarrolladores chinos y occidentales.

El nuevo modelo cuenta con 320.000 millones de parámetros totales, aunque solo 18.000 millones permanecen activos durante la inferencia, una arquitectura dispersa que la empresa ya empleó en la serie GLM-4.5 pero que ahora refina de forma sustancial. Frente a su predecesor, GLM-5.3-Flash casi reduce a la mitad los parámetros activos respecto a GLM-4.5 (18B frente a 32B) y disminuye el número de capas de 92 a 45, con un volumen total de parámetros ligeramente inferior (320B frente a 355B). Z.ai sostiene que, gracias a estas decisiones arquitectónicas, el modelo produce más inteligencia por unidad de cómputo.

En los benchmarks publicados por la propia empresa, GLM-5.3-Flash mejora con claridad a GLM-5.2 en tareas de programación y agentic. Destacan las diferencias en DeepSWE v1.1, donde alcanza 63,4 puntos frente a 46,2, y en AutomationBench, con 48,8 frente a 26,2. En la evaluación interna Z.ai Code Bench v1.0, ejecutada sobre Claude Code 2.1.207, el nuevo modelo supera a GLM-5.2 en todos los niveles de esfuerzo y, al máximo esfuerzo, prácticamente iguala a Claude Opus 4.8 (29,0 frente a 29,5). En el Artificial Analysis Intelligence Index v4.1.1 obtiene una puntuación de 57 con un coste de 0,045 dólares por tarea (con descuento), un nivel de rendimiento que, según Z.ai, hasta ahora solo era accesible a un coste aproximadamente diez veces mayor.

Uno de los elementos diferenciadores es la incorporación de una arquitectura híbrida de atención que combina mecanismos dispersos y lineales. La atención lineal modela dependencias locales mediante state modeling, mientras que la atención dispersa recupera contexto global relevante a través de un indexador ligero. Para mitigar la latencia y el consumo de memoria de ese indexador con ventanas de un millón de tokens, Z.ai introduce IndexPool, que comprime cuatro vectores clave del indexador en uno mediante pooling ponderado. En comparación con GLM-5.3, esta arquitectura reduce el cómputo de atención por token en un factor de 3,0 y el tamaño de la caché KV en un factor de 4,4. Frente a DeepSeek-V4-Flash y Kimi-K3, GLM-5.3-Flash presenta el menor cómputo de atención del grupo, aunque la caché KV sigue siendo ligeramente mayor que la de ambos competidores.

Otra novedad relevante es la adopción de Manifold-Constrained Hyper-Connections (mHC), una técnica que mejora la eficiencia de escalado, junto con un corpus de preentrenamiento multimodal de 30 billones de tokens. El modelo es además el primero de la serie GLM-5 con multimodalidad nativa, lo que le permite interpretar documentos, hojas de cálculo, presentaciones, interfaces y otros artefactos visuales, y aplicar esa capacidad tanto a flujos profesionales como a la programación visual. Z.ai ha desarrollado pipelines de síntesis de datos centrados en el juicio visual y la mejora iterativa en tiempo de prueba, así como técnicas de aprendizaje por refuerzo con retroalimentación del entorno para tareas de frontend, reforzando el juicio sobre interfaces gráficas mediante verificación agentiva.

Antes del lanzamiento oficial, Z.ai probó el modelo de forma anónima bajo el alias ox-alpha en OpenCode y OpenRouter, donde se convirtió en el más popular de la semana. Todo el tráfico fue servido en chips de IA chinos, apoyados por una interconexión de alto ancho de banda y un motor de inferencia propio construido sobre SGLang. La compañía destaca que la optimización de ese motor fue acelerada por un agente de infraestructura alimentado por el propio GLM-5.3, que asistió a los ingenieros en el desarrollo de kernels y en el diagnóstico de cuellos de botella, creando un bucle en el que el modelo ayudó a mejorar el sistema que lo sirve. Entre las técnicas empleadas destacan el paralelismo tensorial intranodo para la atención lineal y la cabeza del modelo, ReplaySSM, cuantización W8A8, cuantización híbrida de caché INT8/FP8/BF16 y Layer Split, junto con una arquitectura de producción EPD (Encode-Prefill-Decode) desagregada para servir el modelo de forma eficiente a escala de clúster.

En el plano comparativo, Z.ai sitúa a GLM-5.3-Flash-Base por encima de GLM-4.5-Base y a la altura de GLM-5-Base en la mayoría de los benchmarks, a pesar de contar con menos parámetros activos. En MMLU alcanza 88,1 (frente a 86,1 de GLM-4.5 y 88,3 de GLM-5), en BBH 86,6 y en HellaSwag 87,1. En tareas de código base, LiveCodeBench-Base sube a 37,6, frente a 28,1 de GLM-4.5 y 34,4 de GLM-5, mientras que DeepSeek-V4-Flash-Base se queda en 29,9. En SimpleQA obtiene 33,5, por debajo de GLM-5 (36,0) pero por encima de GLM-4.5 (30,0).

El lanzamiento consolida la estrategia de Z.ai de competir en eficiencia más que en tamaño bruto, apoyándose en hardware chino para reducir la dependencia de proveedores extranjeros. La compañía no detalla qué chips concretos utiliza, pero subraya que las optimizaciones a nivel de motor de inferencia son clave para sostener ventanas de contexto largas a precios agresivos. De confirmarse en pruebas independientes el rendimiento y el coste anunciados, GLM-5.3-Flash podría convertirse en una opción por defecto para cargas de trabajo de programación y agentic de alta frecuencia, donde el precio por tarea es un factor determinante, y añade presión competitiva sobre laboratorios occidentales como Anthropic y DeepSeek.