ZAI (Zhejiang AI) ha documentado cómo su modelo GLM-5.3-Flash utilizó un agente de infraestructura para desplegar y optimizar su propia infraestructura de inferencia en un clúster de más de 100.000 aceleradores chinos. Este proceso, que duró menos de dos semanas, marca un avance hacia la mejora recursiva de la IA (RSI), donde el sistema diseña y entrena a sus sucesores de forma autónoma. El proyecto enfrentó desafíos técnicos significativos, como la falta de soporte de kernels y la inmadurez del ecosistema de hardware, lo que requirió optimizaciones agresivas como la cuantización W8A8 y la arquitectura EPD. Estas mejoras triplicaron el rendimiento final, igualando la eficiencia de GPUs NVIDIA. El artículo destaca que la clave no es solo la generación de código, sino la capacidad del agente para recibir retroalimentación densa y localizable, vinculando métricas de rendimiento con cambios específicos en el código o los kernels. Este enfoque permite al sistema identificar con precisión las causas de regresiones de rendimiento, facilitando la iteración continua sin depender de pruebas de carga completas en cada paso.
