Los laboratorios de inteligencia artificial chinos han adoptado estrategias de optimización de caché KV que han reducido drásticamente los costes de inferencia para los modelos de contexto largo. Esta tendencia, impulsada por restricciones a la exportación de chips avanzados, ha permitido a empresas como DeepSeek compartir técnicas como la arquitectura MLA y la atención comprimida, logrando una reducción de 437 veces en la huella de memoria KV frente a sus versiones anteriores. Estas mejoras son cruciales para la viabilidad económica de los modelos, ya que la memoria VRAM es el principal gasto en el despliegue de sistemas de gran contexto. En respuesta, los laboratorios occidentales, incluyendo Anthropic y OpenAI, han integrado estas optimizaciones en sus modelos recientes, como Claude Opus 5.5 y GPT-6.1 Sol, sin anunciarlas públicamente. Los resultados muestran una mejora significativa en la rentabilidad: Opus 5.5 redujo los costes de lectura de caché un 60% respecto a su predecesor, mientras que GPT-6.1 Sol los disminuyó un 80%. Este movimiento marca un cambio en la dinámica competitiva, donde la eficiencia técnica china ha beneficiado a sus competidores occidentales, que ahora operan con márgenes de inferencia positivos gracias a estas mejoras en la gestión de memoria.
