Kimi Linear: una arquitectura de atención que supera a la atención completa con menos memoria

Fuentes: Kimi Linear: An Expressive, Efficient Attention Architecture

Investigadores de Moonshot AI presentan Kimi Linear, una arquitectura híbrida de atención lineal que, según afirmam, supera por primera vez a la atención completa en comparaciones equitativas en contextos cortos, largos y en escenarios de escalado por aprendizaje por refuerzo. El núcleo del sistema es Kimi Delta Attention (KDA), un módulo de atención lineal que amplía Gated DeltaNet con un mecanismo de compuerta más granular, lo que permite aprovechar mejor la memoria limitada de una RNN de estados finitos. Un algoritmo chunkwise a medida, basado en una variante especializada de matrices de transición Diagonal-Plus-Low-Rank (DPLR), reduce sustancialmente el cálculo frente a la formulación DPLR general y mantiene la coherencia con la regla delta clásica.

El equipo preentrenó un modelo de 3.000 millones de parámetros activados y 48.000 millones totales, construido como un híbrido por capas de KDA y Multi-Head Latent Attention (MLA). Con una receta de entrenamiento idéntica, Kimi Linear supera a MLA completo en todas las tareas evaluadas, reduce el uso de caché KV hasta un 75 % y multiplica por seis el rendimiento de decodificación con un contexto de un millón de tokens. Los autores sostienen que la arquitectura puede sustituir directamente a los mecanismos de atención completa.

Para facilitar la reproducción, el equipo ha publicado en código abierto el kernel de KDA y sus implementaciones para vLLM, junto con los checkpoints del modelo preentrenado e instruction-tuned. El trabajo se difundió en arXiv el 30 de octubre de 2025 (v1) y se revisó el 1 de noviembre (v2).