Kimi K3 es el nuevo modelo open-weight de gran escala presentado por Moonshot AI, con 2,8 billones de parámetros, y se posiciona como el modelo de pesos abiertos más grande disponible en la actualidad. El texto analiza su arquitectura, que constituye una versión escalada de producción del modelo Kimi Linear (48B) presentado el año anterior. La principal novedad respecto a Kimi Linear es el componente LatentMoE, que comprime las capas lineales grandes mediante una proyección descendente, técnica ya empleada en Nemotron 3 Ultra. El diseño global prioriza la eficiencia de inferencia, tendencia compartida con Nemotron 3 y DeepSeek V4: MoE se reemplaza por LatentMoE, la atención convencional por atención latente multi-cabezal (MLA) y atención Kimi Delta. Otro cambio relevante, no vinculado a la eficiencia, son los residuos de atención, que conectan los residuos entre capas mediante puntuaciones de atención; según el informe técnico, esta técnica mejora de forma consistente la pérdida de validación y el rendimiento, con un coste adicional del 4% en entrenamiento y del 2% en inferencia. Kimi K3 también abandona todas las capas RoPE y adopta NoPE (sin embeddings posicionales) en todo el modelo, siendo el primer modelo de frontera que aplica este criterio de forma integral. Por último, incorpora soporte multimodal nativo. En conjunto, el lanzamiento es valorado como un gran avance en modelos open-weight.
