Optimización integral de inferencia para MiMo-V2.5: llevar la eficiencia Hybrid SWA al límite

Fuentes: Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit

La familia MiMo-V2.5, compuesta por las versiones MiMo-V2.5 y MiMo-V2.5-Pro, integra varias decisiones arquitectónicas orientadas a reducir el coste de razonamiento en contextos largos: atención híbrida con ventana deslizante (Hybrid SWA), que comprime el almacenamiento de la KVCache a aproximadamente una séptima parte del de la atención completa; activación dispersa tipo MoE, que reduce el cómputo por token manteniendo la capacidad del modelo; y codificadores multimodales para visión, audio y vídeo. La motivación del equipo era entrenar un modelo potente y eficiente para razonamiento de contexto largo, dos objetivos en tensión en arquitecturas tradicionales.

El artículo describe la puesta en práctica de extremo a extremo de la inferencia de la serie MiMo-V2.5. Incluye la gestión de KVCache con dos pools independientes para capas de atención completa y SWA; sistemas de caché jerárquicos en tres niveles; árboles de prefijo compatibles con SWA; estrategias de planificación; pipelines de ejecución Prefill/Decode; y optimizaciones multimodales. Como ejemplo concreto, MiMo-V2.5-Pro emplea 70 capas —10 de atención completa y 60 SWA con ventana de 128 tokens—, lo que sitúa el cómputo y la memoria KVCache cercanos a 1/7 respecto a la atención plena. La sección también analiza cómo las suposiciones de RadixAttention deixam de ser válidas bajo SWA y cómo redefinir las reglas de coincidencia de prefijos preservando la corrección. El texto queda truncado al describir la refactorización de los tres niveles de HiCache.