vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

Fuentes: vLLM v0.28.0 releases major optimizations for Kimi-K3 and DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyendo soporte para paralelismo de contexto en decodificación (DCP), núcleos fusionados FlashKDA y una reducción de aproximadamente 17 GiB de memoria por GPU mediante el particionamiento opcional de expertos compartidos. Además, se ha habilitado la ejecución de Kimi-K3 en plataformas ROCm con el nuevo ejecutor de modelos V2.

En cuanto a DeepSeek V4, la versión permite el funcionamiento extremo a extremo del MLA disperso para decodificación estándar y especulativa, junto con soporte para cuantización NVFP4 en hardware AMD. El sistema de decodificación especulativa avanza con la introducción de DFlash2 y verificación programada por confianza en DSpark. La maduración del Model Runner V2 incluye la desagregación E/P/D, el descargado de pesos y soporte para caché KV multi-capas.

También se implementa un sistema de descargado jerárquico de caché KV hacia disco y se introduce un frontend en Rust con capacidades gRPC para inferencia multimodal. Entre los cambios notables, el valor predeterminado de max_num_batched_tokens aumenta a 16384 y la compatibilidad con Transformers se actualiza a la versión 5.15.0. La liberación incluye soporte para nuevos modelos como Muse Glimmer y Ling 3.0 Flash, así como mejoras en la gestión de LoRA para torres visuales.