vLLM-Kunlun: el plugin de Baidu para ejecutar vLLM en la XPU Kunlun

Fuentes: vLLM-Kunlun: a community-maintained hardware plugin to run vLLM on Kunlun XPU

vLLM-Kunlun es un plugin de hardware mantenido por la comunidad y publicado por Baidu que permite ejecutar el motor de inferencia vLLM sobre la XPU Kunlun (chip Kunlun3 P800). El proyecto se distribuye como un plugin estándar de la plataforma vLLM mediante entry points de Python, lo que evita modificar el código fuente de vLLM y se alinea con la propuesta RFC Hardware Pluggable del proyecto oficial. Su versión inicial se abrió el 8 de diciembre de 2025 y, en pocos meses, ha incorporado optimizaciones relevantes: Fused MoE con lotes pequeños, paralelismo tensorial, soporte Multi-LoRA que alcanza más del 80 % del rendimiento sin LoRA, decodificación especulativa MTP para DeepSeek-V3.2 y DFlash, y el motor vLLM V1 con muestreo Flash-Infer 10-100 veces más rápido.

En cuanto a modelos, soporta más de 20 familias de LLMs —Qwen2/2.5/3/3.5 y sus variantes MoE, Llama2/3/3.1, DeepSeek-R1, V3 y V3.2, GLM4.5/4.5Air/5, Gemma4, Kimi-K2, Seed-OSS, gpt-oss, MiMo-V2-Flash, InternLM2— y modelos multimodales como Qwen2-VL/2.5-VL/3-VL, Gemma4, InternVL-2.5/3.5 e InternS1. Ofrece cuantización W8A8, AWQ, GPTQ y compressed-tensors W4A16, además de una API compatible con OpenAI. La rama en desarrollo v0.25.1 ya añade Qwen3.5/Qwen3.5-MoE, Gemma4 (texto y multimodal), GLM MoE DSA y decodificación especulativa DFlash.

El repositorio funciona como punto de entrada recomendado para integrar el backend Kunlun dentro del ecosistema vLLM y requiere Ubuntu 20.04, Python 3.10+, PyTorch 2.5.1 (build xpytorch personalizado para KL3) y transformers 5.2.0 para los modelos Qwen3.5.