El backend de modelado de transformers en vLLM alcanza velocidad nativa

Fuentes: Native-speed vLLM transformers modeling backend

Hugging Face ha anunciado una actualización del backend de modelado de transformers dentro de vLLM que permite ejecutar los modelos de Hugging Face a la misma velocidad —o superior— que las implementaciones nativas escritas a mano para vLLM, sin necesidad de portar el código. La mejora se valida con tres modelos Qwen3 muy distintos entre sí: un modelo denso de 4B en una sola GPU, un denso de 32B con paralelismo de tensores y un MoE de 235.000 millones de parámetros en FP8 con paralelismo de datos y de expertos en un nodo 8×H100.

La clave técnica está en el uso de torch.fx para analizar estáticamente el grafo del modelo y detectar patrones optimizables, combinados con ast para reescribir el código fuente en el momento y aplicar fusiones de capas específicas de inferencia. Entre las operaciones fusionadas se encuentran MergedColumnParallelLinear y QKVParallelLinear de vLLM, además de kernels optimizados para la paralelización de expertos en modelos MoE. El resultado sigue siendo compatible con torch.compile y CUDA Graphs.

En la práctica, cualquier modelo del Hub puede servirse con vLLM añadiendo el flag --model-impl transformers, sin modificar la configuración de paralelismo ni el despliegue. Esto elimina la necesidad de mantener dos versiones del modelo —una para entrenamiento y otra para inferencia optimizada— y unifica el ciclo de trabajo de autores, investigadores y equipos de producción. Los autores del cambio anuncian un artículo técnico en preparación que detallará los métodos empleados.