vLLM: motor de inferencia de alto rendimiento para modelos de lenguaje

Fuentes: vLLM: high-throughput inference engine for large language models

vLLM es una biblioteca de código abierto diseñada para la inferencia y el servicio de modelos de lenguaje de gran escala (LLM). Desarrollada originalmente en el Sky Computing Lab de la Universidad de California en Berkeley, esta herramienta se ha convertido en uno de los proyectos de IA más activos, manteniéndose por una comunidad diversa de instituciones académicas y empresas con más de 2.000 contribuyentes. Su objetivo principal es ofrecer un alto rendimiento en el throughput de servicio y una gestión eficiente de la memoria, lo que permite ejecutar modelos complejos en hardware limitado.

El sistema destaca por su capacidad de gestión de memoria mediante PagedAttention, una técnica que optimiza el uso de la memoria de atención y valor. Además, vLLM implementa técnicas avanzadas como el batching continuo de solicitudes, el prefill en bloques y la caché de prefijos para mejorar la velocidad de respuesta. En cuanto a la ejecución del modelo, soporta gráficos CUDA/HIP fragmentados y completos, así como kernels optimizados para atención (FlashAttention, Triton) y matrices (CUTLASS, CuTeDSL). La herramienta ofrece una amplia gama de opciones de cuantización, incluyendo FP8, INT4, GPTQ y GGUF, lo que facilita su despliegue en entornos con recursos restringidos.

En términos de flexibilidad, vLLM integra nativamente modelos de Hugging Face y soporta más de 200 arquitecturas, desde LLMs de solo decodificador hasta modelos de mezcla de expertos (MoE) y multimodales. Ofrece APIs compatibles con OpenAI, Anthropic Messages y gRPC, además de soporte para paralelismo tensor, pipeline y contexto. La instalación es sencilla mediante pip o uv, y el proyecto incluye soporte para GPUs de NVIDIA, AMD, Intel y CPUs de x86/ARM/PowerPC, así como hardware especializado como TPUs de Google y GPUs de Apple Silicon.