vLLM es uno de los motores de inferencia de modelos de lenguaje (LLM) de código abierto más extendidos y, sin embargo, su arquitectura interna sigue siendo poco conocida para la mayoría de los desarrolladores e investigadores. Este artículo ofrece un recorrido técnico en profundidad por el sistema vLLM a partir del commit 42172ad (9 de agosto de 2025), centrado en el motor V1, y desglosa pieza a pieza sus componentes principales.
El texto está organizado en cinco bloques: motor LLM y engine core, funcionalidades avanzadas, escalado desde una sola GPU a múltiples GPUs y nodos, la capa de servicio distribuido y, por último, benchmarks y autoajuste. En la primera parte se explican los fundamentos del motor: el planificador con sus colas de espera y ejecución (FCFS o por prioridad), el gestor de caché KV —el corazón de la atención paginada (paged attention)—, y el ejecutor del modelo, que en la configuración más simple corre como un único Worker en una sola GPU. Se detalla el proceso de inicialización: asignación del dispositivo CUDA, verificación de VRAM según gpu_memory_utilization, instanciación del model_runner y el InputBatch, carga de pesos, cálculo del número de bloques de caché KV disponibles y captura de CUDA Graphs para reducir la latencia de lanzamiento de kernels.
El artículo está dirigido a lectores curiosos sobre el funcionamiento de los motores LLM punteros y a quienes quieran contribuir a proyectos como vLLM o SGLang. Posts posteriores de la serie profundizarán en subsistemas como prefill por chunks, caché de prefijos, decodificación guiada y especulativa, y el servicio dinámico multi-GPU y multi-nodo.
