La decodificación especulativa es una técnica que permite a vLLM verificar en una sola pasada del modelo objetivo varios tokens propuestos por un componente de borrador, con el fin de mantener el comportamiento de salida del modelo original mientras se reduce el número de rondas de decodificación estrictamente autoregresivas. En lugar de generar un token por paso, un borrador ligero propone candidatos futuros y el modelo objetivo los evalúa de izquierda a derecha: los aceptados se confirman y el primero rechazado marca el fin de la propuesta, aportando además el siguiente token.
El artículo repasa cinco enfoques de borrador disponibles en vLLM —MTP nativo, Gemma 4 MTP, EAGLE-3, DFlash y DSpark— que difieren en cómo reciben información del modelo objetivo (estados ocultos, caché KV o representaciones combinadas) y en si generan candidatos de forma secuencial, autoregresiva, en paralelo o híbrida. Los módulos MTP nativos se integran en la arquitectura del modelo objetivo; los MTP separados usan un checkpoint propio; y EAGLE-3, DFlash y DSpark son redes entrenadas específicamente para un modelo objetivo concreto.
Los autores comparten mediciones realizadas en GPUs AMD Instinct MI300X y MI355X con la plataforma ROCm. El efecto sobre el throughput de tokens de salida varía según el método de borrador, la longitud de propuesta, la familia de modelo, el checkpoint de borrador, la carga de trabajo y la tasa de aceptación. El texto también aborda consideraciones prácticas de configuración y observabilidad para ajustar estos métodos en producción.
