Decodificación especulativa en vLLM sobre GPUs AMD: cómo funciona y qué se midió
La decodificación especulativa es una técnica que permite a vLLM verificar en una sola pasada del modelo objetivo varios tokens propuestos por un componente de borrador, con el fin de mantener el comportamiento de salida del modelo original mientras se reduce el número de rondas de decodificación es
