Biting the Bullet: predicción de ráfagas para reducir latencia en inferencia de LLM

Fuentes: Biting the Bullet: Predictive Speculative KV Replication for Bursty LLM Inference

Biting the Bullet (BTB) es una técnica desarrollada por JW Labs Research para optimizar la inferencia de modelos de lenguaje de gran tamaño cuando se producen picos súbitos de peticiones que comparten un prefijo largo común, un patrón habitual en tareas de etiquetado de datos, agentes distribuidos o procesamiento por lotes de documentos. Los enrutadores tradicionales, como el cache-aware de SGLang o el least-load de Dynamo, no gestionan bien estas ráfagas: o dispersan las peticiones entre réplicas sin caché o las concentran en una sola, generando colas enormes y recomputaciones innecesarias.

BTB detecta la ráfaga entrante y replica de forma proactiva la caché KV del prefijo desde la memoria de otra GPU mediante RDMA hacia la HBM local, antes de que lleguen las peticiones. Para validar la idea, los autores construyeron Bursted-ART, un conjunto de datos sintético que reproduce este patrón, ya que los traces públicos como Mooncake, LMSYS o BurstGPT apenas contienen ráfagas profundas de prefijo común.

En pruebas con Llama-3.3-70B sobre nodos de 4 GPUs H100, BTB reduce el tiempo medio hasta el primer token entre un 10 % y un 60 % frente al enrutador cache-aware por defecto de SGLang, y disminuye el percentil 95 hasta un 80-82 % en los mejores casos. Los autores destacan que la diferencia entre recomputar la caché y replicarla por RDMA puede ser de hasta 44 veces, lo que justifica precalentar la caché cuando se anticipa la ráfaga. El código y el simulador Infer-Sim están disponibles en el repositorio abierto jwlaboratory/bite-the-bullet.