Estudio revela que LRU supera a políticas avanzadas en caché KV

Fuentes: Study reveals LRU outperforms advanced policies in agentic KV cache

Un análisis técnico basado en 68.266 solicitudes de 393 sesiones reales de Claude Code y 23.608 de Mooncake demuestra que la política LRU (Least Recently Used) es más difícil de superar en cachés KV agénticas de lo que sugieren los papers teóricos. El estudio, reproducible mediante un simulador de eventos discretos, revela que bajo presión de capacidad, la mayoría de la recomputación proviene de bucles de llamadas a herramientas separados por segundos, no de sesiones inactivas que superan un TTL. Los datos muestran que el TTL de 5 minutos nunca se activa como restricción vinculante; LRU siempre evicta antes de que el temporizador expire. Esto indica que el problema dominante es de capacidad, no de predicción de vida útil. Aunque la literatura argumenta que LRU falla porque no distingue sesiones pausadas de muertas, en la práctica, con un intervalo medio de 2,1 segundos, casi todas las sesiones están "a punto de volver", dejando poco margen para estimadores de vida útil. El estudio también resuelve una discrepancia de 4-6 puntos porcentuales en las tasas de acierto publicadas por Mooncake, atribuyéndola a diferencias en la definición de métricas o versiones de trazas, y concluye que la restricción de hojas en estructuras radix (usada por vLLM y SGLang) ofrece una mejora marginal de solo 0,02 puntos porcentuales en esta carga de trabajo.