El temporizador de cache keepalive de los agentes cuesta 8 veces más de lo necesario

Fuentes: Your Agentic Workflow's Cache Keepalive Costs 8x Too Much (v2: the interval frontier)

Mantener caliente la caché de prompts en flujos agénticos es una práctica extendida pero casi siempre mal calibrada. Un análisis experimental con cuatro proveedores (Anthropic, OpenAI, DeepSeek y Gemini) demuestra que el intervalo habitual de 30 segundos cuesta unas ocho veces más de lo necesario, y propone en su lugar alrededor de 4 minutos, ajustados a la TTL real de cada proveedor.

El autor midió la curva de retención de caché dejando prefijos en reposo y también el coste de los pings periódicos. Sus conclusiones reorganizan varias creencias: la TTL documentada es fiable como mínimo, y no más; OpenAI no era "pegajosa" sino lenta; y Google presenta un comportamiento errático (33–83 % de acierto) que parece lotería de enrutado más que curva de retención.

La economía del keepalive es aritmética pura: cada ping cuesta alrededor del 10 % del precio de entrada y evita un reprefill del 100 % (125 % en Anthropic, que factura la escritura en caché). El intervalo óptimo es el mayor que quede seguro bajo la retención del proveedor: aproximadamente 4 minutos con la TTL de 5 minutos de Anthropic. El umbral de rentabilidad se sitúa en pausas de 12 minutos (Google), 36 minutos (OpenAI y DeepSeek) y 46 minutos (Anthropic): por debajo conviene mantener la caché; por encima, conviene dejarla enfriar y pagar el reprefill al volver.

En una pausa de 10 minutos con un prefijo de 100 000 tokens, el keepalive a 4 minutos ahorra un 38 % en Anthropic (de 0,667 $ a 0,414 $); en el resto de proveedores no ahorra dinero, aunque en DeepSeek reduce la latencia unas 3 veces. Pasado el umbral, cada ping adicional paga una póliza que no se va a cobrar: el reprefill nunca llega, y el dinero se pierde.