Reducir la latencia de cola en los productos conversacionales basados en modelos de lenguaje no requiere necesariamente pagar el doble por un nivel de servicio prioritario. La empresa HOAi, que desarrolla agentes de voz que atienden llamadas telefónicas, experimentó con una alternativa más barata: enviar cada petición al LLM dos veces y conservar la respuesta más rápida.
En una llamada típica, cada turno genera una solicitud al modelo. La mayoría de respuestas llegan en menos de 1,5 segundos, pero algunas se alargan entre 10 y 20 segundos, lo que provoca silencios que terminan en abandonos. Con 20-30 turnos por llamada y un 1 % de peticiones muy lentas, la probabilidad de toparse con un silencio prolongado ronda el 22 %.
HOAi comparó, sobre 50 peticiones reales de producción, el nivel prioritario de OpenAI (al doble de coste por token) con el nivel estándar enviando cada petición dos veces. El tiempo hasta el primer token bajó en percentil 99 de 4,2 a 1,2 segundos, y el peor caso de respuesta completa cayó de 9,8 a 3,5 segundos. La mediana se mantuvo igual en ambos escenarios.
El método funciona cuando las respuestas lentas son raras e independientes entre sí: es improbable que ambas copias se retrasen a la vez. Para equipos que construyen experiencias en tiempo real, la recomendación es comparar ambas estrategias antes de asumir el coste extra del nivel prioritario.
