Este artículo es un build-log técnico que demuestra cómo construir un agente de IA rápido sobre inference serverless, sin sacrificar control ni caer en costes elevados. La pieza narra la construcción de Foodie, un agente que recibe un mensaje de Telegram (por ejemplo, "2 días en Bangalore, amante del biryani, presupuesto bajo") y devuelve un itinerario gastronómico investigado junto con una narración en audio.
La arquitectura combina un marco de agente open source (Hermes, de Nous Research), un Droplet básico de DigitalOcean como host y el motor Serverless Inference de la misma plataforma, que expone más de 70 modelos tras una única clave y un endpoint compatible con OpenAI. El bot usa long polling de Telegram, por lo que no necesita IP pública ni webhook.
El artículo distingue dos métricas de latencia que suelen confundirse: time to first token (TTFT) —lo que tarda el usuario en ver algo— y tiempo total de generación. La primera depende sobre todo del tamaño del contexto enviado al modelo; la segunda, del paralelismo en las llamadas a herramientas. Tres claves prácticas: limitar el contexto que entra en cada turno, escribir las consultas de búsqueda dentro del skill para permitir paralelismo (supports_parallel_tool_calls) y mantener un modelo barato para iterar.
También se detallan decisiones de diseño en los archivos SOUL.md (personalidad y regla de una sola pregunta de intake) y foodie-trail skill (máximo seis búsquedas, rutas a pie, narraciones de 60-90 segundos) que afectan directamente a la velocidad percibida y a la calidad del resultado. El texto termina planteando cuándo deja de tener sentido el enfoque serverless, por ejemplo cuando la carga es sostenida y el coste por token supera al de una instancia dedicada.
