Speko, una startup respaldada por Y Combinator en su promoción S26, se presenta como el equivalente para voz de OpenRouter, la plataforma que permite elegir entre distintos modelos de inteligencia artificial desde una única interfaz. Su fundador, Bek, lanzó el producto este lunes en Hacker News, donde describió la propuesta: un enrutador inteligente que selecciona automáticamente la mejor combinación de modelos de voz a texto, grandes modelos de lenguaje y texto a voz según las necesidades del cliente, optimizando precisión, latencia o costo en idiomas y regiones específicas.
La idea central de Speko surge de un problema práctico en el sector de los agentes de voz para empresas. Un agente conversacional típico en producción combina tres capas de modelos: reconocimiento automático del habla (STT), un modelo de lenguaje para generar respuestas y síntesis de voz (TTS). Cada una de esas capas cuenta con una decena de proveedores solventes, y cada mes aparecen nuevos modelos en el mercado. Según Bek, la mayoría de los equipos evalúan una vez, eligen una pila tecnológica y nunca la revisan, porque cambiar de proveedor implica una nueva integración y un nuevo debate sobre métricas. El resultado es que muchos sistemas de voz funcionan con modelos del trimestre pasado mientras existen opciones mejores y más baratas.
Antes de fundar Speko, Bek pasó cuatro años como cofundador y director de tecnología construyendo agentes de voz para empresas en Asia, en más de diez idiomas. Cada vez que aparecía un nuevo modelo de voz, repitió el mismo ritual: contratar evaluadores nativos, compararlo con la pila existente y actualizar producción si mejoraba. Speko automatiza ese proceso en una API. El sistema recibe una solicitud con los criterios de optimización (precisión, latencia, costo o un equilibrio entre ellos), el idioma y la región, filtra los modelos medidos para esa combinación, los clasifica y devuelve la respuesta junto con cabeceras que indican proveedor, nombres de modelos y puntuaciones. El enrutador precarga planes de sesión firmados, de modo que cada nueva llamada contacta al proveedor directamente desde memoria, sin un viaje de ida y vuelta al plano de control mientras el usuario espera.
La página web de Speko muestra la cobertura actual de su panel de evaluación de referencia, que incluye modelos en inglés como Universal-3.5 Pro de AssemblyAI, GPT-4o Transcribe y GPT-4o-mini Transcribe de OpenAI, Qwen3-ASR de Alibaba, Chirp 3 de Google, Ink-Whisper, Pulse Pro, Whisper-1, Nova-3 y Nova-2 de Deepgram, Gradium ASR, Grok STT de xAI, Ink-2 de Cartesia, Pulse de Smallest, stt-rt-v5 de Soniox, Solaria-1 de Gladia, Velma 2 de Modulate, Flux, GPT Live Transcribe y Scribe v2 Realtime de ElevenLabs, entre otros. El ranking en inglés sitúa a Universal-3.5 Pro en primer lugar, con una tasa de error de palabras del 2.0% a un costo de 0.0075 dólares por minuto, seguido por GPT-4o Transcribe (2.3%, 0.0060 dólares) y GPT-4o-mini Transcribe (2.7%, 0.0030 dólares). Realtime STT-1 de Inworld aparece en quinta posición con 3.3% de error y un costo de 0.0025 dólares por minuto, el más bajo entre los cinco primeros.
Speko publica sus mediciones con transparencia, algo poco habitual en el sector. La empresa envía las mismas entradas a cada modelo en una región concreta en distintas ejecuciones datadas y publica los rankings completos, incluidos aquellos en los que sus selecciones obtienen peores resultados que las alternativas. Bek señaló que entrenaron un evaluador automático de naturalidad de texto a voz basado en votos ciegos de escuchas comparativos, y que en proveedores que el sistema nunca ha visto votar, elige al mismo ganador que los evaluadores humanos con una frecuencia similar a la coincidencia entre evaluadores humanos.
Los casos de uso que Speko cita ilustran el problema que busca resolver. Un fundador llegó sin saber qué elegir: proporcionó su caso de uso y ahora enruta todo el tráfico a través de la plataforma. Una empresa de gestión inmobiliaria que ejecutaba LiveKit en Python no había actualizado sus modelos STT ni TTS desde el lanzamiento; desconocía que su STT tenía tasas de error altas en sus llamadas y que existían mejores opciones. Otro equipo no sabía qué modelos elegir para español, y un equipo médico desconocía qué STT manejaba mejor el vocabulario clínico.
El modelo de negocio se divide en dos partes. El gateway y la configuración con claves propias del cliente, conocido como BYOK, son y serán gratuitos para siempre. Speko cobra por el enrutador alojado y la gestión de claves con facturación consolidada. Para quienes prefieren evitar un salto de red adicional en la ruta de audio, Speko publicó en código abierto bajo licencia MIT su gateway, un único binario en Go que se ejecuta como sidecar en el contenedor del agente, se comunica mediante un protocolo local sobre socket Unix, fija los hosts del proveedor y adjunta las claves del cliente. En modo BYOK, el gateway no se comunica con los servidores de Speko en absoluto. El componente cuenta con telemetría anónima sin contenido habilitada por defecto, que se puede desactivar con una variable de entorno.
Speko es compatible con la API de OpenAI, de modo que frameworks como LiveKit Agents solo necesitan un hostname y una cadena de modelo. Además ofrece un servidor MCP que se puede agregar con el comando claude mcp add, lo que permite su uso desde asistentes basados en el protocolo Model Context Protocol. Desde que comenzó el batch de Y Combinator a finales de junio, el uso externo ha crecido alrededor de un 25% semanal en promedio, concentrado en las semanas posteriores al lanzamiento. Bek pidió a la comunidad de Hacker News retroalimentación sobre cómo seleccionan actualmente los modelos de voz y qué les genera confianza en las evaluaciones independientes de terceros.
