OpenAI ha lanzado GPT-Live-1 en su API, una herramienta diseñada para que los desarrolladores creen aplicaciones y flujos de trabajo con voz natural. Este modelo, que ya estaba disponible en ChatGPT, permite escuchar y hablar simultáneamente, eliminando las latencias y las transiciones frágiles de las arquitecturas tradicionales que encadenan reconocimiento de voz, modelos de lenguaje y síntesis de voz. Al operar en un solo modelo, GPT-Live-1 gestiona interrupciones y silencios de forma fluida, delegando el razonamiento profundo y las llamadas a herramientas en modelos de texto de backend como GPT-6 Astra o modelos de terceros. Esta arquitectura permite que la conversación continúe mientras se procesan tareas complejas en segundo plano. En evaluaciones iniciales, el modelo ha demostrado reducir las interrupciones en casi un 80% en aplicaciones de tutoría de idiomas, otorgando a los usuarios más tiempo para pensar. Además, GPT-Live-1 mejora el rendimiento en la métrica Full Duplex Bench en 30 puntos porcentuales respecto a GPT-Realtime-2.1 y ocupa el primer puesto en Tau3, una métrica de inteligencia para agentes de voz. El modelo está disponible hoy a 0,05 dólares por minuto para la capa de voz, y OpenAI planea ampliar las opciones de acentos, dialectos y idiomas en los próximos meses. También se integra con OpenAI Presence para que las empresas desplieguen agentes de voz que resuelvan problemas y utilicen sistemas corporativos.
