OpenAI lanza GPT-Live, su modelo de voz full-duplex para ChatGPT

Fuentes: Dank Full-Duplex-Architektur: ChatGPT Voice hört zu, während es spricht

OpenAI ha presentado GPT-Live, una nueva generación de su función de voz en ChatGPT que, por primera vez, permite al modelo escuchar y hablar al mismo tiempo gracias a una arquitectura full-duplex. Hasta ahora, el asistente alternaba entre escuchar y responder; con GPT-Live procesa el audio de forma continua y decide en tiempo real cuándo intervenir, admite retroalimentaciones breves como «mmm» y acepta interrupciones reales del usuario.

El sistema se complementa con un mecanismo de delegación: las tareas que requieren búsqueda web o razonamiento profundo se envían en segundo plano a GPT-5.5, de modo que la conversación no se interrumpe. OpenAI ofrece tres niveles de profundidad —Instant, Medium y High— para equilibrar velocidad y capacidad de razonamiento. Según las pruebas internas de la compañía, los usuarios prefirieron GPT-Live-1 frente al Advanced Voice Mode en el 75,7 % de los casos, y la variante mini en el 69,2 %. En el benchmark GPQA de razonamiento científico la tasa de acierto pasó del 45,3 % al 84,2 %, y en BrowseComp saltó del 0,7 % al 75,2 %, mejoras que la empresa atribuye casi por completo a la delegación en segundo plano.

GPT-Live incorpora además medidas de seguridad en tiempo real —redirección de la respuesta, oferta de recursos o interrupción en situaciones de alto riesgo— y un protocolo específico para menores con apoyo en caso de autolesión. El modelo solo utiliza voces predefinidas y no permite imitación de voz. GPT-Live-1 queda como estándar para suscriptores de pago y GPT-Live-1 mini para el acceso gratuito, disponible en iOS, Android y ChatGPT.com. De momento se echan en falta la compartición de vídeo y pantalla presentes en el Advanced Voice Mode.