Google ha presentado dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, que transforman la generación de audio en un estudio creativo dinámico. Estos modelos permiten a creadores, desarrolladores y empresas diseñar voces originales desde cero mediante prompts de lenguaje natural, superando las limitaciones de los presets estáticos. El modelo Flash TTS se centra en la dirección creativa granular, permitiendo controlar matices de actuación, dialectos y reacciones no verbales en línea, mientras que el Flash-Lite TTS optimiza la escala y el coste para el doblaje de alto volumen y agentes de voz expresivos.
La tecnología soporta más de 100 idiomas y dialectos, incluyendo variantes regionales como el español mexicano o el francés de Quebec. Incluye una biblioteca de más de 2.000 voces listas para producción y capacidades de replicación de voz con verificación de consentimiento y marcas de agua SynthID para garantizar la transparencia y proteger a los talentos vocales. En pruebas de Hume AI, Gemini 3.8 Flash TTS lidera el benchmark de diseño de voz con una puntuación de 71.4, y ambos modelos ocupan los primeros dos puestos en el índice de calidad general. Los modelos están disponibles hoy en Google AI Studio, la API de Gemini y próximamente en Gemini Enterprise, integrándose en plataformas como Agora, LiveKit y Vercel, así como en aplicaciones como Gemini Notebook y Google Vids.
