Google ha dado un paso significativo en su estrategia de inteligencia artificial conversacional con el lanzamiento de tres nuevos modelos de audio bajo la familia Gemini 3.5: Gemini 3.5 Transcribe, Gemini 3.5 Live y Gemini 3.5 Live Experimental. El anuncio, realizado a través del blog oficial de la compañía, llega en un momento peculiar: mientras los usuarios y desarrolladores esperan desde junio el lanzamiento de Gemini 3.5 Pro, que Google prometió pero aún no ha hecho público, la empresa opta por reforzar su oferta de voz a texto y procesamiento de audio en tiempo real.
La joya de la presentación es Gemini 3.5 Transcribe, un modelo completamente nuevo que Google describe como "el más preciso hasta la fecha" para la conversión de voz a texto. Según la compañía, este sistema es capaz de transcribir en más de 85 idiomas, eliminar expresiones de relleno como "ehs" y "ums", distinguir hasta tres hablantes distintos en audio pregrabado y reconocer acentos regionales o dialectos. Además, interpreta las autocorrecciones que el usuario realiza mientras habla y adapta el resultado para reflejar la intención final del mensaje, una capacidad que supone un salto cualitativo frente a su predecesor, el modelo Chirp 3.
En términos de rendimiento, las cifras aportadas por Google son notables: la latencia se ha reducido un 70% respecto a Chirp 3, mientras que la tasa de errores en transcripción de voz en vivo ha descendido del 7,32% al 5,5%. Aunque Ars Technica señala que la mejora en precisión es modesta, subraya que cualquier avance en este terreno resulta valioso, dado lo tedioso que resulta corregir errores tipográficos cuando se utiliza dictado por voz.
La compañía de Mountain View ha integrado Gemini 3.5 Transcribe en varios de sus productos estrella. En Gboard para Android, el modelo convierte las ideas habladas en texto limpio dentro de la función Rambler. En Google Antigravity, tiene en cuenta el contenido en pantalla y el historial de conversaciones para generar transcripciones más precisas. En la aplicación Gemini para macOS, combina las órdenes de voz con el contexto visual para permitir acciones como resumir archivos, reutilizar texto entre aplicaciones o generar imágenes mediante instrucciones habladas. Google AI Studio, por su parte, permite a los desarrolladores escribir código mediante comandos de voz, aunque esta función está limitada al modo Build. La integración en Chrome, que permitirá dictar texto en cualquier campo de una página web, está prevista para los próximos meses.
Junto al modelo de transcripción, Google ha presentado Gemini 3.5 Live y Gemini 3.5 Live Experimental, que mejoran la tecnología de reconocimiento de voz que alimenta el modo de chat por voz de Gemini. Mientras que 3.5 Live gestiona mejor las interrupciones a mitad de frase, el reconocimiento de idiomas y el procesamiento visual en vivo, la versión Experimental narra su progreso paso a paso mientras aborda tareas de razonamiento más complejas.
En cuanto a la disponibilidad, los nuevos modelos ya están operativos en inglés para todos los usuarios de la aplicación Gemini en macOS y para la función de dictado Rambler en Android en países e idiomas seleccionados. Los desarrolladores pueden acceder a ellos en versión preliminar pública a través de la API de Gemini en Google AI Studio y Antigravity, así como en Gemini Enterprise Agent Platform. El soporte para más idiomas se espera en próximas actualizaciones.
El lanzamiento llega en un contexto competitivo intenso en el sector de la inteligencia artificial generativa, donde la transcripción de voz precisa y multilingüe se ha convertido en un campo de batalla clave. La apuesta de Google por eliminar las palabras de relleno y comprender la intención del usuario, en lugar de transcribir literalmente, marca una filosofía de diseño que prioriza la experiencia del usuario sobre la fidelidad bruta. No obstante, este enfoque plantea interrogantes sobre el grado de intervención del sistema en el mensaje original, una cuestión que la propia Ars Technica advierte como posible punto de fricción: depender de la inteligencia artificial para interpretar lo que realmente se quiso decir implica confiar en que el modelo acierte siempre con la intención.
Con Gemini 3.5 Pro aún pendiente de lanzamiento, Google demuestra que su estrategia de actualizaciones fragmentadas por modalidad (texto, imagen, audio, vídeo) le permite mantener el ritmo competitivo sin necesidad de esperar a un modelo unificado. La pregunta que queda en el aire es si la esperada versión Pro llegará antes de que finalice el año y si incorporará las mejoras de audio presentadas ahora como una capa más del ecosistema Gemini.
