Meta ha presentado Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real, desarrollado por Meta Superintelligence Labs. Se trata de un sistema de reconocimiento automático de voz que distingue a más de 20 hablantes, es multilingüe y permite una alternancia de código fluida al ejecutarse en servidores conectados.
El modelo pertenece a la familia Muse Spark y es multimodal autorregresivo. Una de sus características principales es que controla cuándo escucha y decide cuánta cantidad de contexto de audio necesita antes de transcribir cada palabra: cuanto más tiempo espera para predecir, mayor es la precisión, aunque también la latencia. Además, incorpora un «retardo adaptativo» que ajusta sobre la marcha el tiempo de procesamiento de cada palabra según su dificultad, y se entrena con aprendizaje por refuerzo para equilibrar rapidez y precisión.
Muse Voice Transcribe está entrenado con más de 70 idiomas, de los cuales 25 han sido ampliamente verificados. Admite de forma nativa entradas de audio de larga duración sin procesamiento posterior y permite interactuar por voz con Meta AI mientras se utiliza cualquier aplicación abierta en el ordenador. Para activarlo basta con mantener pulsada la tecla Fn. Está disponible a través de Meta Model API, Meta AI para Mac y Muse Code.
