SpaceXAI lanza Grok Voice Transcribe 2.0 con mayor precisión y mismo precio

Fuentes: SpaceXAI launches Grok Voice Transcribe 2.0 with higher accuracy at same price

SpaceXAI ha presentado Grok Voice Transcribe 2.0, su nuevo modelo de transcripción de voz a texto, que ofrece una precisión superior al doble de la versión anterior, Grok Voice Transcribe 1.0, manteniendo el mismo coste. Este modelo, construido sobre la base de audio del asistente Grok Voice, está diseñado para manejar audio realista con ruido, acentos locales y múltiples hablantes, superando a los modelos que funcionan mejor en entornos limpios.

En pruebas públicas, Grok Voice Transcribe 2.0 ocupa el primer puesto en la tabla de clasificación de Artificial Analysis entre 32 modelos de transmisión. En métricas internas de error de palabras, el modelo mejora significativamente en cuatro conjuntos de datos de tráfico de producción, liderando en llamadas de soporte al cliente. Su mayor avance radica en la transcripción multilingüe, donde reduce el error de palabras en comandos de voz de 20,6% a 6,8% en un solo paso, detectando automáticamente el idioma y gestionando cambios durante la grabación.

El modelo soporta decenas de idiomas y ofrece configuraciones avanzadas. Para los usuarios existentes, las integraciones de la API de Speech-to-Text no requieren cambios de código. Atlassian ya utiliza este modelo para transcribir todas sus grabaciones de pantalla en Loom, facilitando flujos de trabajo de IA que integran transcripciones en herramientas como Cursor. El precio por hora de audio sigue siendo de 0,10 USD para transcripciones por lotes y 0,20 USD para transmisión en directo, incluyendo diarización y marcas de tiempo. Grok Voice Transcribe 2.0 se convertirá pronto en el modelo predeterminado, mientras que la versión 1.0 será descontinuada en las próximas semanas.