Wispr lanza Canto, su modelo de voz con menor error en dictado real

Fuentes: Wispr launches Canto, its speech model with lowest error in real-world dictation

Wispr Advanced Interfaces Lab ha presentado Canto, un modelo de reconocimiento de voz diseñado específicamente para condiciones de uso realistas. A diferencia de los modelos anteriores que funcionan mejor en entornos controlados, Canto está optimizado para transcripciones en tiempo real realizadas en oficinas, transporte o entornos ruidosos. En una evaluación comparativa con modelos de Google, OpenAI, AssemblyAI y Deepgram, Canto logró la tasa de error de palabra (WER) más baja en dictados del mundo real, superando a la mayoría de las soluciones de transcripción en vivo.

El desarrollo se basa en un conjunto de datos de 10 horas de dictados de más de 2.300 usuarios, con estricta separación entre conjuntos de entrenamiento y prueba para evitar sobreajuste. Además, el equipo creó un conjunto de prueba de 3 horas enfocado en situaciones desafiantes, como audio con música, tráfico, viento o voz susurrada. En este escenario, Canto se situó en segundo lugar solo detrás de Gemini 3.1 Pro de Google, un modelo multimodal de gran escala que no es apto para aplicaciones de baja latencia. Entre los modelos de transcripción en tiempo real, Canto fue el mejor en todas las métricas.

Técnicamente, Canto combina un modelo preentrenado con aprendizaje por refuerzo (RL) mediante Group Relative Policy Optimization (GRPO). Este enfoque permite evaluar transcripciones completas y ajustar el modelo según la calidad final, no solo paso a paso. El sistema también integra correcciones de usuarios para adaptarse a cambios en vocabulario y contexto, mejorando la precisión en dictados espontáneos donde el contexto lingüístico es limitado.