Un sistema de ultrasonido convierte movimientos silenciosos de la lengua en texto

Fuentes: Silent speech with ultrasound

Un equipo de investigadores ha entrenado un modelo capaz de transcribir el habla a partir de grabaciones de ultrasonido de la lengua mientras la persona permanece en silencio. Colocan una sonda bajo el mentón para capturar vídeos del movimiento lingual y los transforman en palabras, una técnica de 'habla silenciosa' que evita que旁人 escuchen la conversación.

El sistema alcanza un 15,6% de tasa de error por palabra (WER) en reconocimiento de vocabulario abierto, frente al 83,8% de WER de la mejor referencia previa de ultrasonido publicada. Por comparar, la lectura de labios con 1 millón de horas de datos consigue un 12,5% de WER, lo que los autores consideran prometedor dada la fase temprana del proyecto.

Para entrenar el modelo reunieron 50 horas de datos propios: personas leyendo relatos cortos en voz alta mientras una ecografía registraba su lengua. Validaron la calidad transcribiendo el audio y comprobando que coincidía con el texto previsto. Arquitetctónicamente, combinaron un codificador de vídeo ResNet-18 2+1d con el decodificador de Whisper Base, alineando los embeddings visuales del vídeo con los del audio para que el decodificador generase texto. El modelo aún falla con acentos no estadounidenses, pero los autores destacan que la WER cae de forma sostenida al crecer el conjunto de datos.

Quedan retos de hardware pendientes: reducir el tamaño y peso de la sonda y reemplazar el gel de ultrasonido por materiales prácticos como hidrogeles, con el objetivo de convertirla en un wearable ligero o un parche adhesivo. Para los autores, esta vía permitiría una comunicación privada con dispositivos en entornos compartidos, de forma similar a como los auriculares hicieron privada la escucha.