El reconocimiento de voz no empeora con la edad; los agentes de voz sí interrumpen a los mayores

Fuentes: Speech recognition does not degrade with speaker age. Voice-agent turn-taking does, by 2-5x.

Un repositorio de código abierto cuestiona un supuesto muy extendido en el diseño de asistentes conversacionales por voz: que el reconocimiento automático del habla (ASR) falla con las personas mayores. El proyecto, del usuario Kayvan-Zahiri en GitHub, replica un banco de pruebas sobre 2.760 clips de Common Voice emparejados por acento, género y locutor, y llega a la conclusión opuesta. Whisper transcribe a hablantes de 60, 70 y 80 años con menor tasa de error por palabra (WER) que a los de 20: 5,23%, 4,67% y 6,24% frente a 6,53%. El resultado se mantiene con wav2vec2 (CTC puro, sin modelo de lenguaje), lo que descarta que sea un artefacto del decodificador.

El problema real está en la toma de turno. Los agentes que deciden el cierre con un umbral fijo de silencio interrumpen a los mayores de 60 el doble de veces que a los jóvenes porque hacen más pausas internas y más largas. A 700 ms, el corte prematuro sube de 8,0% (veinteañeros) a 19,7% (sesentones) y a 16,6% (setentones); en los octogenarios alcanza un 22,1% frente a 4,1%, una diferencia de 5,4 veces. Usar un modelo semántico de turno como smart-turn v3 de Pipecat reduce la brecha a la mitad y la deja dentro del intervalo de confianza. El benchmark se reproduce con un script sin claves de API y discute sus limitaciones, incluida la validez externa más allá de Common Voice y la alta variabilidad intra-locutor que complica detectar declive cognitivo a partir de biomarcadores de voz.