Storyteller es una plataforma de software que automatiza la lectura inmersiva mediante un algoritmo de alineación forzada que sincroniza ebooks con audiolibros. El sistema identifica automáticamente dónde se pronuncia cada palabra del texto escrito dentro de la grabación de audio, sin requerir intervención manual del usuario. Esta información se incrusta en el archivo EPUB utilizando la especificación Media Overlays, permitiendo a las aplicaciones lectoras resaltar las frases en tiempo real mientras el narrador las lee.
El desarrollo inicial enfrentó desafíos técnicos significativos, como la discrepancia en el orden de los capítulos entre formatos, la omisión de secciones (prólogos o apéndices) y variaciones léxicas intencionales por parte de los narradores. A diferencia de herramientas anteriores que requerían mapeo manual de capítulos, Storyteller implementa un algoritmo de búsqueda para resolver estas inconsistencias.
Técnicamente, el proceso utiliza el modelo Massively Multilingual Speech (MMS) basado en Wav2Vec 2.0 y Connectionist Temporal Classification (CTC). El audio se procesa en cuadros de 20 milisegundos para generar emisiones CTC, que son matrices de probabilidades de caracteres. Mediante una decodificación voraz no restringida, el sistema extrae una representación textual aproximada del audio, lo que permite localizar los límites de los capítulos y facilitar la alineación precisa posterior entre el texto estático y la narración dinámica.
