VoxMem es un benchmark diseñado para evaluar la capacidad de recuperación de información en modelos de lenguaje de audio (LALM) de gran escala. A diferencia de las pruebas existentes, que se centran principalmente en el contenido léxico y tratan la memoria como un problema de una sola sesión, VoxMem aborda la complejidad de las conversaciones habladas, donde la información relevante puede residir en el tono, la identidad del hablante o el ruido ambiental, datos que no se capturan en transcripciones de texto.
El sistema se basa en una taxonomía que clasifica la evidencia acústica en cuatro tipos: semántica del habla, identidad del hablante, señales paralingüísticas y sonido ambiental. Simultáneamente, define cuatro operaciones de memoria: extracción de información, razonamiento multi-sesión, seguimiento temporal y rechazo de respuestas. VoxMem incluye 3.196 instancias de evaluación distribuidas en 34.743 sesiones habladas, con un total de 177 horas de audio. Los datos están estratificados por presupuestos de contexto que van desde 8.000 hasta 64.000 tokens.
La evaluación abarca 15 modelos de LALM. Los resultados indican que ningún modelo supera el 40% de precisión en el contexto de 32K tokens. Los modelos retienen significativamente mejor la información sobre lo que se dijo que la identidad del hablante o el tono, una brecha que se amplía en operaciones más complejas y con historiales más largos. VoxMem busca proporcionar una base sólida para medir y mejorar el rendimiento completo de la memoria en sistemas conversacionales hablados.
