Edge0 Audio8 ASR Infinite es un modelo de reconocimiento de voz nativo en streaming diseñado para ofrecer latencia mínima y transcripciones de audio de longitud ilimitada. Su arquitectura hereda la estructura Voxtral Realtime y combina un Decoder basado en Qwen2.5-3B-Instruct con un sistema de caché KV rodante que mantiene la memoria y el retraso controlados durante operaciones 24/7. El modelo soporta transcripción en chino y inglés, con una tasa de decodificación de 12.5 tokens por segundo y un retraso de transcripción configurable entre 240 y 560 milisegundos. Incluye VAD semántico para distinguir pausas de pensamiento y estertores, algo que los VAD acústicos tradicionales no logran. El modelo pesa 8.17 GB y utiliza bfloat16 para optimizar el rendimiento. Se proporciona soporte para inferencia mediante Transformers, vLLM con Docker Compose y decodificación simulada en Torch. Las pruebas en conjuntos de datos como Aishell y LibriSpeech muestran una precisión superior a modelos similares, con tasas de error (CER/WER) significativamente menores. La versión actual es un preview que entrega la base de transcripción, con planes de expansión hacia la percepción semántica en tiempo real.
