Nari Labs presenta una implementación open source del modelo de síntesis de voz Qwen3-TTS CustomVoice 1.7B que alcanza 10 peticiones por segundo (RPS) con un tiempo al primer audio (TTFA) inferior a 50 milisegundos en percentil 95 sobre una única GPU NVIDIA H100 SXM. El equipo comparó su sistema con cuatro alternativas —vLLM-Omni, SGLang-Omni, VoxServe y M*— bajo tráfico Poisson en bucle abierto, tras ajustar cada motor para minimizar latencia y evitar cortes de audio. Solo la implementación de Nari y VoxServe logran TTFA por debajo de 50 ms a 1 RPS; a 6 RPS todos los motores se sitúan en torno a 100 ms o más, mientras que la propuesta de Nari se mantiene por debajo de 100 ms incluso a 20 RPS.
El sistema produce alrededor de 630 caracteres por segundo a 10 RPS. A un coste de 4,29 dólares por hora por instancia H100, el coste estimado ronda los 2 dólares por cada millón de caracteres a plena utilización, frente a los 100 dólares de ElevenLabs V3 o los 49 dólares de Cartesia Sonic 3.5. Nari Labs publica el código y la metodología de evaluación en GitHub, junto con comparativas de consumo y latencia para los cuatro motores analizados.
