Inflect-Micro-v2 es un modelo de síntesis de voz texto a forma de onda que funciona de forma local, con 9,36 millones de parámetros y 37,53 MB en FP32, y que produce audio mono a 24 kHz. Su autor, Owen, lo ha desarrollado y financiado de forma independiente y lo distribuye en Hugging Face con versiones oficiales en PyTorch y ONNX Runtime. La familia Inflect v2 ofrece dos tamaños bajo una misma API pública: Micro (por debajo de 10M de parámetros, prioriza calidad) y Nano (por debajo de 4M, prioriza huella).
El modelo es un TTS en inglés de voz fija con semillas deterministas, gestión de textos largos e inferencia en CPU o CUDA. En una evaluación ciega con la comunidad obtuvo una preferencia del 66,2% (21 victorias, 10 derrotas, 3 empates) frente a referencias compactas como KittenTTS Nano, Piper Low y Supertonic 3. En inteligibilidad, Inflect-Micro-v2 registra un WER medio de 3,99% combinando Qwen3-ASR y Nemotron 3.5, con un UTMOS22 de 4,395 (IC 95% 4,381–4,408) y 6,28 veces tiempo real en CPU de 4 hilos. El protocolo completo (Modern400, 400 prompts no vistos, SHA-256 b7504ce2…) está publicado bajo evaluation/final/ para auditoría.
El proyecto resulta útil para desarrolladores que necesitan TTS ejecutable en local sin servicios en la nube, con una huella de peso reducida y latencia baja. Como limitaciones, solo soporta inglés, no se publica como el sistema compacto más rápido y las comparativas de velocidad mezclan runtimes PyTorch y ONNX. Si el modelo encuentra audiencia, Owen plantea una futura v3 con más idiomas, voces y mejoras de estabilidad.
