ElevenLabs lanza modelo de voz v4 con 90 idiomas y baja latencia

Fuentes: ElevenLabs launches v4 speech model with 90 languages and low latency

ElevenLabs ha presentado el lunes sus nuevos modelos de síntesis de voz, denominados ElevenLabs v4 y v4 Turbo, que incorporan un mayor control de expresión, una latencia reducida para agentes de voz y soporte para más de 90 idiomas. Esta nueva generación, que adopta una arquitectura diseñada para mejorar el control y la velocidad de clonación, permite a los usuarios clonar una voz utilizando solo 10 segundos de audio de referencia.

En el ámbito creativo, el modelo v4 gestiona mejor la identidad de voz en textos extensos y mantiene el contexto semántico para ajustar las expresiones durante la lectura. La empresa ha expandido las etiquetas en línea introducidas en la versión v3, permitiendo a los usuarios apilar múltiples etiquetas para definir secuencias de expresión específicas. En cuanto a la cobertura lingüística, el número de idiomas soportados ha aumentado de 70 a 90, con mejoras notables en japonés, portugués brasileño, mandarín y cantonés.

Desde el punto de vista empresarial, ElevenLabs ha escalado rápidamente su negocio de llamadas corporativas, con más del 55% de sus ingresos provenientes de grandes empresas. El nuevo modelo está optimizado para agentes de voz, ofreciendo una latencia baja que permite generar audio en tiempo real mientras el modelo de lenguaje genera respuestas. La compañía ha reportado un aumento en su tasa de ingresos anualizada, que ha pasado de unos 330 millones de dólares a más de 600 millones de dólares, y ha ampliado su plantilla a más de 800 empleados. El cofundador y CEO, Mati Staniszewski, ha indicado que la empresa busca una salida a bolsa en los próximos años, aunque no ha fijado una fecha concreta.