Fish Audio cierra una ronda semilla de 50 millones para modelos de voz con IA

Fuentes: Fish Audio raises $50M seed to build AI voice models for creators and enterprises

La startup Fish Audio, con sede en Palo Alto, anunció este martes una ronda semilla de 50 millones de dólares liderada por Coreline Ventures y Capital Today, con participación de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0. La compañía desarrolla modelos de voz con IA que incorpora más de 15.000 controles de lenguaje natural y que ya utilizan más de 8 millones de personas en sus versiones de código abierto y alojada, con un ARR de 21 millones de dólares.

Fish Audio nació como un proyecto del exinvestigador de NVIDIA Shijia Liao, quien entrenó un modelo de generación de voz en una sola GPU tras frustrarse por la falta de expresividad de las voces sintéticas disponibles. Su repositorio Fish Speech en GitHub suma más de 31.000 estrellas. En el último año la empresa lanzó cinco modelos —cuatro de generación de voz y uno de voz a texto— y mantiene en código abierto tres de ellos, mientras que su modelo S2.1 Pro solo se ofrece mediante la API de pago.

La compañía ofrece suscripciones mensuales para creadores y equipos, con funciones de clonación de voz, y una versión empresarial ya utilizada por HeyGen, Sanas y Plaud. Según explicó su cofundadora y CEO Rissa Cao, distintos clientes demandan necesidades opuestas: realismo para avatares, expresividad para personajes de videojuegos y baja latencia para agentes conversacionales.

El enfoque comunitario ha generado controversias: varios creadores denunciaron que sus voces fueron subidas sin consentimiento. Fish Audio afirma haber automatizado el proceso de retirada, que ahora tarda menos de tres minutos, aunque hasta entonces la voz puede seguir usándose en la plataforma. Fish Audio lanzará este año un modelo de comprensión de audio y desarrolla un modelo de voz a voz en un mercado competido con ElevenLabs, Cartesia, Speechify y Krisp.