Speko (YC S26), un enrutador para elegir modelos de voz en producción

Speko, una startup respaldada por Y Combinator en su promoción S26, se presenta como el equivalente para voz de OpenRouter, la plataforma que permite elegir entre distintos modelos de inteligencia artificial desde una única interfaz. Su fundador, Bek, lanzó el producto este lunes en Hacker News, don

Inflect-Micro-v2: TTS local de menos de 10 millones de parámetros

Inflect-Micro-v2 es un modelo de síntesis de voz texto a forma de onda que funciona de forma local, con 9,36 millones de parámetros y 37,53 MB en FP32, y que produce audio mono a 24 kHz. Su autor, Owen, lo ha desarrollado y financiado de forma independiente y lo distribuye en Hugging Face con versio

xAI lanza 21 voces nuevas multilingües para Grok Voice

xAI ha presentado 21 voces nuevas para Grok Voice, que se suman a las cinco originales y están disponibles desde ahora en las API de Voice Agent y de Texto a Voz, así como en el nuevo Grok Voice Agent Builder, la consola de xAI para crear agentes de voz a medida. Cada voz se diseñó para un uso espec

Kokoro, un TTS local, ligero y de alta calidad que funciona sin GPU

Kokoro es un modelo de síntesis de voz (TTS) de código abierto con solo 82 millones de parámetros capaz de generar audio realista en inglés, mandarín e hindi, entre otros idiomas, y ofrece alrededor de 50 voces distintas. Su principal atractivo es que produce resultados de alta calidad funcionando í

MOSS-TTS Family: modelos de síntesis de voz y sonido de código abierto

MOSS-TTS Family es una familia de modelos de síntesis de voz y sonido de código abierto desarrollada por MOSI.AI y el equipo OpenMOSS. Su objetivo es cubrir múltiples escenarios reales con alta fidelidad y expresividad, incluyendo locuciones largas estables, diálogos con múltiples hablantes, diseño

VoxCPM2: sistema TTS multilingüe de código abierto con clonación de voz

OpenBMB ha lanzado VoxCPM2, la nueva versión de su sistema de síntesis de voz (TTS) que prescinde de tokenización. Se trata de un modelo de 2 000 millones de parámetros entrenado con más de dos millones de horas de datos en 30 idiomas. La herramienta permite generar voz directamente a partir de text

SaySynth: breve historia de las máquinas parlantes

Adam Abelson presentó SaySynth en la conferencia composition.codes el 21 de diciembre de 2025, un sintetizador construido sobre el marco de texto a voz de macOS conocido popularmente como el comando 'say'. El proyecto parte de un hallazgo: el sistema TTS de Apple incluía un DSL oculto y de bajo nive

Google Maps: indicaciones de ruta solo con texto

El proyecto "Text-Based Google Directions" (o Direcciones de Google Basadas en Texto) es una iniciativa que permite obtener indicaciones de ruta de Google Maps utilizando únicamente texto, sin necesidad de una interfaz gráfica. Esto puede parecer simple, pero implica una complejidad técnica consider

PersonaPlex: Voz y Roles Dinámicos en Conversaciones

PersonaPlex es un avance significativo en el campo de los modelos de habla conversacional de dobleplex, que permite interacciones de voz a voz en tiempo real con una latencia muy baja, imitando la conversación humana natural. Los sistemas de dobleplex existentes, aunque prometedores, están limitados