FnScribe: dictado por voz local para macOS con Whisper

FnScribe es una aplicación de dictado por voz para macOS que ejecuta el reconocimiento de forma local en el equipo, sin enviar audio ni transcripciones a la nube. Funciona desde la barra de menús y permite activar la grabación manteniendo pulsada la tecla fn (Globe) y soltándola para insertar la tra

Moonshine lleva su reconocimiento de voz al navegador con WebAssembly

Moonshine, la biblioteca de reconocimiento de voz de la start-up Moonshine AI, ya puede ejecutarse directamente en el navegador gracias a una compilación en WebAssembly del núcleo en C++ de la herramienta. El desarrollador principal del proyecto publica una versión inicial pensada para que los progr

Qwen Scribe: transcripción local y dictado en macOS con Apple Silicon

Qwen Scribe es una aplicación de código abierto que ofrece transcripción de audio y vídeo y dictado en todo el sistema ejecutándose por completo en un Mac con Apple Silicon, sin cuentas, claves de API ni servicios en la nube. El proyecto se encuentra en la versión 0.1.0-beta.1 y utiliza el modelo Qw

Yap, dictado por voz local y gratuito para macOS 26

Yap es una herramienta gratuita y de código abierto para dictado por voz en macOS que realiza la transcripción íntegramente en el dispositivo, sin enviar audio a la nube ni requerir cuentas, claves de API ni conexión a internet. La aplicación, desarrollada por Frigade, vive en la barra de menús y se

Los orígenes secretos del Amazon Echo y la asistente Alexa

En los primeros meses de 2011, Jeff Bezos dibujó en una pizarra de sala de reuniones el dispositivo que acabaría convirtiéndose en el Amazon Echo: un altavoz controlado por voz, con un precio objetivo de 20 dólares y la inteligencia en la nube, aprovechando Amazon Web Services para mejorar el produc

Erm: una herramienta de línea de comandos para eliminar muletillas del habla

Erm es una herramienta de línea de comandos de código abierto diseñada para eliminar disfluencias como “um”, “uh” y “er” de archivos de audio de voz. Desarrollada por Doug Calobrisi y disponible en GitHub, se ejecuta completamente en local, lo que garantiza la privacidad de las grabaciones. La inter

Agente de voz innovador reduce la latencia a la mitad

Un ingeniero ha desarrollado un agente de voz con una latencia 2 veces menor que las plataformas existentes, utilizando una aproximación de bajo costo y un enfoque innovador. El proyecto, realizado en seis meses como parte de un trabajo para una importante empresa de bienes de consumo, buscó crear u

Moonshine AI: voz sin nube, toolkit de código abierto

Moonshine AI ha lanzado Moonshine Voice, un toolkit de código abierto para desarrolladores que buscan crear interfaces de voz en tiempo real. La herramienta, disponible en múltiples plataformas (Python, iOS, Android, macOS, Linux, Windows, Raspberry Pi, IoT y wearables), se distingue por funcionar c

PersonaPlex: Voz y Roles Dinámicos en Conversaciones

PersonaPlex es un avance significativo en el campo de los modelos de habla conversacional de dobleplex, que permite interacciones de voz a voz en tiempo real con una latencia muy baja, imitando la conversación humana natural. Los sistemas de dobleplex existentes, aunque prometedores, están limitados