Voicebox: dictar, transcribir y pegar texto formateado con un atajo de teclado

Fuentes: Voicebox: voice-to-text tool with Whisper STT and LLM formatting via hotkey

Voicebox es una herramienta de voz a texto de código abierto que captura la voz del usuario, la transcribe con el modelo Whisper y formatea el resultado mediante un modelo de lenguaje. Funciona con un atajo de teclado (Ctrl+Cmd en macOS): al pulsarlo se inicia la grabación y se muestra una pequeña superposición en la parte superior de la pantalla; al soltarlo, el audio se envía a la nube, se procesa y el texto ya formateado se copia al portapapeles y se pega automáticamente en la aplicación que tenía el foco.

La arquitectura combina una aplicación de escritorio construida con Wails (Go y React en WebView) y un worker de Cloudflare con Durable Objects donde se ejecutan Whisper para la transcripción y un LLM para el formateo. La comunicación entre ambos se realiza por WebSocket y se transmite audio PCM en fragmentos de 16 kHz, mono y 16 bits. Para adaptar el resultado al contexto, el cliente envía metadatos del elemento enfocado (aplicación, identificador, rol, título, marcador de posición y valor actual), lo que permite que el formateador ajuste la salida según el campo de destino.

El proyecto admite varios proveedores: en la nube, usa Workers AI con whisper-large-v3-turbo y qwen3-30b-a3b-fp8; en local, puede trabajar con faster-whisper y Ollama, gracias a interfaces definidas en internal/stt e internal/formatter. La grabación máxima ronda los 13 minutos (unos 25 MiB de audio). En macOS, el autorre pegado requiere permiso de Accesibilidad; al primer uso el sistema lo solicita, o puede concederse manualmente en Privacidad y seguridad. La configuración se gestiona en TOML y se carga desde ~/.config/voicebox/voicebox.toml, junto al binario o en el directorio actual. Requisitos: Go 1.24+, Node.js con pnpm, la CLI de Wails v2 y una cuenta de Cloudflare con acceso a Workers AI.