transcribe.cpp es una biblioteca de transcripción de voz a texto basada en ggml, presentada por el autor y mantenedor de Handy como un proyecto de código abierto en su versión 0.1.0. Su objetivo es simplificar la distribución de aplicaciones de reconocimiento automático del habla (ASR) multiplataforma, un problema que las alternativas actuales —whisper.cpp y ONNX— no resuelven de forma satisfactoria: la primera ofrece buen rendimiento pero soporte limitado de modelos y la segunda sacrifica el rendimiento al funcionar solo en CPU. La biblioteca soporta 16 familias de modelos de ASR (más de 60 modelos), con aceleración mediante Vulkan, Metal, CUDA y TinyBLAS, lo que permite ejecutar transcripción más rápido que en tiempo real incluso en hardware modesto como un RK3566. Cada modelo incluido ha sido validado numéricamente y sometido a pruebas de tasa de error de palabra (WER) frente a su implementación de referencia, con resultados publicados en el repositorio y en Hugging Face. transcribe.cpp funciona como sustituto prácticamente directo de whisper.cpp, mantiene compatibilidad con los archivos .bin populares y añade soporte para transcripción en streaming y por lotes. Incluye bindings oficiales de primera parte en Python, JavaScript/TypeScript, Rust y Objective-C/Swift. El proyecto surgió de la necesidad interna de Handy de distribuir actualizaciones de transcripción de forma fiable y eficiente, y recibió apoyo del programa BiR de Mozilla AI, créditos de Modal para pruebas en CUDA y se apoya en la comunidad de ggml. El autor invita a reportar errores y a contribuir con nuevos modelos o bindings para acelerar la maduración de la herramienta.
