Moonshine Micro es una versión del kit de herramientas de voz con IA de código abierto Moonshine Voice pensada para procesadores embebidos, como microcontroladores y DSP. Su plataforma de referencia es el Raspberry Pi RP2350, un chip cuyo precio minorista ronda los 0,80 dólares. La herramienta integra detección de actividad de voz (VAD), reconocimiento de comandos (STT) y síntesis de habla neuronal (TTS), y puede ejecutarse consumiendo tan solo 470 KB de RAM.
El proyecto está pensado para sistemas con recursos muy limitados. En el RP2350, el pipeline completo (VAD + STT + TTS) ocupa aproximadamente 3,6 MiB de flash y unos 468 KiB de SRAM aprovisionados sobre los 520 KiB disponibles. Los tres módulos comparten un único arena de TensorFlow Lite Micro de unos 384 KiB y se ejecutan de forma secuencial, por lo que la memoria no es acumulativa. El TTS neuronal basado en difonios a 16 kHz necesita un paquete de voz de 1,8 MiB, mientras que el STT basado en SpellingCNN alcanza unos 36 MMAC/s y el TTS, en condiciones típicas, unos 37 MMAC por respuesta. El ciclo completo de clasificación y reproducción ronda entre 0,7 y 1,0 segundos.
Las bibliotecas de VAD, STT y TTS pueden utilizarse de forma independiente y se apoyan en TensorFlow Lite Micro para los cálculos neuronales. El repositorio incluye además un ejemplo extremo a extremo de conexión Wi-Fi por voz sobre el RP2350. Todo el código, salvo el contenido de la carpeta third-party, se distribuye bajo licencia MIT, lo que permite su uso en aplicaciones comerciales. Los modelos SpellingCNN y TinyVadCNN también se publican bajo MIT.
