h3.c es un motor de inferencia nativo para el modelo de generación de vídeo MiniMax-H3, desarrollado específicamente para equipos Mac con chip Apple Silicon (procesadores M3 Max y M5 Max). El proyecto se construye mediante rebanadas verticales funcionales: primero metadatos deterministas del modelo y del host, después paridad portable de bloques Metal, codificación de prompts, funciones de texto a vídeo y audio, condicionamiento por fotogramas inicial y final, y por último referencias ordenadas de tipo Ref2VA para imagen, vídeo y audio.
En su estado actual, la herramienta ya soporta de extremo a extremo la generación de vídeo y audio a partir de prompts, el condicionamiento por primer y último fotograma, y las referencias Ref2VA. El trabajo en curso se centra en optimizaciones de rendimiento y memoria específicas para Metal en los chips M3 Max y M5 Max. La compilación se realiza con un simple make -j8 y requiere tener el snapshot del modelo en Hugging Face en la carpeta ./MiniMax-H3, además de FFmpeg y FFprobe en el PATH.
El binario admite dos modos de uso. Con la bandera -p ejecuta una generación única con parámetros detallados, mientras que sin ella arranca una sesión interactiva al estilo Iris. En la sesión interactiva se pueden encadenar generaciones reutilizando la codificación BF16 del prompt, el DiT preparado y el decodificador de vídeo cargados en memoria. Comandos como !status, !seed random, !seconds 2, !show, !save y !cache permiten controlar la sesión, y !first/!last fijan fotogramas de anclaje persistentes. Para condicionamiento Ref2VA general se usa !ref-image PATH, y las imágenes se enumeran como , , etc.
El control de calidad y velocidad se articula mediante cinco parámetros principales: --steps (número de pasadas de denoising, por defecto 20), --reuse (reutilización del denoiser completo, por defecto 2), --layers (bloques DiT activos, por defecto 45 de 50), --core-reuse (reutilización del núcleo residual, por defecto 4) y --token-reduction (reducción de tokens en bloques intermedios). El proyecto documenta bancos de pruebas comparativos: en un M5 Max, una generación de 4 pasos con 22 fotogramas tarda unos 3,5 segundos frente a 26,4 segundos de la referencia de 29 pasos, con SSIM de vídeo completo de 0,556 frente a la referencia. Una configuración agresiva con token reduction reduce la generación de 45 capas y reuse 2 de 16,69 a 12,60 segundos.
