DwarfStar 4: motor de inferencia local para modelos de IA

Fuentes: DwarfStar 4: Local DeepSeek V4.1, Qwen and GLM Inference Engine

DwarfStar 4 (ds4) es un motor de inferencia escrito en C diseñado para ejecutar modelos de inteligencia artificial de frontera localmente en máquinas con alta memoria, como Mac, sistemas con CUDA y hardware con ROCm. A diferencia de los ejecutores genéricos, ds4 se centra en un conjunto selecto de familias de modelos, validando cada configuración de memoria de forma exhaustiva. El proyecto soporta DeepSeek V4 y V4.1 Flash, GLM 5.x y Qwen3.8 Flash Next, ofreciendo una solución unificada para modelos de texto y visión.

La arquitectura de ds4 se basa en la cuantización asimétrica de 2 bits, una técnica que comprime los expertos de mezcla de expertos (MoE) mientras preserva la precisión en las rutas críticas del modelo. Esto permite que modelos que normalmente requieren servidores remotos funcionen de manera práctica en hardware local de alto rendimiento. El sistema expone una interfaz de línea de comandos (CLI), APIs HTTP compatibles con los estilos de OpenAI y Anthropic, y un agente nativo para sesiones de codificación persistentes. Además, implementa una función de recuperación de contexto: los prefijos largos se guardan en SSD y se reanudan mediante un hash de prompt, evitando la re-prefill completa en cada reinicio.

En cuanto a rendimiento, los benchmarks indican que un Mac M5 Max con 128 GB de memoria puede procesar un contexto de 2,048 tokens a 790.2 tokens por segundo en generación y 398.5 en pre-prefill con un contexto de 65,536 tokens. El proyecto está licenciado bajo MIT y está dirigido a desarrolladores que buscan optimización de recursos y control total sobre la inferencia local, en lugar de depender de servicios en la nube.