Deltafin es un proyecto de investigación de código abierto que permite ejecutar Kimi K3, un modelo de lenguaje de tipo Mixture-of-Experts con 2,8 billones de parámetros, en un único Mac con chip Apple Silicon. La clave está en que, en un modelo MoE, solo una pequeña fracción de los pesos se activa por cada token: K3 cuenta con 82.432 expertos enrutados y el router selecciona 16 por capa en cada paso, de modo que basta con cargar esa fracción —unos 25,8 GB por token— en lugar del modelo completo.
El sistema divide los pesos en dos partes. La "columna vertebral" residente, de unos 114 GB en bf16 (cuantizable a int8), contiene atención, expertos compartidos, proyecciones latentes y embeddings, y se lee capa a capa desde el almacenamiento NVMe local. Los expertos enrutados (~1,45 TB) pueden descargarse íntegramente (~1,7 TB de disco, 5-10 horas) para funcionar sin red, o bien transmitirse bajo demanda desde Hugging Face mediante peticiones HTTP por rango, con caché en disco (~215 GB, unos 30 minutos de descarga inicial).
El proyecto emplea kernels NEON fusionados y computación Metal/MPS, ofrece decodificación exacta y reproducible e incluye un servidor compatible con la API de OpenAI (endpoints /v1/chat/completions, /v1/completions y /v1/models, con streaming), lo que permite usarlo con clientes y agentes de código. En un M1 Max con 64 GB genera unos 16 segundos por token, y el rendimiento mejora automáticamente con más RAM y chips más recientes. Entre sus limitaciones destacan que solo admite decodificación greedy, procesa una solicitud a la vez y, en modo streaming, las conversaciones pueden tardar horas por el prefill.
