WASTE: un motor en C ejecuta el modelo Kimi K3 de 2,78 billones de parámetros desde un NVMe en un portátil

Fuentes: WASTE: a dependency-free C engine streams the 2.78T-parameter Kimi K3 from NVMe on a consumer laptop

WASTE es un motor de inferencia escrito en C, sin dependencias externas y totalmente integrable, capaz de ejecutar modelos de escala frontier directamente desde unidades NVMe. Su demostración principal es el modelo abierto Kimi K3, con 2,78 billones de parámetros, convertido en un contenedor de 982 GiB que corre en un MacBook Pro de 64 GB de RAM a 0,49–0,54 tokens por segundo. El sistema no es una versión destilada ni podada: se trata del modelo completo, que en su forma original ocupa 1,42 TB.

La clave es que un modelo de mezcla de expertos solo activa alrededor del 4 % de sus pesos por token, de modo que la mayor parte del modelo permanece inactiva en cada instante. WASTE mantiene el tronco residente en memoria, transmite desde disco los expertos que activa cada token y aprovecha la RAM restante como caché acotada de expertos. Cada experto se almacena con un diseño alineado a 4 KiB que permite leerlo con una sola operación pread. La corrección se valida contrastando cada capa con una referencia en PyTorch, con coincidencia de logits de 3,6e-06.

En cifras prácticas, un token requiere leer 17 GB de expertos: en un SSD interno eso equivale a 12,78 GB/s, mientras que en una carcasa USB se reduce a 0,94 GB/s y un solo token tarda trece segundos. El requisito mínimo es 29,05 GB de RAM para abrir K3 con contexto 4K, aunque 64 GB es el valor recomendado para un rendimiento estable. Para quienes carecen de un terabyte libre, el mismo motor ejecuta Kimi-Linear-48B-A3B-Instruct en un contenedor de 19 GB con un suelo de 1,87 GB y 10,7 tokens por segundo. La API pública consta de 26 funciones en waste.h, con un binario CLI como cliente de referencia. El proyecto lo publica sqliteai en GitHub.