qMLX: cómo hacer viable la inferencia local de un modelo de 122B en un Mac Studio

Fuentes: qMLX: Maximising my AI psychosis by minmaxing my Mac Studio

qMLX es un fork de rapid-mlx creado por un desarrollador que buscaba ejecutar un modelo de frontera completamente en local sobre un Mac Studio Ultra M3 con 96 GB de memoria unificada. Tras probar primero DS4 Flash —basado en el trabajo de antirez—, descartó ese modelo por su prefill excesivamente lento en contextos largos (de 50 000 tokens en adelante, esperar al primer token podía llevar entre tres y cinco minutos) y se decantó por Qwen 3.5 122B, un modelo MoE con unos 10 000 millones de parámetros activos que encaja bien en el ancho de banda de la máquina y deja margen para una caché KV profunda respaldada por SSD.

El verdadero reto, según explica, no fue elegir el modelo sino depurar tresbugs en su propia pila de servicio que impedían reutilizar la caché entre turnos. El primero era una marca de tiempo única inyectada en el prompt del sistema que rompía la coincidencia byte a byte. El segundo afectaba a la ruta de interrupción: los tokens ya decodificados se perdían del historial al cortar la generación. El tercero era un escritor en segundo plano que llenaba el disco de checkpoints sin clave útil, desplazando al único checkpoint restaurable.

Tras corregir esos tres problemas, una conversación que antes obligaba a reprocesar unos 30 000 tokens en cada turno pasa a servirse en gran medida desde caché, con prefill de apenas decenas o pocos miles de tokens según el turno. El proyecto está disponible en GitHub como qMLX, una bifurcación especializada en atención híbrida.