TurboFieldfare: ejecutar Gemma 4 26B-A4B con unos 2 GB de RAM en cualquier Mac Apple Silicon

Fuentes: TurboFieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook

TurboFieldfare es un runtime escrito en Swift y Metal que permite ejecutar el modelo de lenguaje Gemma 4 26B-A4B de Google en un MacBook con Apple Silicon usando apenas unos 2 GB de memoria RAM, frente a los 14,3 GB que ocupa el modelo completo en disco. El truco reside en mantener en memoria únicamente el núcleo compartido de 1,35 GB y la caché KV en FP16, mientras que los expertos específicos de cada token se transmiten bajo demanda desde la unidad SSD. La arquitectura MoE del modelo —26 000 millones de parámetros totales, de los que unos 3 880 millones se activan por token— hace viable esa descarga selectiva, ya que nunca se necesita el modelo entero al mismo tiempo.

El proyecto se distribuye como un paquete Swift con seis productos: la biblioteca runtime con sus kernels Metal, una aplicación nativa para macOS, un servicio de decodificación, una interfaz de línea de comandos, un servidor OpenAI-compatible en loopback y un instalador que reformatea el checkpoint al vuelo desde Hugging Face sin descomprimirlo en disco.

En un MacBook Air M2 de 8 GB se miden entre 5,1 y 6,3 tokens por segundo en decodificación, mientras que en un M5 Pro de 24 GB se alcanzan entre 31 y 35 tok/s. Los autores subrayan que esas cifras son referencias, no techos: influyen la longitud del prompt, la del texto generado y el estado de la caché de páginas. El sistema requiere macOS 26 con Metal 4, Xcode 26 y Swift 6.2 o superior, y solo funciona en arquitecturas arm64. La aplicación y la CLI son exclusivamente de texto; el servidor experimental admite declaraciones de herramientas, pero no ejecuta imágenes, audio ni vídeo.