Swiftlet ejecuta modelos MoE de 35B y 80B en dispositivos Apple, incluido el iPhone

Fuentes: Swiftlet runs 35B and 80B MoE Qwen models on Apple devices, including iPhones

Swiftlet es un runtime escrito en Swift y Metal que permite ejecutar modelos MoE híbridos de la familia Qwen3-Next y Qwen3.5/3.6 en hardware Apple convencional. Su estrategia consiste en mantener residente en memoria únicamente el núcleo denso del modelo (atención, proyecciones DeltaNet, routers, expertos compartidos y embeddings, alrededor de 1,3 GB para el 35B y 2,5 GB para el 80B en cuantización de 4 bits) y transmitir desde almacenamiento los pesos de los expertos enrutados bajo demanda, empaquetados en contenedores .qpack con stride fijo para que cada acceso sea una sola lecturapreaddesde SSD sin mmap. El sistema aplica una caché acotada de expertos activos con política LFU más recencia, gestiona el 75 % de las capas mediante atención lineal Gated DeltaNet con estado recurrente fijo (lo que evita un caché KV creciente) y ejecuta todo el forward pass en Metal con shaders compilados en tiempo de ejecución.

En cifras concretas, el modelo Qwen3.6-35B-A3B ocupa 18 GB en disco, exige un pico de 2,6 GB de RAM y alcanza entre 7 y 11 tokens por segundo en un Mac M5; el Qwen3-Next-80B-A3B necesita 42 GB en disco, 4,3 GB de RAM y rinde entre 4,5 y 5 tokens por segundo. El 35B funciona además en un iPhone 17 con unos 2,5 GB de RAM a aproximadamente 1 token por segundo, un hito que los autores consideran la primera ejecución nativa de un modelo de esta clase en un teléfono. Cada capa enruta cada token a 10 de 512 expertos en el 80B o a 8 de 256 en el 35B, lo que se traduce en unos 3.000 millones de parámetros activos por token.

Swiftlet se distribuye como paquete Swift (SwiftletCore), CLI con comandos swiftlet chat, swiftlet generate y swiftlet-repack, un servidor compatible con la API de chat completions de OpenAI en loopback y una integración en la app iOS Priv AI. Requiere Apple Silicon con macOS 14+ o iOS 17+. El proyecto se publica bajo Apache 2.0 y los pesos de los modelos mantienen sus propias licencias.