AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

Fuentes: AirLLM: run 70B LLMs on a single 4GB GPU

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda. La técnica se basa en descomponer el modelo por capas y cargar en disco únicamente las partes necesarias, mientras la compresión opcional mediante cuantización por bloques de 4 u 8 bits puede acelerar la inferencia hasta tres veces con una pérdida de precisión casi imperceptible.

El proyecto, disponible en GitHub bajo el nombre airllm, ofrece una interfaz sencilla: tras instalarlo con pip install airllm, basta con invocar AutoModel.from_pretrained() indicando el repositorio o la ruta local del modelo. Esta misma API es compatible con un amplio abanico de arquitecturas, entre ellas Llama 2 y 3, Qwen, Qwen3, DeepSeek V2 y V3, Mistral, Mixtral, Phi-4, Gemma, ChatGLM, Baichuan e InternLM.

Entre los hitos recientes destaca el soporte para DeepSeek-V3 (671B), ejecutable en alrededor de 12 GB, y para Qwen3-235B en aproximadamente 3 GB. La versión 3.0 añadió compatibilidad con modelos FP8, y en julio de 2026 se anunció soporte para Kimi K3, un modelo sparse MoE de 2,8 billones de parámetros —el mayor de código abierto hasta la fecha—, que funciona en menos de 4 GB mediante la carga selectiva de los expertos que cada token necesita. La biblioteca también funciona en CPU y en Apple Silicon (con mlx y torch), e incluye quantization opcional, prefetching para solapar carga y cómputo, y opciones para liberar espacio en disco tras la descomposición del modelo.