Cómo exprimir varias GPU de desecho para ejecutar modelos de IA en casa

Fuentes: AI At Home Part 2: Multi GPU Drifting

Este artículo explica, desde una perspectiva práctica y accesible, cómo aprovechar varios GPU reciclados para ejecutar modelos de lenguaje de gran tamaño en un servidor doméstico. Tras una introducción al funcionamiento básico de los transformers y al concepto de token, el texto repasa por qué la generación de texto depende más del ancho de banda de memoria que de la potencia de cálculo: cada nuevo token requiere releer todos los pesos del modelo. También describe la arquitectura de Mezcla de Expertos (MoE), donde solo una fracción de los pesos se activa por token pero todos deben permanecer en memoria rápida, lo que dispara los requisitos de VRAM.

El núcleo del artículo se centra en las dos estrategias principales de paralelismo multi-GPU relevantes para un usuario particular. El paralelismo por capas reparte las capas del modelo entre distintas GPU y procesa cada token de forma secuencial, con lo que el ancho de banda efectivo se mantiene igual que el de una sola GPU. El paralelismo por tensores, en cambio, divide cada capa entre varias GPU que calculan fragmentos de la multiplicación de matrices en paralelo. El autor promete cubrir en una siguiente sección la prueba práctica de estas técnicas sobre su servidor con cuatro GPU AMD V620 de 32 GB cada una, comparando el rendimiento real frente al teórico. El enfoque combina contexto teórico, crítica de ideas recibidas y orientación práctica para aficionados que intentan ejecutar modelos grandes en hardware no profesional.