¿Cuándo merece la pena un puente NVLink?

Fuentes: When is NVLink Worth It?

Dos RTX 3090, un puente NVLink caro y una pregunta: ¿merece realmente la pena para cargas de trabajo de IA? Esta entrada es un benchmark a fondo que intenta responderla.

El autor ejecuta cuatro tipos de pruebas: inferencia con partición por capas y paralelismo de tensores (llama-bench con Llama 3.3 70B y Gemma 4 31B), entrenamiento DDP sobre TinyLlama 1.1B y entrenamiento FSDP sobre Qwen2.5 3B. Cada una representa un patrón distinto de comunicación entre GPUs.

La primera ronda, que usaba NCCL_P2P_DISABLE=1 para simular la ausencia de NVLink, estaba sesgada sin querer: en lugar de recurrir a PCIe peer-to-peer, las GPUs caían a memoria compartida del host (SHM), mucho más lenta. Y lo peor es que no se puede forzar P2P sobre PCIe sin parchear el driver de Nvidia, porque la compañía desactiva P2P por completo en GPUs de consumo como estrategia de segmentación. Existe un parche comunitario (open-gpu-kernel-modules) que lo restaura.

Con P2P realmente activado, el procesamiento de prompts en inferencia con paralelismo de tensores queda prácticamente a la par que con NVLink, y el entrenamiento FSDP recupera más del 90 % del rendimiento de NVLink. En una plataforma de servidor con varios slots PCIe Gen4 x16 completos, el puente NVLink apenas aporta nada.

El escenario cambia en placas base de consumo, cuyas CPUs exponen pocas líneas PCIe. Muchas ranuras 'x16' funcionan en realidad como x8 cuando ambas se usan, e incluso placas premium como la MSI MEG X870E GODLIKE X EDITION (1300 $) o la Gigabyte Z890 AORUS XTREME AI TOP (1000–1800 $) quedan en x8/x8 con dos GPUs. Limitar a x8 cuesta a P2P alrededor del 5 % en inferencia con paralelismo de tensores; limitar a x4 cuesta cerca del 15 %. El entrenamiento FSDP es mucho más sensible: en x8/x8 NVLink es alrededor de un 50 % más rápido, y en x4 duplica el throughput de entrenamiento.

Conclusión: NVLink apenas aporta en hardware de estación de trabajo o servidor con suficientes líneas PCIe, pero sigue siendo la única forma práctica de escapar del techo x8/x8 de las plataformas de consumo para cargas multi-GPU de IA con alta demanda de ancho de banda.