Noticias que mencionan RDMA

Guía para montar un clúster de dos nodos AMD Strix Halo con vLLM y RoCE v2

Esta guía explica cómo configurar un clúster de dos nodos equipados con las placas base Framework Desktop Mainboard con AMD Ryzen AI MAX+ 'Strix Halo' y 128 GB de memoria unificada, conectados mediante tarjetas Intel E810-CQDA1 de 100 GbE sobre el protocolo RoCE v2, para ejecutar inferencia distribu

Cómo saturar una NIC de 400 Gb/s leyendo NVMe con io_uring

Este artículo técnico describe un recorrido de optimización de rendimiento en un sistema de almacenamiento de alto rendimiento ejecutado sobre Linux. El montaje es deliberadamente simple: un único hilo emite lecturas aleatorias de 1 MiB en E/S directa sobre 8 unidades NVMe y envía los datos a un hos

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

thunderbolt-ibverbs: emular InfiniBand sobre USB4 para inferencia distribuida

El proyecto thunderbolt-ibverbs, publicado por la organización hellas-ai, consiste en un módulo para el kernel de Linux y un shim en espacio de usuario que hacen que un enlace genérico USB4/Thunderbolt se presente ante las aplicaciones como un dispositivo InfiniBand de baja latencia y alto rendimien