AMD GFX1250: lo que los commits de LLVM revelan sobre la nueva generación Instinct

Fuentes: Scrying the AMD GFX1250 LLVM Tea Leaves

AMD ultima el lanzamiento de su serie MI400 de aceleradores para centros de datos, que se presentará en su evento Advancing AI. Antes del anuncio, el análisis de los commits preliminares de LLVM —el compilador open source en el que se apoya ROCm— permite reconstruir la arquitectura del chip bautizado como GFX1250 y destinado al mercado de machine learning bajo el nombre comercial MI455X, pieza clave del rack Helios. Un segundo silicio, GFX1251 (MI430X), apunta a HPC y promete más de 200 TFLOPs de doble precisión nativa, aunque queda fuera del análisis actual.

El artículo describe las principales novedades técnicas del GFX1250 a partir del código LLVM. Entre las similitudes con la arquitectura de consumo RDNA4 destaca la organización en WGPs (Workgroup Processors) compuestos por dos pares de dos arrays SIMD32, aunque AMD distingue cuatro SIMDs por CU según el contexto, una diferencia que parece más terminológica que estructural gracias a una jerarquía de caché compartida. El GFX1250 opera exclusivamente en modo Wave32, frente al soporte Wave64 de RDNA y CDNA previas, y cada SIMD puede ejecutar 20 waves, cuatro más que RDNA4.

Los cambios respecto a la familia CDNA son profundos. Cada wave ahora direcciona hasta 1024 registros vectoriales (VGPRs) frente a los 512 de CDNA y los 256 de RDNA. La memoria local LDS alcanza 320 kB por wavefront, el doble que CDNA4 y muy por encima de los 64 kB de RDNA. Además, AMD fusiona por primera vez la caché L0 vectorial y la LDS en una única estructura de 448 kB bautizada como WGP Cache (WGP$), alineándose con Nvidia e Intel. El chip mantiene packed fp32 y hereda las unidades SDMA de CDNA, pero prescinde de cualquier instruccion grafica (rasterizador, texturas, BVH, MTBUF, MUBUF), lo que lo convierte en un acelerador de calculo puro, incluso mas especializado que sus predecesores.