La inferencia de modelos de lenguaje de gran tamaño entra en una nueva fase con las aplicaciones de IA agéntica: una sola petición puede alcanzar un millón de tokens al sumar instrucciones largas, llamadas a herramientas y resultados de recuperación. Durante la generación, cada token nuevo debe atender a todos los anteriores almacenados en la caché KV, lo que convierte al subsistema de memoria en el cuello de botella principal.
La nueva GPU AMD Instinct MI450 llega precisamente para responder a esa presión: duplica los registros vectoriales por SIMD (de 512 a 1024 VGPR), amplía la memoria local compartida LDS de 160 KB a 320 KB por WGP, multiplica por 1,5 la capacidad de HBM (de 288 GB a 432 GB) y casi 2,5 veces el ancho de banda HBM (de 8,1 TB/s a 19,6 TB/s). Incorpora además la unidad TDM, que mueve bloques de tensores entre memoria global y LDS con transferencias asíncronas descritas por descriptor, y soporta clústeres de grupos de trabajo con barreras por hardware y cargas multicast.
La guía utiliza Gluon, un DSL de bajo nivel basado en Triton que exige declarar el layout de cada tensor, para escribir un kernel de atención en descodificación MQA. Detalla cuatro optimizaciones clave —layout de tensores, carga de datos, segmentación y paralelización con Split-k— y presenta un kernel Gluon optimizado que alcanza el 85 % del ancho de banda pico de HBM en MI450 como resultado preliminar.
