Este artículo técnico explica por qué la combinación de MLA (atención de latente múltiple) con MTP (decodificado especulativo o multi-token prediction) tiende a perjudicar el rendimiento en las GPUs actuales, partiendo de un comentario del investigador Su Jianlin. La clave está en la intensidad aritmética: los FLOPs por byte movido desde la memoria HBM durante la fase de decodificado de un solo token.
El autor desglosa matemáticamente la atención y demuestra que, con caché KV en BF16, la intensidad aritmética del núcleo de atención es independiente del tamaño de contexto y de la dimensión de cabeza: MHA da exactamente 1, GQA equivale a Hq/Hkv, MQA es igual al número de cabezas de consulta y MLA ronda 2·Hq. Es decir, MLA prácticamente duplica la intensidad aritmética frente a MHA.
Ese ~2 multiplicador coloca al decodificado de MLA cerca del punto de equilibrio teórico (roofline) de las GPUs H100, H200 y B200, en torno a 200-300 FLOP/B. Al añadir MTP, que busca intercambi
ar cómputo por velocidad, la carga pasa al régimen compute-bound y la ganancia se diluye. El texto recorre con detalle el conteo de FLOPs por proyección, score y suma ponderada, señala que la proyección QKV no es despreciable frente a la atención a longitudes de contexto habituales y cierra comparando prefill y decodificado, donde el mismo modelo pide algoritmos opuestos. Un apunte de cuidado: la intensidad aritmética no predice qué método es más rápido, solo de qué lado del roofline se está.
