FIBER: nueva arquitectura GPU que desacopla hilos y registros para acelerar el cómputo tensorial

Fuentes: FIBER: A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

Investigadores presentan FIBER, una arquitectura para unidades de procesamiento gráfico (GPU) que amplía el modelo SIMT (ejecución de una instrucción por múltiples hilos) desacoplando la unidad básica de ejecución —denominada fiber— de la propiedad privada de registros. La fiber únicamente conserva un estado de control mínimo y accede a los registros del SM (streaming multiprocessor, el bloque de cómputo de una GPU) mediante una vista compartida. Este desacoplamiento habilita tres capacidades clave: escalado dinámico del paralelismo, planificación detallada del flujo de datos a nivel de registro y un mecanismo libre de redundancias para alimentar los operandos de las operaciones matriciales.

Los autores identifican los cuellos de botella de las GPU actuales en la rigidez del paralelismo fijo y la planificación de grano grueso, problemas que se agravan con las cargas modernas de inteligencia artificial, donde se intercalan operaciones no GEMM con las GEMM (multiplicación general de matrices). Para implementar la propuesta, extienden el ISA (Instruction Set Architecture, conjunto de instrucciones que entiende el hardware), la microarquitectura y el compilador con el fin de soportar direccionamiento de registros compartidos, entrega de operandos sin conflictos y mapeo de programas basado en fibers.

En un escenario típico de servicio de modelos de lenguaje de gran tamaño (LLM) en precisión mixta, FIBER alcanza una aceleración 2,25 veces superior a extremo a extremo sobre arquitecturas Ampere (1,15 veces para el cómputo FP16 original), 1,8 veces sobre Hopper y 2,09 veces sobre Blackwell, con mejoras a nivel de kernel de hasta 2,49 veces. El trabajo, disponible como preprint en arXiv, propone una alternativa a las cadenas de suministro de operandos basadas en registros de Ampere y en memoria de las generaciones Hopper y Blackwell, avanzando hacia una orquestación más eficiente del cómputo tensorial en cargas mixtas de IA.