WattGPU predice consumo y latencia de inferencia en GPUs no vistas

Fuentes: WattGPU predicts inference power and latency on unseen GPUs and LLMs

WattGPU es una herramienta de software diseñada para predecir el consumo de energía y la latencia de inferencia de modelos de lenguaje grandes (LLM) en GPUs de NVIDIA que no se han utilizado durante el entrenamiento. Este sistema aborda la falta de herramientas para optimizar despliegues en centros de datos, permitiendo a los operadores seleccionar la combinación más eficiente sin necesidad de perfiles exhaustivos de cada hardware. La herramienta se basa en dos modelos predictivos que utilizan únicamente metadatos públicos de LLM y especificaciones técnicas de GPUs, eliminando la necesidad de acceso físico o perfiles de hardware. Se evaluó mediante validación cruzada rigurosa en un conjunto de datos de 42 LLMs de código abierto (con parámetros entre 0.1B y 27B) y 8 GPUs, bajo escenarios offline y de servidor. Los resultados muestran que el modelo de consumo de potencia alcanza un error absoluto medio del 3,4% en escenarios offline y del 13,5% en servidores para GPUs no vistas, mientras que el modelo de latencia inter-tokeno logra un error del 8,5% en modo servidor. Estas métricas superan a las líneas base físicas estándar, reduciendo el error medio en aproximadamente 4 veces para combinaciones no vistas de LLM-GPU en servidores, y en 2 veces para GPUs completamente no vistas. WattGPU facilita la generalización a hardware y modelos no observados, ofreciendo datos y código públicamente disponibles para la comunidad técnica.