Medición de la eficiencia energética de la inferencia local de IA

Fuentes: Measuring the energy efficiency of local AI inference

Un estudio académico publicado en arXiv propone una nueva métrica, 'inteligencia por vatio' (IPW), para evaluar la eficiencia de la inferencia de modelos de lenguaje locales. La investigación, que analiza más de 20 modelos locales y 8 aceleradores de hardware, busca determinar si la ejecución de modelos pequeños (con menos de 20.000 millones de parámetros activos) en dispositivos locales puede redistribuir la demanda de consultas de inteligencia artificial desde la infraestructura centralizada en la nube. El objetivo es medir no solo la precisión de las respuestas, sino también el consumo de energía y la latencia en dispositivos con restricciones de potencia, como portátiles.

Los resultados del análisis, que abarca consultas de chat y razonamiento del mundo real, indican que los modelos locales logran acertar el 88,7% de las consultas evaluadas, superando a los modelos de frontera en muchos casos. Un hallazgo clave es que la IPW ha mejorado 5,3 veces entre 2023 y 2025, impulsada por avances tanto algorítmicos como en hardware. Además, la cobertura de consultas servibles localmente aumentó del 23,2% al 71,3% en el mismo periodo. Los autores concluyen que los aceleradores locales logran al menos 1,4 veces menor IPW que los de la nube para modelos idénticos, lo que sugiere un gran margen de optimización. Estos datos demuestran que la inferencia local puede sustituir significativamente a la infraestructura centralizada para un subconjunto sustancial de consultas, posicionando la IPW como la métrica crítica para rastrear esta transición tecnológica.