La implementación local de modelos de lenguaje grandes (LLM) ha ganado relevancia por las preocupaciones de privacidad y la necesidad de inferencia on-premise, aunque los costos energéticos en hardware de consumo siguen siendo poco caracterizados. Este artículo presenta un benchmark reproducible de nivel de hardware que evalúa la eficiencia energética de 18 LLMs de código abierto, con parámetros que varían entre 0.5B y 7B, ejecutados en una única GPU de consumo (RTX 4060ti 16GB). El estudio utiliza el motor de inferencia Ollama y muestrea el consumo de potencia de la GPU a 2 Hz mediante la herramienta nvidia-smi, basándose en un conjunto de prompts fijo.
El análisis cuantifica el consumo medio y pico de potencia, la energía total por prompt (J/prompt), la energía por token de salida (J/tok) y el rendimiento (tok/s). Los resultados indican que la eficiencia energética no depende únicamente del número de parámetros, sino también de la arquitectura del modelo y la estrategia de cuantización. Específicamente, los modelos qwen2.5:0.5b y tinyllama:1.1b alcanzan los menores costos energéticos, con 0.2747 J/tok y 0.3234 J/tok respectivamente, y un rendimiento superior a 325 tok/s. En contraste, el modelo 7B-Mistral consume hasta 8.6 veces más energía por token que el modelo más eficiente. Además, se observa que qwen3.5:0.8b(on) presenta un consumo anómalamente alto de energía por prompt debido a un razonamiento interno extendido, lo que subraya la necesidad de distinguir entre modos de generación de tokens en las métricas de eficiencia.
