Homebench: una sola orden para comparar LLMs locales en velocidad, memoria y calidad

Fuentes: Homebench: one command to benchmark local LLMs on speed, memory, and quality

Homebench es una herramienta de línea de comandos con interfaz TUI que evalúa de forma unificada los modelos de lenguaje grandes (LLMs) ejecutados en local. Detecta automáticamente los modelos instalados en runners como Ollama, LM Studio, llama.cpp, vLLM o cualquier servidor compatible con la API de OpenAI, y ejecuta un banco de pruebas que mide cuatro ejes: velocidad de generación (tokens por segundo), latencia hasta el primer token (TTFT), huella de memoria residente y calidad de las respuestas.

La calidad se evalúa con 31 tareas deterministas distribuidas en matemáticas, razonamiento, conocimiento factual, seguimiento de instrucciones y salida estructurada, extracción y comprensión de código, todas calificadas con temperature 0 y semilla fija para garantizar reproducibilidad. Un modo opcional de juez LLM permite puntuar de 1 a 5 tareas abiertas como resúmenes o explicaciones. Los resultados se muestran en una clasificación en directo en la terminal y pueden exportarse a Markdown o JSON; cada ejecución se guarda automáticamente para poder compararse con posteriores mediante subcomandos como history y diff.

La instalación es trivial: pip install homebench y, a continuación, homebench. No requiere configuración previa, claves de API ni conexión a la nube. Incluye además subcomandos prácticos como list (modelos detectados), fit (qué modelos populares caben en el hardware del usuario) y throughput (barrido de rendimiento por concurrencia), y admite paquetes de tareas personalizados en JSON o YAML para cubrir casos de uso específicos.