shoehorn es una herramienta de línea de comandos y aplicación web local que ajusta la cuantización de modelos de lenguaje al hardware disponible en lugar de recurrir a presets genéricos. Su propuesta central parte de un problema concreto: las cuantificaciones predefinidas obligan a elegir entre malgastar cientos de megabytes de margen de calidad o descubrir, al cargar el modelo, que no cabe en la memoria. La utilidad mide la memoria real de la máquina, descuenta lo que el propio proceso de inferencia necesita y resuelve, por tensor, una asignación de precisión mixta que se acerca al remanente con un error de redondeo mínimo; según el proyecto, utiliza de forma habitual el 99,99% del presupuesto y, en ocasiones, hasta el último byte.
El flujo de uso es deliberadamente simple. La interfaz web local mide el equipo del usuario, transmite el ajuste en tiempo real, representa el presupuesto como una cinta métrica, muestra un valor de perplejidad que cuantifica la pérdida de calidad del ajuste y termina en un botón de chat listo para usar. Requiere tener llama.cpp en el PATH como motor de inferencia; en macOS basta con una instalación mediante Homebrew, y también puede compilarse desde el código fuente con cargo. La página web del proyecto analiza, además, los modelos más descargados de Hugging Face y los clasifica según la calidad que cada presupuesto de memoria permite, ejecutándose por completo en el navegador.
Entre las consideraciones a tener en cuenta, shoehorn depende de llama.cpp y se orienta a quienes ejecutan modelos localmente en equipos con recursos limitados. Es una alternativa a las cuantificaciones fijas de la comunidad para usuarios que quieran exprimir la memoria disponible sin renunciar a calidad de forma innecesaria.
