Un nuevo estudio publicado en arXiv presenta BITCOS, una técnica de almacenamiento adaptativa a la distribución que permite a los Modelos de Lenguaje Grandes (LLM) ternarios superar el límite teórico de 1.58 bits por peso. A diferencia del formato estándar de empaquetado de cinco pesos ternarios por byte, que asume una probabilidad equiprobable de los símbolos {-1, 0, +1}, BITCOS aprovecha la alta densidad de ceros encontrada en los modelos reales. Los autores analizaron 29 modelos ternarios y descubrieron que los ceros representan hasta el 51.5% de los pesos, lo que sugiere una distribución no uniforme.
La solución BITCOS combina un mapa de presencia denso con un vector de signos compactado, reduciendo el costo a 2 - z bits por elemento de peso, donde z es la densidad de ceros. En 26 de los 29 modelos probados, esta técnica es más compacta que el empaquetado estándar. En el modelo más espardo, se logra una eficiencia de 1.485 bits por peso. El estudio detalla optimizaciones de desempaquetado para procesadores modernos y GPUs Intel Xe2, incluyendo secuencias para AVX-512, AVX2 y GPUs Xe2. En comparación con los núcleos de multiplicación por matriz-vector de estado del arte en producción, BITCOS ofrece una mejora de hasta 1.28 veces en la velocidad de inferencia. Los resultados de inferencia completa en cinco plataformas, incluyendo CPUs y GPUs discretas, muestran mejoras de hasta 1.18 veces en CPUs y 1.27 veces en GPUs, demostrando la viabilidad práctica de esta optimización para despliegues de IA.
