La cuantización es una técnica de compresión que reduce el número de bits necesarios para representar los parámetros de un modelo de lenguaje grande (LLM), normalmente almacenados en punto flotante de 32 bits (FP32), a formatos de menor precisión como FP16, BF16 o enteros de 8 bits (INT8). El objetivo es mantener la capacidad predictiva del modelo a la vez que se disminuye drásticamente la memoria requerida: un modelo de 70.000 millones de parámetros en FP32 ocupa unos 280 GB, una cifra inabordable para el hardware de consumo.
La guía explica paso a paso cómo se representan los valores numéricos en los computadores según el estándar IEEE-754 (signo, exponente y mantisa) y describe la diferencia entre rango dinámico y precisión. A continuación, presenta los principales formatos de datos (FP16, BF16 e INT8) utilizados en aprendizaje profundo, señalando que BF16 conserva el rango de FP32 sacrificando mantisa, mientras que INT8 permite reducir el coste de memoria a la cuarta parte pero introduce errores de cuantización.
En la parte sobre métodos, el texto distingue entre cuantización simétrica (por ejemplo, absmax), que mapea los valores originales en un rango centrado en cero, y cuantización asimétrica (zero-point), que ajusta el desplazamiento cuando la distribución de los parámetros no está centrada en el origen. En ambos casos se aplica un factor de escala para convertir los valores en coma flotante a enteros y, tras la inferencia, se recupera una versión aproximada de los originales (decuantización). Cada operación introduce un error de cuantización que crece cuanto menor es el número de bits empleados.
La publicación cierra con la idea de que la cuantización permite ejecutar LLMs en GPUs de consumo sin necesidad de reentrenar el modelo, aunque a costa de una pérdida de precisión que debe evaluarse según el caso de uso.
