Guía visual de la cuantización: cómo comprimir modelos de lenguaje grandes
La cuantización es una técnica de compresión que reduce el número de bits necesarios para representar los parámetros de un modelo de lenguaje grande (LLM), normalmente almacenados en punto flotante de 32 bits (FP32), a formatos de menor precisión como FP16, BF16 o enteros de 8 bits (INT8). El objeti
