CaSA: inferencia de modelos de lenguaje ternarios dentro de DRAM DDR4 convencional
La creciente atención hacia los modelos Bonsai de PrismML, basados en cuantización a 1 bit y pesos ternarios, reaviva el debate sobre cómo ejecutar modelos de lenguaje de gran tamaño directamente en dispositivos móviles. Para alcanzar escalas de 27 000 millones de parámetros en un teléfono se necesi
