Noticias que mencionan BF16

Guía visual de la cuantización: cómo comprimir modelos de lenguaje grandes

La cuantización es una técnica de compresión que reduce el número de bits necesarios para representar los parámetros de un modelo de lenguaje grande (LLM), normalmente almacenados en punto flotante de 32 bits (FP32), a formatos de menor precisión como FP16, BF16 o enteros de 8 bits (INT8). El objeti

Más allá de un solo número: cómo elegir un modelo cuantizado para despliegue

La empresa ByteShape ha publicado una serie de tres artículos técnicos en los que propone un marco práctico para evaluar modelos de inteligencia artificial cuantizados de cara a su puesta en producción. El texto parte de una crítica a la forma habitual de comparar estos modelos: mediante una única c

T-Head publica un fork de Triton con backend para sus procesadores PPU

El repositorio t-head/triton-for-sail es un fork del compilador y lenguaje Triton que añade un backend específico para los procesadores PPU desarrollados por T-Head Semiconductor, utilizados en su SDK SAIL. Está pensado para dos generaciones de Tensor Core: PPU0010, con instrucciones MMAv1, y PPU001

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

El redondeo estocástico elimina el sesgo en entrenamiento con baja precisión

El redondeo al más cercano produce el mismo error cada vez, que se acumula linealmente con el número de pasos. En cambio, el redondeo estocástico genera errores de media cero que se cancelan parcialmente, creciendo solo como la raíz cuadrada del número de pasos. Un experimento con un MLP pequeño ent