Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

Fuentes: The 4-bitter Lesson

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardware más reciente. El texto describe un punto de partida basado en la receta de preentrenamiento NVFP4 de NVIDIA, adaptada al contexto del RL, donde el gradiente de política es un estimador ruidoso por naturaleza: en este escenario, no basta con que la cuantización sea insesgada, sino que el ruido introducido debe ser lo bastante pequeño para no degradar la señal de gradiente en cada actualización.

La receta base cuantiza únicamente las capas MoE, que en arquitecturas tipo DeepSeek-V3 concentran alrededor del 97 % de los parámetros totales, y mantiene el resto de capas en BF16. El forward se ejecuta en NVFP4 con escalado por token para las activaciones (escala FP32 local por fila y escalas FP8 E4M3 por bloques de 16 valores), mientras que el backward se conserva en BF16 como opción conservadora. El documento también aborda los picos de norma de gradiente provocados por la discrepancia entre el forward cuantizado y el backward en BF16, y propone intervenciones orientadas a reducir el error de cuantización en la política y a mejorar la precisión del cálculo del gradiente. La implementación se ha liberado de forma open source para que la comunidad pueda reproducir y extender el trabajo.