Rufus-Air es una receta de post-entrenamiento abierta y reproducible diseñada para el modelo GLM-4.5-Air-Base, una variante de 106B parámetros. Este proyecto se estructura como una pipeline serial de ocho etapas, que van desde el ajuste fino (SFT) hasta el refuerzo con recompensa humana (RLHF). La metodología detalla el diseño de datos, la infraestructura técnica y el orden específico de las etapas para reproducir el proceso de entrenamiento.
El enfoque parte de capacidades básicas y avanza hacia funciones avanzadas, pasando de recompensas verificables y duras a señales más suaves basadas en jueces. El entrenamiento se basa exclusivamente en componentes de código abierto y datos públicos, sin necesidad de anotación humana adicional ni de un maestro de destilación interno. Los hallazgos clave indican que un ajuste fino diverso y de alta calidad establece un suelo de capacidad sólido, mientras que el filtrado de dificultad mantiene los prompts de refuerzo dentro de un rango de aprendizaje productivo. Además, la fiabilidad de la recompensa ofrece un principio práctico para ordenar las etapas de entrenamiento.
Rufus-Air mejora sobre la versión oficial de post-entrenamiento de GLM-4.5-Air y se posiciona como competitivo frente a otros modelos abiertos de tamaño similar. La publicación incluye un informe detallado del progreso por etapas, destacando que las decisiones de ingeniería e infraestructura son parte integral de la receta, no solo detalles de implementación. Este recurso sirve como referencia para la comunidad de investigación en IA, ofreciendo una guía técnica para el desarrollo de modelos de lenguaje de gran escala.
