ByteDance Seed y Tsinghua AIR han publicado DAPO, un sistema de aprendizaje por refuerzo (RL) a gran escala para modelos de lenguaje grandes (LLM) de código abierto. La propuesta técnica, denominada Decoupled Clip and Dynamic sAmpling Policy Optimization, busca mejorar la estabilidad y la eficiencia en el entrenamiento de modelos de 32B parámetros. El sistema, basado en el framework verl, ha logrado un puntaje de 50 puntos en la prueba AIME 2024 utilizando el modelo base Qwen2.5-32B, superando al DeepSeek-R1-Zero-Qwen-32B con un 50% menos de pasos de entrenamiento.
El proyecto destaca por su transparencia total, ofreciendo el código fuente, los conjuntos de datos de entrenamiento y validación, y las instrucciones para reproducir los resultados. Los datos de entrenamiento incluyen DAPO-Math-17k, mientras que la validación se realiza sobre AIME 2024. Los desarrolladores proporcionan scripts para la preparación de datos y el entrenamiento, así como herramientas de inferencia con vLLM y Ray Serve. La iniciativa busca facilitar el acceso a técnicas de RL escalables para la comunidad de investigación, permitiendo a otros equipos replicar y mejorar los resultados obtenidos en este benchmark de matemáticas.
