AllenAI lanza Olmo-core 3 para entrenar modelos MoE a escala trillones

Fuentes: AllenAI releases Olmo-core 3 for trillion-scale MoE training

AllenAI ha presentado Olmo-core 3, una actualización significativa de su marco de desarrollo para modelos de lenguaje de gran escala (LLM) que rediseña el sistema de entrenamiento de la arquitectura Mixture of Experts (MoE). Esta herramienta está diseñada para escalar el entrenamiento de modelos MoE hasta el rango de parámetros de billones, manteniendo la eficiencia computacional. El objetivo principal es reducir los costos y el consumo energético asociados al entrenamiento de modelos de IA, que suelen ser prohibitivos para laboratorios académicos y pequeños, permitiendo que más investigadores accedan a estas tecnologías.

A diferencia de las implementaciones anteriores basadas en paralelismo de datos completo (FSDP), Olmo-core 3 adopta un sistema de paralelismo de datos distribuido (DDP). Esta transición permite mantener a los expertos residentes en las GPUs y enrutar los datos relevantes, evitando la recolección repetida de pesos del modelo. En pruebas preliminares con ocho GPUs NVIDIA B300, el nuevo sistema logró un rendimiento de 52.000 tokens por segundo por GPU, una mejora de 2,7 veces respecto a la implementación anterior, que procesaba 19.400 tokens por segundo.

El sistema integra técnicas de paralelismo experto, pipeline y optimizador distribuido, junto con el formato de precisión MXFP8, que redujo el throughput de entrenamiento en un 21% en comparación con BF16, mientras disminuye la memoria activa. Olmo-core 3 ha sido benchmarked hasta alcanzar más de un billón de parámetros totales, demostrando su capacidad para gestionar sistemas de gran escala de manera eficiente y abierta.