Magic asegura una eficiencia de preentrenamiento más de 10 veces mayor que la de los modelos abiertos

Fuentes: >10x More Efficient Pretraining — Magic

La startup Magic ha presentado una actualización de su investigación en preentrenamiento de modelos de inteligencia artificial en la que afirma haber multiplicado por más de diez la eficiencia computacional de su receta frente a los principales modelos de código abierto disponibles. Según la compañía, su modelo replica el rendimiento de DeepSeek V4 Pro Base utilizando aproximadamente 50 veces menos FLOPs, en torno a la mitad del cómputo empleado para entrenar GPT-3, con un coste cercano a los 0,5 millones de dólares en GPUs GB200. Tras escalar otros diez veces (~4 millones de dólares), el modelo supera en pérdida de bits por byte a todas las bases abiertas evaluadas: DeepSeek V4 Pro y Flash, Kimi K2 de Moonshot y Nemotron 3 Ultra de NVIDIA. Las leyes de escala obtenidas sugieren que entrenar un modelo equivalente con la receta de DeepSeek V4 Pro costaría más de 100 millones de dólares. La metodología incluye curvas de escalado ajustadas a 167 dominios, conjuntos de evaluación con problemas matemáticos y código no públicos, y verificaciones con Fireworks para detectar sesgos en motores de inferencia como vLLM y SGLang. Magic, que se define como el equipo independiente más pequeño del mundo entrenando modelos de un billón de parámetros, enmarca la eficiencia de preentrenamiento, el aprendizaje por refuerzo agéntico y el contexto largo como los tres pilares para construir agentes de codificación sobrehumanos y automatizar la propia I+D en IA.