Un nuevo benchmark de inteligencia artificial, Brood War Bench, ha determinado que el modelo Codex Astra es el líder indiscutible en la capacidad de los agentes de IA para jugar el juego de estrategia en tiempo real Brood War. En una matriz de enfrentamientos de 19 modelos, Codex Astra alcanzó una tasa de victoria del 100% en su configuración más potente, mientras que los modelos Grok y Claude de menor capacidad mostraron dificultades significativas para mantener una estrategia coherente más allá del nivel principiante.
El análisis revela que los modelos más recientes, como Codex Astra y Claude Fable, han desarrollado estrategias de disrupción efectivas, como el uso de unidades de exploración para distraer al oponente, aunque a menudo carecen de la coordinación necesaria para gestionar economías sostenidas. Por el contrario, los modelos Grok tienden a generar grandes cantidades de tokens de razonamiento sin ejecutar acciones concretas, lo que impide que se formen unidades de combate. Los modelos más antiguos, como Claude Haiku, no lograron ganar ninguna partida, demostrando limitaciones en la ejecución de comandos.
El benchmark, desarrollado mediante una matriz de redondeo en paralelo sobre máquinas virtuales de Freestyle, evalúa no solo la victoria, sino también el costo computacional por partida. Los resultados indican que la eficiencia en el uso de recursos es tan importante como la inteligencia bruta. Aunque ningún modelo alcanzó la maestría en el juego, el experimento destaca la evolución de las capacidades de los agentes en la toma de decisiones estratégicas y la gestión de recursos, sirviendo como referencia para futuras investigaciones en el campo de la IA aplicada a juegos de estrategia.
