AgentWorld es un nuevo benchmark diseñado para medir la capacidad de colaboración a largo plazo entre modelos de lenguaje de gran escala (LLM) que operan como agentes autónomos. A diferencia de las pruebas existentes, que suelen centrarse en escenarios competitivos, interacciones de corto alcance (menos de 20 pasos) o la agregación de resultados individuales, este marco de evaluación introduce 100 tareas humanas anotadas y 100 variantes aumentadas para probar la coordinación en entornos de sandbox MMORPG. Estas misiones requieren entre 3 y 20 agentes con roles asimétricos y habilidades distintas para coordinarse mediante comunicación, planificación conjunta y compartición de recursos, todo ello bajo un entorno de caja negra donde cada agente actúa sin acceso al estado interno de los demás.
Para cuantificar la eficacia de la colaboración más allá del éxito binario de la tarea, los autores proponen Causal Collaboration Effectiveness (CCE), una métrica basada en grafos que rastrea las dependencias causales entre las acciones de los agentes y mide la proporción del esfuerzo del equipo que realmente contribuyó al resultado final. Los experimentos realizados con modelos como Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini y DeepSeek R1-70B revelan que incluso el modelo más capaz alcanza solo un 52,0% de éxito en las tareas. Los fallos sistémicos identificados incluyen roturas de comunicación, confusión de roles e incapacidad para mantener planes compartidos a lo largo de las rondas de interacción. AgentWorld está disponible de forma completamente de código abierto, ofreciendo una herramienta rigurosa para investigar las limitaciones actuales de la colaboración multiagente en la inteligencia artificial.
