El equipo de Junjue Wang ha publicado DORA, un benchmark diseñado para evaluar la capacidad de los agentes de lenguaje de gran escala (LLM) para responder a operaciones de emergencia ante desastres. La herramienta, aceptada como presentación oral en NeurIPS 2026, incluye 515 tareas expertas basadas en 45 eventos de desastre reales de 10 tipos en 5 continentes. Cada tarea se acompaña de trayectorias de herramientas verificadas por expertos, con un total de 3.500 pasos de llamadas a herramientas, que siguen protocolos de organismos como la ONU, FEMA y Copernicus.
El sistema se distingue por su naturaleza heterogénea, integrando imágenes ópticas, SAR y multiespectral de secuencias temporales, junto con capas de datos vectoriales como redes de transporte y población. Los agentes utilizan una biblioteca de 108 herramientas mediante la interfaz MCP (Model Context Protocol) para realizar tareas de percepción, análisis espacial y síntesis de informes. Los resultados muestran que los agentes comerciales y de código abierto presentan variaciones significativas en la precisión, con la trayectoria de oro (oracle) alcanzando un 80,48% de precisión media, mientras que los modelos actuales oscilan entre el 18% y el 54%. El estudio identifica desafíos persistentes, como la fragilidad compositiva en pipelines largos y la dificultad de los agentes para seleccionar herramientas adecuadas, lo que limita su eficacia en escenarios operativos complejos.
