DORA evalúa la capacidad de los agentes de IA para responder a desastres

Fuentes: DORA benchmarks LLM agents for disaster response operations

El equipo de Junjue Wang ha publicado DORA, un benchmark diseñado para evaluar la capacidad de los agentes de lenguaje de gran escala (LLM) para responder a operaciones de emergencia ante desastres. La herramienta, aceptada como presentación oral en NeurIPS 2026, incluye 515 tareas expertas basadas en 45 eventos de desastre reales de 10 tipos en 5 continentes. Cada tarea se acompaña de trayectorias de herramientas verificadas por expertos, con un total de 3.500 pasos de llamadas a herramientas, que siguen protocolos de organismos como la ONU, FEMA y Copernicus.

El sistema se distingue por su naturaleza heterogénea, integrando imágenes ópticas, SAR y multiespectral de secuencias temporales, junto con capas de datos vectoriales como redes de transporte y población. Los agentes utilizan una biblioteca de 108 herramientas mediante la interfaz MCP (Model Context Protocol) para realizar tareas de percepción, análisis espacial y síntesis de informes. Los resultados muestran que los agentes comerciales y de código abierto presentan variaciones significativas en la precisión, con la trayectoria de oro (oracle) alcanzando un 80,48% de precisión media, mientras que los modelos actuales oscilan entre el 18% y el 54%. El estudio identifica desafíos persistentes, como la fragilidad compositiva en pipelines largos y la dificultad de los agentes para seleccionar herramientas adecuadas, lo que limita su eficacia en escenarios operativos complejos.