CrucibleBench: un MUD para evaluar el comportamiento social de los agentes de IA

Fuentes: CrucibleBench — Old Worlds for New Agents

CrucibleBench es un proyecto de investigación independiente que propone una forma distinta de evaluar los modelos de lenguaje: en lugar de tests estáticos, los sitúa durante 50 turnos dentro de un MUD (un dungeon multijugador de texto persistente) con personajes no jugables que recuerdan, acumulan confianza y sospechas, y objetivos sociales ocultos. La idea se apoya en la filosofía de diseño de Gunpei Yokoi, reutilizar tecnología madura y barata con un propósito nuevo: las restricciones del MUD —un espacio enumerable de 7 comandos, 12 salas y 14 objetos— hacen que las acciones alucinadas y los errores de contexto sean detectables, y que la confianza ganada o perdida dentro de la partida sea persistente y medible.

El hallazgo central del trabajo no es un ranking, sino una advertencia metodológica. Un único componente LLM-judge dentro del sistema de puntuación alteró la clasificación hasta seis posiciones, mientras que las estadísticas agregadas de fiabilidad (kappa = 0,04) no detectaron esa inestabilidad. Al eliminar las dos dimensiones que dependen del clasificador de diálogo, cuya concordancia por modelo oscila entre el 21,7 % y el 84,8 %, seis modelos cambian de posición más allá del ruido de muestreo.

CrucibleBench también identifica tres modos de fallo legibles en la transcripción: bucles de diálogo (14 %-66 % de las ejecuciones de modelos frontera), interacciones con salas vacías y parálisis exploratoria. El artefacto se publica completo —650 transcripciones, código fuente, sistema de puntuación y registro de facturación— y sus autores subrayan que no debe interpretarse como una medida validada de inteligencia social ni como un ranking definitivo de modelos frontera.