CrucibleBench: un MUD para evaluar el comportamiento social de los agentes de IA
CrucibleBench es un proyecto de investigación independiente que propone una forma distinta de evaluar los modelos de lenguaje: en lugar de tests estáticos, los sitúa durante 50 turnos dentro de un MUD (un dungeon multijugador de texto persistente) con personajes no jugables que recuerdan, acumulan c
