Optimización Inversa por Rúbrica: un banco de pruebas para la ciencia de agentes
Fulcrum Research presenta la Optimización Inversa por Rúbrica (IRO, por sus siglas en inglés), un nuevo marco experimental para investigar el comportamiento de agentes de inteligencia artificial en tareas de horizonte largo. En un entorno IRO, un agente debe descubrir las preferencias de un juez de
