El arnés Schema alcanza cerca del 99% en ARC-AGI-3 con modelos de frontera

Fuentes: Frontier Models with Our Harness Achieve ~99% on ARC-AGI-3 Public

Un equipo de Impossible Research, la Universidad de California en Berkeley y la Carnegie Mellon University presenta Schema, un arnés que logra que los modelos de frontera afronten los retos de ARC-AGI-3 como lo haría un físico: escribir el mecanismo de cada juego como un programa ejecutable, contrastarlo con la realidad y planificar dentro de él. El nombre se inspira en Kant: un esquema es una regla de construcción que conecta el concepto abstracto con la percepción concreta.

ARC-AGI-3 plantea al agente un entorno de juego sin reglas explícitas: cada paso recibe una rejilla de 64×64 con 16 colores y un conjunto de acciones legales, sin objetos definidos, objetivo declarado ni recompensa informativa. La métrica oficial es la Eficiencia Relativa de Acciones Humanas (RHAE), que compara el número de acciones del agente con una línea base humana de primera exposición; el 100% equivale a completar todos los niveles con eficiencia igual o superior a la humana.

Con la combinación controlada Claude Opus 4.8 y Fable 5, Schema alcanza el 98,98% en el conjunto público, frente al 42,83% que obtiene esa misma pareja de modelos bajo Claude Code, una mejora de 56,15 puntos atribuible al arnés y no al modelo subyacente. Con la pareja Sol xhigh y Sol max, el sistema llega al 95,35%. Los autores subrayan que ambas cifras son autoinformadas, se basan en 25 juegos públicos y aún no han sido verificadas por ARC Prize; la traducción exacta al conjunto Semi-privado se desconocerá hasta que se mida.