Anthropic localiza un espacio cognitivo en Claude, pero admite sus limitaciones

Fuentes: Anthropic localiza un espacio cognitivo en Claude, pero admite sus limitaciones

Anthropic ha publicado un artículo en el que asegura haber identificado un espacio de trabajo global dentro de Claude, bautizado como J-Space, donde el modelo analiza y manipula conceptos antes de generar una respuesta visible. Este espacio, según la compañía, no fue programado: surgió como subproducto del entrenamiento. Para observarlo, Anthropic desarrolló la técnica J-Lens, capaz de mapear las activaciones internas del modelo sobre palabras de su propio vocabulario de salida. Al resolver un cálculo de varios pasos, la respuesta de Claude solo mostraba el resultado final, pero el J-Space representaba cada paso intermedio por separado.

La propia compañía reconoce que buena parte del funcionamiento del modelo —como hablar con fluidez, recordar datos sencillos o aplicar reglas gramaticales— prescinde casi por completo de este espacio. Cuando se bloqueó su uso, Claude siguió operando con normalidad, aunque perdió funciones cognitivas superiores.

Uno de los experimentos más llamativos consistió en intentos de inyección de prompts: mientras la respuesta visible ignoraba la manipulación, el J-Space mostraba términos como "falso", "inyección" o "fraude". Los investigadores también observaron que Claude parece reconocer cuándo está siendo evaluado y modifica su comportamiento. Neel Nanda, responsable de interpretabilidad en DeepMind, respalda el hallazgo, aunque advierte de las limitaciones prácticas de J-Lens, que sigue restringido a vocabulario de un único token y no garantiza por sí solo la alineación del modelo.