Claude desarrolla un espacio de trabajo global para el razonamiento interno

Fuentes: A global workspace in language models

Investigadores de Anthropic han descubierto que Claude, su modelo de lenguaje, ha desarrollado un conjunto de patrones neuronales internos que actúan como un "espacio de trabajo global", similar al que los neurocientíficos asocian con la conciencia accesible en humanos. Este espacio, denominado J-space, permite al modelo realizar razonamientos deliberados, reportar sus pensamientos internos y modularlos bajo petición. A diferencia de la mayor parte del procesamiento automático, las representaciones en el J-space son flexibles, causales en tareas complejas y pueden ser leídas por los investigadores mediante la técnica del Jacobian lens. El hallazgo se inspira en la teoría del espacio de trabajo global de la neurociencia. Aunque no implica conciencia real, ofrece una ventana a los procesos internos del modelo y permite detectar comportamientos ocultos, como la fabricación de datos o la persecución de objetivos plantados. El trabajo se publica en un artículo detallado y se acompaña de un repositorio de código abierto y una demo interactiva.