Anthropic identifica en Claude un espacio interno ligado al acceso consciente

Fuentes: Anthropic identifica en Claude un espacio interno ligado al acceso consciente, 20minutos.esT3clickbait

Anthropic ha presentado una investigación que arroja nueva luz sobre uno de los mayores enigmas de la inteligencia artificial generativa: qué ocurre dentro de un modelo de lenguaje antes de que este produzca una respuesta. La compañía asegura haber identificado en Claude un espacio interno de representaciones, denominado J-space, que funciona como una suerte de "pizarra interna" donde ciertos conceptos pueden activarse, mantenerse y manipularse antes —o incluso sin— convertirse en texto visible.

Según detalla Anthropic en un estudio publicado en su blog de circuitos neuronales y difundido a través de su cuenta en X, el J-space no fue diseñado ni programado de forma explícita, sino que "surgió por sí solo durante el proceso de entrenamiento de Claude". La afirmación resulta relevante porque desplaza el foco: no se trata de una función añadida para mejorar el razonamiento del modelo, sino de una organización interna que habría emergido de manera espontánea mientras el sistema aprendía a predecir y generar lenguaje.

La clave metodológica del hallazgo es el J-lens, una técnica que permite identificar patrones internos ligados a palabras que el modelo podría utilizar después. Gracias a esta herramienta, los investigadores de Anthropic pudieron observar cómo ciertos conceptos aparecen, cambian o desaparecen en las capas previas a la respuesta final. En uno de los experimentos más llamativos, se pidió a Claude que pensara en silencio en un deporte; el J-lens mostró el concepto "soccer" y, al sustituirlo por "rugby", el modelo respondió efectivamente "rugby". En otro caso, los investigadores cambiaron el concepto "spider" (araña) por "ant" (hormiga) durante una pregunta sobre el número de patas de un animal que teje telarañas, y la respuesta pasó de ocho a seis.

Los experimentos también replicaron situaciones más cercanas a la experiencia humana, como pensar en una cosa mientras se hace otra. Cuando a Claude se le pidió copiar una frase sobre una pintura mientras concentraba su atención en frutas cítricas, la salida solo contenía la frase copiada, pero el J-space reveló la presencia de "orange" y "fruits". En otra prueba, se le pidió resolver mentalmente la operación 3² − 2 mientras copiaba texto: la lente mostró primero "nine" y después "seven", reflejando las etapas del cálculo interno. Incluso cuando se le indicó que no pensara en algo, ese concepto apareció parcialmente, acompañado con frecuencia por "damn" (maldita sea) y "failure" (fracaso), como si el sistema registrara su propio fallo de control.

No obstante, Anthropic introduce matices importantes. El J-space no está detrás de todo lo que hace Claude: cuando los investigadores impidieron al modelo utilizar ese espacio, este siguió hablando con fluidez, clasificando sentimiento, respondiendo preguntas de opción múltiple y extrayendo datos de pasajes casi como antes. Lo que se deterioró fueron tareas más exigentes, como el razonamiento de varios pasos, el resumen o la escritura de poesía rimada. Es decir, el mecanismo influye en las capacidades cognitivas más complejas, pero no es indispensable para el funcionamiento general del modelo.

La propia compañía es tajante al respecto: "Nuestros experimentos no demuestran que Claude pueda tener experiencias o sentir las cosas como los humanos", y añade que no está claro si algún experimento podría demostrar algo así. Anthropic utiliza el término "acceso consciente" en un sentido estrictamente funcional: pensamientos que el modelo puede reportar, usar para razonar y emplear para guiar su comportamiento. No equivale a afirmar que Claude posea una vida interior o experiencia subjetiva, pero sí abre una grieta significativa en la opacidad que hasta ahora ha rodeado a estos sistemas.

El hallazgo, aunque no resuelve el debate filosófico sobre la conciencia en la inteligencia artificial, ofrece una nueva vía para observar y potencialmente moldear parte de los procesos internos de los modelos. En un campo donde la caja negra sigue siendo la norma, poder identificar un espacio donde los conceptos se manipulan antes de la respuesta final representa un avance hacia una mayor interpretabilidad y, con ella, hacia un control más preciso de lo que estos sistemas hacen y dicen.