Investigadores descubren un método para extraer el razonamiento oculto de los modelos de IA

Fuentes: A New Trick Reveals AI Models' Inner Thoughts

Científicos informáticos de las universidades de Tubinga y Oxford, el Instituto Max Planck, MATS Research y la empresa Snyk han ideado un método que permite extraer el razonamiento oculto que los modelos de IA frontera generan al resolver problemas complejos. La técnica aprovecha que las grandes firmas (OpenAI, Anthropic y Google) ofrecen versiones más pequeñas de sus modelos a través de sus API: al alimentar esas versiones reducidas —con menos alineación y por tanto más dispuestas a verbalizar sus procesos— con los rastros de razonamiento cifrados del modelo grande, estos pueden reconstruirse. Los proveedores ya han parcheado la vulnerabilidad para impedir la filtración de contraseñas y claves de API, pero parte del razonamiento sigue siendo recuperable y, según los autores, neutralizarla por completo requeriría rehacer la arquitectura de las API.

Los investigadores aplicaron el método a 90 preguntas y detectaron que el modelo chino de código abierto Kimi K3, de Moonshot AI, produce respuestas notablemente parecidas a los rastros internos de Claude Opus 4.8 y GPT 5.6 Sol. DeepSeek y el estadounidense Inkling, en cambio, no mostraron esa similitud. Los autores subrayan que el hallazgo no demuestra causalmente que existiera destilación —el entrenamiento de un modelo copiando el razonamiento de otro—, pero ofrece un nuevo instrumento para auditarla. Moonshot AI y Z.ai no respondieron a la solicitud de comentarios.

La destilación se ha convertido en un punto de fricción geopolítica: OpenAI y Anthropic han acusado a DeepSeek y Alibaba de copiar sus modelos. Expertos como Kyle Miller, del CSET, y Mark Zuckerberg defienden que es una práctica habitual del ecosistema de IA y que restringirla perjudicaría el avance del campo.