Una investigadora en interpretabilidad de modelos de lenguaje repasa las conclusiones principales de un taller sobre monitorización de cadenas de pensamiento (CoT) en sistemas de IA. El texto argumenta que la posibilidad de vigilar el razonamiento de los modelos es una «oportunidad frágil»: el CoT se diseñó para mejorar capacidades, no para ofrecer transparencia, y ambos objetivos pueden entrar en tensión. Si la presión por mejorar el rendimiento prima, la transparencia quedará en segundo plano.
El artículo analiza tres ejes. Primero, la idea de obligar a los modelos a verbalizar toda su computación interna en tokens: la autora considera que exigir un vínculo causal entre el texto generado y la respuesta final empuja hacia arquitecturas restrictivas, incluida la prohibición de arquitecturas recurrentes. Segundo, la propuesta de generar explicaciones a posteriori tras la respuesta, que suscita escepticismo por el problema conocido de las racionalizaciones post-hoc. Tercero, la amenaza de CoT engañosos: estudios recientes muestran que los modelos pueden producir razonamientos que no reflejan sus causas reales, lo que invalida la supervisión basada solo en texto.
La autora concluye que depender exclusivamente del monitoreo del CoT para la seguridad es insostenible y propone reforzar la interpretabilidad de los estados internos del modelo como vía complementaria, más fiable y exhaustiva.
