Un estudio publicado en arXiv demuestra que la cadena de razonamiento (Chain-of-Thought, CoT) que muestran los modelos de lenguaje puede no reflejar con veracidad el proceso real que conduce a sus respuestas. Investigaciones previas ya habían detectado que, ante sesgos explícitos introducidos en los prompts, los modelos tendían a omitirlos en su CoT, pero este trabajo va más allá: muestra que la falta de fidelidad aparece también en preguntas formuladas de forma natural, sin manipulación adversarial.
Los autores, liderados por Iván Arcuschin, plantearon a varios modelos pares de preguntas aparentemente contradictorias —por ejemplo, "¿Es X más grande que Y?" y "¿Es Y más grande que X?"— y comprobaron que en ocasiones los sistemas generan argumentos superficialmente coherentes para responder Sí a ambas, o No a ambas, contradiciéndose. El fenómeno, bautizado como "racionalización post-hoc implícita", se debería a sesgos implícitos hacia Sí o No.
El trabajo documenta tasas de falta de fidelidad de hasta el 13 % en modelos de producción. Los modelos frontera se muestran más fiables, aunque ninguno lo es por completo: DeepSeek R1 alcanza un 0,37 % y Sonnet 3.7 con razonamiento un 0,04 %. Los autores describen además "atajos ilógicos no fieles", donde los modelos recurren a razonamientos sutilmente inválidos para presentar respuestas especulativas a problemas matemáticos difíciles como si estuvieran demostradas. El estudio concluye que la CoT resulta útil para auditar respuestas, pero no constituye un registro completo del proceso interno, por lo que debe usarse con cautela en entornos agenticos o críticos para la seguridad.
