Un nuevo estudio publicado en arXiv examina si los modelos de razonamiento latente (LRMs), una clase de sistemas de inteligencia artificial que razonan internamente sin generar texto intermedio, son realmente interpretables. La investigación, firmada por Connor Dilgren y colaboradores, analiza dos LRMs de última generación y llega a conclusiones que matizan el entusiasmo en torno a esta familia de modelos.
En primer lugar, los autores descubren que los tokens de razonamiento latente resultan a menudo innecesarios: en conjuntos de datos de razonamiento lógico, los LRMs producen prácticamente las mismas respuestas finales sin recurrir al razonamiento latente. Esta infrautilización, sostienen, podría explicar por qué estos modelos no superan de forma consistente a los métodos de razonamiento explícito y arroja dudas sobre el papel que la literatura previa atribuye a dichos tokens.
En segundo lugar, cuando esos tokens sí influyen en el rendimiento, el equipo demuestra que es posible decodificar trazas de razonamiento de referencia entre el 65 % y el 93 % de las veces en instancias correctamente predichas. El resultado sugiere que los LRMs suelen implementar la solución esperada en lugar de un proceso opaco.
Por último, los investigadores presentan un método para extraer una traza de razonamiento en lenguaje natural verificada a partir de los tokens latentes, sin necesidad de conocer una traza de referencia previa. El procedimiento permite recuperar una traza verificada en la mayoría de las predicciones correctas, pero solo en una minoría de las incorrectas. El trabajo subraya que los LRMs actuales codifican en gran medida procesos interpretables y que la propia interpretabilidad puede servir como señal de corrección de las predicciones.
