La trampa del modelo de un solo paso en la investigación de IA

Fuentes: The One-Step Trap (in AI Research)

Rich Sutton, investigador de referencia en aprendizaje por refuerzo, describe y rebate en un breve ensayo lo que denomina la «trampa del modelo de un solo paso»: la suposición, muy extendida en la comunidad de inteligencia artificial, de que basta con aprender una transición de un solo paso del entorno para predecir, iterándola, cualquier consecuencia a largo plazo de una política de comportamiento. La idea resulta tentadora porque se asimila a las leyes de la física o a un simulador realista: si las predicciones de un paso fueran perfectas, las predicciones a largo plazo también lo serían. Sutton recuerda, sin embargo, que en la práctica las predicciones de un paso distan de ser exactas y sus errores se acumulan al iterarse, generando desviaciones considerables en horizontes largos. A ello se suma un coste computacional exponencial en la longitud de la predicción, ya que en entornos estocásticos el futuro no es una trayectoria única, sino un árbol de posibilidades que hay que imaginar y ponderar por su probabilidad. Sutton concluye que los modelos del mundo basados en una sola transición son, a la vez, desesperanzadoramente limitados y enormemente atractivos, y que aparecen con frecuencia en POMDP, análisis bayesianos, teoría de control y teorías compresivas de la IA. Como alternativa, el autor propone construir modelos temporalmente abstractos del mundo mediante la jerarquía de opciones y las funciones de valor generalizadas (GVF), y aporta tres referencias académicas propias que desarrollan ese enfoque entre 1999 y 2023.