Artículo divulgativo que presenta la programación dinámica como un principio matemático único capaz de explicar algoritmos muy diversos: desde el cálculo de rutas más cortas en grafos y el ajuste de gradientes en redes neuronales hasta el análisis de gramáticas independientes del contexto o la planificación de trayectorias de cohetes. El autor parte de la definición original de Richard Bellman —«una política óptima tiene la propiedad de que, sea cual sea el estado inicial y la primera decisión, las decisiones restantes deben constituir una política óptima respecto al estado resultante»— y reconoce que él mismo tardó en percibir la conexión entre la técnica de memoización aprendida en algoritmos, la Programación Dinámica Dual Estocástica que usa en problemas de scheduling y los métodos de aprendizaje por refuerzo.
El texto construye primero la base conceptual: define los autómatas como sistemas con estados y acciones gobernados por una función de transición y asocia a cada acción un coste (monetario, temporal, de distancia o, en sentido inverso, una recompensa). A partir de ahí formaliza las dinámicas de decisión, introduce el concepto de política —análoga a un gobierno que actúa sobre el Estado— y define la función de valor como la suma descontada de costes a lo largo del tiempo, justificando la necesidad de un factor de descuento tanto por razones prácticas (inflación, intereses) como analíticas (garantizar la convergencia de la serie mediante una cota geométrica).
Finalmente plantea el problema de optimización: encontrar la política que minimice el coste total acumulado, teniendo en cuenta no solo el coste inmediato sino las consecuencias futuras, y anticipa que esa estructura puede explotarse para resolver el problema de forma eficiente.
