Entrenar un modelo de mundo para jugar Pokémon Red

Fuentes: Training a World Model to Play Pokémon Red

Un investigador ha documentado el proceso de entrenamiento de un modelo de mundo basado en la arquitectura JEPA (Joint Embedding Predictive Architecture) para aprender a interactuar con el videojuego Pokémon Red. El objetivo era que la IA comprendiera las dinámicas del entorno sin necesidad de recompensas externas, imitando la lógica de un jugador humano. El modelo, entrenado localmente en una RTX 3080 Ti, logró seleccionar a Squirtle como Pokémon inicial mediante una secuencia de pulsaciones de la tecla A, demostrando la capacidad de generalización de la arquitectura.

El artículo explica que un modelo de mundo aprende la correlación entre acciones y estados futuros, pasando de capturas de pantalla a vectores de embeddings en un espacio latente. Para evitar el colapso latente, donde el modelo colapsa todas las entradas en un único vector para minimizar el error cuadrático medio, se emplea la técnica SIGReg. Este enfoque permite mantener la utilidad del espacio de embeddings, asegurando que el modelo distinga entre estados distintos y no simplemente prediga un estado trivial. El proyecto ilustra los desafíos técnicos de la JEPA, como la necesidad de regularizar el espacio latente para evitar degeneraciones, y ofrece una visión didáctica de cómo los modelos de mundo actuales operan en entornos discretos.