La empresa Pantograph ha presentado a Pan, un modelo de inteligencia artificial de 4 000 millones de parámetros capaz de ejecutar tareas complejas en Minecraft —como combatir enemigos, explorar el mapa para localizar objetos concretos, completar plataformas difíciles y construir estructuras— a partir de una imagen objetivo. La clave del enfoque es haber entrenado la conducta dirigida a metas durante el preentrenamiento con aproximadamente 500 000 horas de vídeos de partidas, en lugar de hacerlo en una fase posterior, lo que amplía la capacidad de generalización del sistema. Tras esa fase, el modelo se ajusta con unas 2 000 horas de trayectorias con acciones etiquetadas por contratistas. Los autores describen el método como aprendizaje por refuerzo a partir de datos de observación, tratando los vídeos de internet como trayectorias sin recompensas ni acciones explícitas y recurriendo al reetiquetado hindsight para fijar objetivos. En una suite de 104 entornos de evaluación, Pan superó a STEVE-1 y a una línea base VLA basada en Gemma 4 de Google DeepMind, especialmente en metas alejadas de la distribución de entrenamiento. El equipo señala que el modelo solo opera dentro de Minecraft y que en los próximos meses entrenará versiones mayores aplicables a entornos visuales más amplios.
