Receta para entrenar drones de carreras con aprendizaje por refuerzo

Fuentes: A recipe for drone racing with reinforcement learning

Un blog técnico detalla una metodología práctica, descrita como 'receta', para entrenar una política de aprendizaje por refuerzo (RL) capaz de pilotar un cuadricóptero a través de un circuito con compuertas. El texto, tercero de una serie sobre simulación de cuadricópteros, parte de la validación del algoritmo PPO en un problema sencillo —el péndulo invertido de Gymnasium— usando entornos vectorizados de stable-baselines3, y luego aplica los mismos hiperparámetros a un entorno propio construido sobre el simulador físico MuJoCo.

El diseño de acciones emplea un esquema CTBR (empuje colectivo más velocidades angulares en ejes cuerpo), que un controlador proporcional de bajo nivel traduce a comandos de motor; según el autor, esta interfaz, además de simplificar el aprendizaje, coincide con la que aceptan controladores reales como Betaflight, lo que facilita el despliegue en hardware. Para observación se utiliza el estado libre de MuJoCo en 13 dimensiones (posición, cuaternión de actitud, velocidad lineal y velocidad angular). El bucle de actitud se cierra con un controlador P al que se añade explícitamente el término de acoplamiento giroscópico, linearizando así la dinámica y dejando una respuesta de primer orden por eje.

El entrenamiento se divide en tres fases incrementales: péndulo invertido, vuelo estacionario y, finalmente, recorrido de un circuito de ocho compuertas con una recompensa diseñada para avanzar entre ellas y con inicializaciones aleatorias que fomentan la robustez. El código completo está publicado en el repositorio mrandri19/quadcopter-racing de GitHub y las visualizaciones se generan con la herramienta Rerun.