Un agente de IA que entrena otros agentes de IA mediante bucles de aprendizaje por refuerzo anidados

Fuentes: An AI agent that RL-trains other AI agents via two nested reinforcement learning loops

El repositorio ai-trains-ai, publicado por Danau5tin, implementa una canalización de código abierto con dos bucles de aprendizaje por refuerzo (RL) independientes que se entrenan mutuamente. En el bucle externo, un agente entrenador basado en Qwen3-35B-A3B con un adaptador LoRA aprende, mediante GRPO sobre la plataforma Tinker de Thinking Machines, a redactar trabajos de entrenamiento para modelos pequeños (Qwen3-0.6B y 1.7B). En el bucle interno, esos trabajos se ejecutan con prime-rl sobre pods de GPU en Runpod, evaluando el modelo resultante en una prueba oculta.

La recompensa del bucle externo combina tres componentes ponderados (0,35 de validación, 0,60 de calidad del trabajo y 0,05 de velocidad) y ascendió de 0 a un pico de 0,63 tras 54 pasos de entrenamiento repartidos en tres ejecuciones (pilot-7, 7b y 7c). El análisis muestra dos fases de aprendizaje: primero el agente aprendió a producir trabajos válidos y a evitar fallos, y después a generar modelos con mejor rendimiento, pasando de elegir casi siempre el modelo 0.6B al 1.7B en el 95% de los episodios.

El sistema se evaluó sobre seis familias de tareas, cinco usadas en entrenamiento y una (triage) reservada como prueba de generalización. En esta última, la recompensa media pasó de 0,399 en el modelo base a 0,492 tras 54 pasos. Todo el proyecto, incluidos los pesos del adaptador LoRA en Hugging Face, los guiones de orquestación y las réplicas de los trabajos, se distribuye bajo licencia abierta.