GEN-1.5, el robot que aprende una tarea con sólo observar una demostración de segundos

Fuentes: GEN-1.5: un robot aprende una tarea tras observar una sola demostración de segundos

La empresa de robótica Generalist AI ha presentado GEN-1.5, un modelo capaz de aprender una tarea nueva tras observar una única demostración física de entre tres y doce segundos, sin necesidad de crear nuevos conjuntos de datos ni hacer ajuste fino. La técnica, bautizada como physical prompting, traslada al mundo de la robótica el concepto de los prompts en los modelos de lenguaje: en lugar de palabras, el robot recibe un vídeo con los movimientos que debe reproducir, ya proceda de otro robot, de un simulador o incluso de una persona ejecutando la tarea con sus manos.

Según la compañía, el sistema interpreta el objetivo del vídeo en lugar de memorizar una trayectoria exacta, lo que le permite encadenar dos demostraciones para deducir los pasos intermedios. En pruebas con diez tareas de manipulación sencillas, GEN-1.5 logró una tasa de éxito media del 59 %.

Cuando a ese aprendizaje inicial se suman apenas cinco minutos de datos adicionales —unas 50 demostraciones y sólo 10 actualizaciones del modelo, con cambios en los pesos inferiores al 0,15 %—, la tasa de éxito sube al 83 %. Generalist AI afirma haber preentrenado sus modelos con más de 500 000 horas de interacción física, en una apuesta por crear un modelo de base generalista reutilizable entre tareas, similar a la estrategia seguida en IA generativa de texto.