Xiaomi presenta un modelo de robótica escalable entrenado con más de 100.000 horas de trayectorias reales

Fuentes: Xiaomi-Robotics-1: Scaling Robot Policy Models with Embodiment-Free Pre-training

Xiaomi Robotics-1 es un modelo fundacional de robótica diseñado para resolver la escasez de datos que limita el escalado de las políticas de robots. La propuesta se inspira en la estrategia de los modelos de lenguaje: preentrenar a gran escala con datos abundantes y luego alinear con少量 datos de robots reales.

El preentrenamiento emplea 100.000 horas de trayectorias embodiment-free (UMI) en más de 1.700 escenarios, desde hogares hasta entornos industriales. Cada trayectoria se divide en segmentos y se anota automáticamente con descripciones lingüísticas de transiciones de estado, mediante un pipeline basado en un modelo visión-lenguaje. Esto aporta un corpus amplio y diverso sin necesidad de etiquetado manual.

En la fase de post-entrenamiento se usan más de 7.200 horas de datos de robots reales en hogares reales, además de datos cross-embodiment y UMI de alta calidad. El modelo aprende a generar acciones a partir de instrucciones en lenguaje natural.

El sistema muestra un comportamiento de escalado claro: a mayor cantidad de datos y tamaño de modelo durante el preentrenamiento, menor error de validación y mayor tasa de éxito en robots reales tras el post-entrenamiento, sin signos de saturación. En adaptación a nuevas tareas (empaquetar teléfonos, rellenar impresoras, cargar lavadoras, empaquetar cajas), alcanza el 75% de éxito con menos de 10 horas de demostraciones por tarea y el 85% con menos de 40 horas, frente al 40% y 53% del baseline π0.5. En los benchmarks RoboCasa, RoboCasa365, VLABench y RoboDojo obtiene resultados de estado del arte.