⏱️ Lectura: 13 min
Un modelo de robótica entrenado con cero robots durante su fase inicial ya casi duplica el éxito de su rival más citado en tareas nuevas. Eso es lo que reporta Xiaomi con Xiaomi Robotics 1 (XR-1), un modelo fundacional de manipulación robótica que invierte el orden habitual: primero aprende de video sin robot a escala masiva, y recién después se ajusta con datos reales de brazos y pinzas.
📑 En este artículo
La apuesta responde a un problema conocido en robótica: a diferencia del texto o las imágenes, los datos de robots reales son caros de recolectar y escasos. Xiaomi Robotics 1 intenta romper esa barrera separando qué aprende el modelo del mundo (preentrenamiento sin robot) de cómo lo aplica a un cuerpo físico concreto (post-entrenamiento con robot).
TL;DR
- Xiaomi Robotics 1 (XR-1) preentrena con 100.000 horas de video sin robot (datos UMI) en más de 1.700 escenarios.
- El post-entrenamiento usa más de 7.200 horas de datos reales grabados en casas: ordenar sofás, zapateras y cocina.
- Con menos de 10 horas de datos por tarea, XR-1 logra 75% de éxito general, casi el doble del 40% de π0.5.
- Con menos de 40 horas por tarea, XR-1 sube a 85% de éxito frente al 53% de π0.5, la referencia de Physical Intelligence.
- En laundry loading (doblar ropa) con menos de 40 horas, XR-1 alcanza 100% de éxito frente a 50% de π0.5.
- XR-1 logra el mejor resultado en los cuatro benchmarks de simulación en los que fue evaluado, según Xiaomi.
- El preentrenamiento muestra una ley de escalado limpia: el error de acción baja de forma constante con más datos y parámetros.
- El éxito en robots reales tras el post-entrenamiento sube de forma predecible con más datos de preentrenamiento, sin señales de saturación.
Qué pasó
Xiaomi publicó los resultados de Xiaomi Robotics 1, un modelo fundacional de manipulación robótica entrenado en dos etapas, siguiendo el mismo paradigma que usan los modelos de lenguaje: preentrenamiento amplio seguido de un ajuste fino especializado. La diferencia clave es que la etapa de preentrenamiento no usa datos de robots en absoluto.
En lugar de grabar brazos robóticos ejecutando tareas, Xiaomi usó 100.000 horas de trayectorias embodiment-free capturadas con el método UMI (Universal Manipulation Interface), un dispositivo de mano que graba manipulación humana sin necesidad de un robot físico. Esas trayectorias cubren más de 1.700 escenarios distintos: hogares, comercios, sitios industriales y espacios al aire libre.
Después de esa fase, el equipo aplicó un post-entrenamiento con datos de robots reales: más de 7.200 horas grabadas en casas reales, resolviendo tareas como ordenar un sofá, clasificar un zapatero o guardar utensilios de cocina. Esa combinación (mucho video sin robot más una cantidad moderada de datos reales) es el núcleo de la propuesta.
Contexto e historia: por qué la robótica no siguió la ley de escalado
Los modelos de lenguaje y visión llevan años beneficiándose de leyes de escalado empíricas: más datos, más parámetros y más cómputo producen mejor capacidad de forma predecible. La robótica se quedó fuera de esa tendencia porque conseguir datos de robots reales, a diferencia de texto scrapeado de internet, requiere hardware físico, supervisión humana y tiempo de grabación real. Ese cuello de botella limitó cuánto podían escalar los modelos de política (policy models) para robots.
El método UMI, desarrollado originalmente en el ámbito académico como una interfaz de manipulación universal, propone una salida a ese problema: capturar demostraciones de manipulación con una pinza portátil que una persona puede llevar a cualquier entorno, sin depender de un robot costoso durante la grabación. Xiaomi lleva esa idea a una escala que hasta ahora no se había reportado públicamente: 100.000 horas de trayectorias.
El desafío de una base de datos así de grande no es solo grabarla, sino etiquetarla. Anotar manualmente 100.000 horas de video es inviable. Por eso Xiaomi construyó un pipeline de auto-etiquetado: divide cada trayectoria larga en segmentos de longitud fija y usa un modelo de visión y lenguaje (VLM) para describir, en cada segmento, cómo cambia el estado de la pinza y de los objetos con los que interactúa.
Cómo funciona el entrenamiento en dos etapas
El entrenamiento de Xiaomi Robotics 1 sigue el mismo esquema de dos fases que popularizaron los grandes modelos de lenguaje: una fase amplia que construye representaciones generales, y una fase de ajuste que alinea esas representaciones con un caso de uso concreto.
flowchart TD
A["100.000 horas de video UMI"] --> B["Preentrenamiento: accion desde descripciones de estado"]
B --> C["7.200+ horas de datos reales de robot"]
C --> D["Post-entrenamiento: alineacion de cuerpo e instrucciones"]
D --> E["Robot ejecuta tareas nuevas en entornos no vistos"]
En la etapa de preentrenamiento, el modelo aprende a generar acciones que llevan una escena hacia el estado descrito por el texto generado automáticamente. No sabe todavía qué es un robot específico ni cómo se mueven sus articulaciones: aprende una noción general de cómo cambia el mundo cuando alguien manipula objetos.
En la etapa de post-entrenamiento, ese conocimiento general se traduce a un cuerpo robótico concreto en dos ejes. Primero, la alineación de cuerpo (embodiment alignment), que usa los datos reales de robot para mapear la capacidad general de generación de acciones a los actuadores físicos reales. Segundo, la alineación de instrucciones, que convierte al modelo de “genera acciones dado un cambio de estado descrito” a “entiende una instrucción en lenguaje natural y la ejecuta directamente”.
💭 Clave: el hallazgo central del paper es que el error de acción durante el preentrenamiento baja de forma constante a medida que crecen los datos y el tamaño del modelo, y que esa mejora se traslada al éxito real del robot después del post-entrenamiento, incluso en entornos y objetos nunca vistos.
Detalles técnicos y rendimiento
Xiaomi evaluó el modelo post-entrenado en dos escenarios complementarios: adaptación eficiente a tareas nuevas y benchmarks de simulación estándar.
Para la adaptación a tareas nuevas, el equipo midió cuánto tarda XR-1 en aprender tareas complejas nunca vistas (empacar un teléfono, recargar una impresora, cargar una lavadora, empacar cajas) usando solo unas horas de demostraciones por tarea, comparándolo contra π0.5, el modelo de referencia de Physical Intelligence.
| Tarea | XR-1 <10h/tarea | π0.5 <10h/tarea | XR-1 <40h/tarea | π0.5 <40h/tarea |
|---|---|---|---|---|
| Empacar teléfono | 70% | 30% | 80% | 40% |
| Recargar impresora | 70% | 20% | 60% | 20% |
| Cargar lavadora | 80% | 40% | 100% | 50% |
| Empacar cajas | 80% | 70% | 100% | 100% |
| Promedio general | 75% | 40% | 85% | 53% |
Con un presupuesto de menos de 10 horas de demostraciones por tarea, XR-1 alcanza un 75% de éxito general, casi el doble del 40% que logra π0.5 con el mismo presupuesto de datos. Al subir el presupuesto a menos de 40 horas por tarea, XR-1 llega a 85% frente al 53% de π0.5.
En simulación, Xiaomi evaluó el modelo en cuatro benchmarks estándar de la comunidad robótica y reporta el mejor resultado promedio en los cuatro, lo que según el equipo confirma que las ganancias de generalización observadas en el mundo real también se sostienen en evaluación simulada.
Aunque Xiaomi no publicó código ni pesos del modelo, sí describió el patrón de inferencia típico de un modelo visión-lenguaje-acción (VLA) como este: recibe una imagen de la escena y una instrucción en texto, y devuelve una secuencia de acciones de bajo nivel para el actuador. Un ejemplo conceptual, no oficial, de cómo se estructura ese ciclo de inferencia en un VLA típico:
vla_model = load_policy("xr1-checkpoint")
observacion = camara.capturar_frame()
instruccion = "guardar los platos en la alacena"
accion = vla_model.predecir(
imagen=observacion,
texto=instruccion,
historial_estado=robot.estado_actual()
)
robot.ejecutar(accion)
Este bloque ilustra el ciclo estándar de un modelo VLA: observación más instrucción entran, una acción de bajo nivel sale. La lógica interesante de XR-1 no está en ese ciclo, sino en cómo se entrenó la política que lo resuelve.
El pipeline de auto-etiquetado usado en el preentrenamiento, que describe transiciones de estado por segmento de video, puede resumirse conceptualmente así:
for clip in dividir_en_segmentos(trayectoria_umi, duracion_fija=SEGMENT_LEN):
descripcion = vlm.describir_transicion(
frame_inicial=clip.primer_frame,
frame_final=clip.ultimo_frame,
foco="pinza y objeto manipulado"
)
dataset.agregar(clip, descripcion)
Ese pipeline es lo que convierte 100.000 horas de video crudo en un corpus etiquetado utilizable para entrenar generación de acciones, sin depender de anotación humana segmento por segmento.
Cómo acercarte a este enfoque hoy
Xiaomi no liberó pesos ni código de Xiaomi Robotics 1, así que no hay un comando de instalación para probar el modelo en sí. Lo que sí es reproducible hoy es la parte metodológica: el método UMI que alimenta el preentrenamiento es un proyecto de investigación público, documentado en umi-gripper.github.io, con planos de la pinza portátil y el pipeline de captura de datos.
Si trabajás en robótica de manipulación y no tenés flota de robots, la lección práctica de XR-1 es replicable a menor escala: grabar demostraciones humanas con una interfaz portátil tipo UMI es mucho más barato que operar un brazo robótico, y ese video puede usarse para preentrenar representaciones de acción antes de tocar hardware real. La verificación de que ese preentrenamiento realmente ayuda se hace igual que en el paper: medir el error de acción en un set de validación separado a medida que crece el dataset, y confirmar que la curva baja de forma monótona antes de invertir en la etapa cara de datos reales.
💡 Tip: antes de recolectar datos de robot real, valida tu preentrenamiento embodiment-free midiendo el error de acción en un conjunto de validación fijo; si no baja de forma consistente al agregar más datos, el problema está en el pipeline de etiquetado, no en la cantidad de datos.
Impacto y análisis
El resultado más relevante de XR-1 no es que un modelo grande funcione bien, sino que la mejora obtenida en preentrenamiento sin robot se transfiere de forma predecible al éxito con robots reales después del post-entrenamiento. Eso es justo lo que faltaba demostrar para justificar invertir en datos embodiment-free a gran escala: que no es solo una forma barata de generar más datos, sino una forma barata de generar datos que efectivamente mueven la aguja en el mundo físico.
La comparación contra π0.5 de Physical Intelligence importa porque no es un baseline débil: es uno de los modelos de referencia más citados en manipulación generalista con robots reales. Que XR-1 casi duplique su tasa de éxito con el mismo presupuesto de datos por tarea sugiere que separar preentrenamiento (barato, sin robot) de post-entrenamiento (caro, con robot) es una estrategia con mejor retorno por hora de dato recolectada que entrenar directamente con datos de robot desde cero.
El límite honesto del anuncio es que toda la evidencia proviene de la propia Xiaomi, sin pesos públicos ni evaluación independiente todavía. Los cuatro benchmarks de simulación donde XR-1 dice liderar tampoco se detallan con cifras completas en el material publicado, lo que hace imposible, por ahora, verificar esos números de forma externa.
Qué sigue
Xiaomi Robotics 1 se presenta como un modelo fundacional pensado para servir de base a aplicaciones posteriores, no como un producto cerrado. El propio equipo lo usa ya en dos frentes: adaptación rápida a tareas nuevas con pocas horas de datos, y evaluación en benchmarks de simulación estándar de la comunidad.
El paso natural siguiente, si Xiaomi sigue el patrón de otros laboratorios de modelos fundacionales, es escalar aún más el preentrenamiento embodiment-free (más horas, más escenarios) y medir si la curva de escalado sigue sin saturar, tal como reporta el equipo hasta el punto actual. También queda pendiente si Xiaomi integrará XR-1 en productos robóticos domésticos propios, dado que buena parte de los datos de post-entrenamiento ya está orientada a tareas de hogar.
📖 Resumen en Telegram: Ver resumen
Probalo vos: revisá el proyecto UMI en umi-gripper.github.io para ver de primera mano cómo se graba manipulación sin robot.
Preguntas frecuentes
¿Qué es Xiaomi Robotics 1?
Es un modelo fundacional de manipulación robótica de Xiaomi, entrenado en dos etapas: preentrenamiento con video sin robot y post-entrenamiento con datos de robots reales.
¿Qué significa “embodiment-free” o UMI?
Significa que los datos se graban sin usar un robot físico, con una pinza portátil que una persona lleva en la mano. UMI (Universal Manipulation Interface) es el método que Xiaomi usó para capturar esas 100.000 horas.
¿Xiaomi liberó el código o los pesos de XR-1?
No, hasta la fecha Xiaomi no publicó pesos ni código del modelo. Lo que sí es público y reproducible es el método UMI en el que se basa el preentrenamiento.
¿Cómo se compara XR-1 con π0.5?
Con menos de 10 horas de datos por tarea, XR-1 logra 75% de éxito promedio frente a 40% de π0.5. Con menos de 40 horas, XR-1 sube a 85% frente a 53% de π0.5.
¿Cómo etiquetó Xiaomi 100.000 horas de video sin anotación manual?
Con un pipeline automático: divide cada trayectoria en segmentos de duración fija y usa un modelo de visión y lenguaje para describir cómo cambia el estado de la pinza y los objetos en cada segmento.
¿Los resultados de XR-1 están verificados de forma independiente?
No todavía. Todas las cifras publicadas provienen del propio equipo de Xiaomi Robotics; no hay pesos públicos ni evaluación externa disponible por ahora.
Referencias
- Xiaomi Robotics: página oficial del proyecto Xiaomi Robotics 1, con datos, método y tablas de resultados.
- Universal Manipulation Interface (UMI): proyecto de investigación en el que se basa la captura de datos embodiment-free.
- Physical Intelligence: laboratorio que desarrolla π0 y π0.5, el modelo usado como referencia comparativa.
- Wikipedia: Xiaomi: contexto general sobre la compañía y sus divisiones de hardware y robótica.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Imagen destacada: Foto de Erhan Astam en Unsplash
0 Comentarios