Présentation de Xiaomi-Robotics-1

Xiaomi-Robotics-1 est un modèle de robotique qui combine une pré-formation à grande échelle sans embodiment (UMI) avec une formation en post-traitement sur des données réelles de robots. Ce modèle vise à répondre à la question de ce que les robots peuvent faire sous une formation à grande échelle.

Architecture et formation

La formation de Xiaomi-Robotics-1 se compose de deux étapes : la pré-formation et la formation en post-traitement. La pré-formation utilise des données UMI pour apprendre des représentations générales pour la génération d'actions, tandis que la formation en post-traitement aligne le modèle avec des robots réels et des capacités de suivi d'instructions.

La pré-formation utilise un pipeline d'auto-étiquetage pour annoter les données UMI avec des descriptions de transitions d'état de scène. Les résultats montrent que la pré-formation présente un comportement d'échelle propre : à mesure que les données et la taille du modèle augmentent, l'erreur d'action de validation diminue de manière régulière.

Évaluation et applications

Xiaomi-Robotics-1 peut être utilisé pour effectuer une large gamme de tâches de manipulation mobile dans le monde réel. L'évaluation du modèle en post-formation montre que le taux de réussite des robots réels augmente de manière régulière et prévisible à mesure que la quantité de données de pré-formation et la taille du modèle augmentent.

Le modèle peut également apprendre de nouvelles tâches avec une grande efficacité de données. Avec une moyenne de moins de 10 heures de démonstrations par tâche, il atteint un taux de réussite global de 75 %, soit près du double de la référence π0.5 (40 %) au même budget.

Conclusion

Xiaomi-Robotics-1 démontre une voie pratique pour mettre à l'échelle les modèles de base de robotique : la pré-formation à grande échelle sans embodiment UMI brise le goulet d'étranglement des données de robot, tandis que l'alignement des robots réels et des instructions transfère cette capacité générale aux robots physiques.

XR-1 = Xiaomi-Robotics-1; Rel. Gain = (XR-1 − 2nd best) / 2nd best