UMI-Bridge : alignement latent ancré sur l'action entre données humaines et robotiques de manipulation
Une équipe de recherche publie sur arXiv (2609.18232, septembre 2026) UMI-Bridge, une méthode pour aligner les représentations apprises à partir de données de manipulation humaine, notamment des vidéos égocentriques et des démonstrations captées avec l'interface UMI (Universal Manipulation Interface, un dispositif de préhension portatif), avec celles issues de véritables robots. Le système utilise UMI comme domaine intermédiaire pour faire correspondre les représentations selon l'équivalence du mouvement d'action plutôt que la simple similarité visuelle, en s'appuyant sur la supervision d'action de UMI pour ancrer la représentation latente au mouvement de l'effecteur terminal et au comportement de la pince. Un modèle d'action latente à double vue (LAM) est d'abord entraîné sur des données humaines sans aucune démonstration robotique, puis son module poignet et son modèle de dynamique sont gelés pour régulariser le post-entraînement d'un modèle vision-langage-action (VLA) sur des données mixtes UMI et robot. Sur trois tâches réelles, UMI-Bridge atteint un taux de réussite moyen de 91,7%, contre 73,3% pour une méthode de co-entraînement naïf utilisant les mêmes données. Sur deux tâches testant l'efficacité en données, la méthode dépasse une base de référence entraînée uniquement sur robot avec l'intégralité des données, tout en n'utilisant que 25% des démonstrations robotiques complétées par des données UMI. Elle atteint aussi 85% et 90% de réussite sur deux tâches apprises uniquement à partir de démonstrations UMI, sans aucune démonstration robotique spécifique à la tâche.
Ce travail s'inscrit dans un enjeu central de l'apprentissage robotique actuel: la rareté et le coût des démonstrations réelles collectées directement sur robot. En démontrant qu'un transfert efficace est possible depuis des données humaines bon marché à collecter vers des politiques robotiques opérationnelles, UMI-Bridge apporte un argument concret en faveur de l'hypothèse selon laquelle l'apprentissage par action plutôt que par apparence visuelle permet de réduire la dépendance aux données robot, un point de friction connu des approches VLA à grande échelle comme Pi-0 ou GR00T N2.
Le papier s'appuie sur UMI, un outil de collecte de démonstrations déjà largement adopté dans la recherche en manipulation robotique pour sa facilité de déploiement sans robot physique. La contribution reste à ce stade un résultat de recherche évalué sur un nombre restreint de tâches réelles, sans indication d'intégration dans un produit commercial ni de calendrier de déploiement industriel annoncé.
Dans nos dossiers




