Aller au contenu principal
RecherchearXiv cs.RO 

UMI-Bridge : alignement latent ancré sur l'action entre données humaines et robotiques de manipulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.18232, septembre 2026) UMI-Bridge, une méthode pour aligner les représentations apprises à partir de données de manipulation humaine, notamment des vidéos égocentriques et des démonstrations captées avec l'interface UMI (Universal Manipulation Interface, un dispositif de préhension portatif), avec celles issues de véritables robots. Le système utilise UMI comme domaine intermédiaire pour faire correspondre les représentations selon l'équivalence du mouvement d'action plutôt que la simple similarité visuelle, en s'appuyant sur la supervision d'action de UMI pour ancrer la représentation latente au mouvement de l'effecteur terminal et au comportement de la pince. Un modèle d'action latente à double vue (LAM) est d'abord entraîné sur des données humaines sans aucune démonstration robotique, puis son module poignet et son modèle de dynamique sont gelés pour régulariser le post-entraînement d'un modèle vision-langage-action (VLA) sur des données mixtes UMI et robot. Sur trois tâches réelles, UMI-Bridge atteint un taux de réussite moyen de 91,7%, contre 73,3% pour une méthode de co-entraînement naïf utilisant les mêmes données. Sur deux tâches testant l'efficacité en données, la méthode dépasse une base de référence entraînée uniquement sur robot avec l'intégralité des données, tout en n'utilisant que 25% des démonstrations robotiques complétées par des données UMI. Elle atteint aussi 85% et 90% de réussite sur deux tâches apprises uniquement à partir de démonstrations UMI, sans aucune démonstration robotique spécifique à la tâche.

Ce travail s'inscrit dans un enjeu central de l'apprentissage robotique actuel: la rareté et le coût des démonstrations réelles collectées directement sur robot. En démontrant qu'un transfert efficace est possible depuis des données humaines bon marché à collecter vers des politiques robotiques opérationnelles, UMI-Bridge apporte un argument concret en faveur de l'hypothèse selon laquelle l'apprentissage par action plutôt que par apparence visuelle permet de réduire la dépendance aux données robot, un point de friction connu des approches VLA à grande échelle comme Pi-0 ou GR00T N2.

Le papier s'appuie sur UMI, un outil de collecte de démonstrations déjà largement adopté dans la recherche en manipulation robotique pour sa facilité de déploiement sans robot physique. La contribution reste à ce stade un résultat de recherche évalué sur un nombre restreint de tâches réelles, sans indication d'intégration dans un produit commercial ni de calendrier de déploiement industriel annoncé.

À lire aussi

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains
1arXiv cs.RO 

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains

Des chercheurs publient HABIT (Human-Aware Behavior and Interaction Training), un jeu de données de démonstration pour l'apprentissage de politiques de manipulation robotique en présence humaine, décrit dans un article déposé sur arXiv (identifiant 2606.31682, juin 2026). Le corpus rassemble plus de 10 000 épisodes et 160 heures d'enregistrements couvrant 60 tâches, organisées selon trois rôles d'interaction homme-robot : « Collaborateur », où humain et robot accomplissent une tâche ensemble, « Collègue », où ils opèrent des tâches séparées dans un espace partagé, et « Superviseur », où l'humain dirige le robot par instructions. Contrairement aux jeux de données existants pour les politiques robotiques généralistes, collectés sans présence humaine dans la scène, HABIT introduit explicitement des humains dans les démonstrations. L'enjeu est la capacité des robots à adopter des comportements conscients de la présence humaine, un angle mort des grands corpus qui alimentent aujourd'hui les politiques VLA (vision-langage-action). Les expériences montrent que l'entraînement sur données incluant des humains fait émerger des comportements que les données robot seul ne produisent pas : synchronisation spatio-temporelle dans les tâches de collaboration, cession de passage dans les tâches de coexistence, et ancrage gestuel pour interpréter les instructions du superviseur. Les auteurs indiquent aussi que l'entraînement sur HABIT accélère l'adaptation à de nouvelles tâches d'interaction homme-robot. Pour les intégrateurs qui déploient des robots en usine ou en entrepôt aux côtés d'opérateurs, c'est un signal que la cohabitation sûre et fluide dépend moins du matériel que de la composition des données d'entraînement, un manque que la course aux modèles fondation robotiques a largement laissé de côté. HABIT s'inscrit dans la lignée des grands corpus type Open X-Embodiment ou DROID, qui ont permis l'essor des politiques généralistes telles que Pi-0 ou GR00T N2 mais restent tournés vers des scènes sans humains, un manque que plusieurs équipes académiques cherchent désormais à combler à mesure que les humanoïdes et bras collaboratifs sortent des lignes de démonstration pour entrer dans des ateliers occupés. À ce stade, HABIT reste une publication de recherche accompagnée d'un jeu de données, sans annonce de produit ni de partenariat industriel ; sa portée dépendra de son adoption par d'autres laboratoires pour entraîner et comparer leurs politiques sur des tâches de collaboration homme-robot.

RecherchePaper
1 source
Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique
2arXiv cs.RO 

Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique

Les auteurs de cette étude publient H-Tac, un jeu de données tactile-action à grande échelle constitué de 160 heures de vidéos humaines à la première personne, couvrant plus de 300 tâches et totalisant 135 000 épisodes. À partir de cette base, ils proposent Transferable Tactile Pre-Training (TTP), un système de pré-entraînement fondé sur le sens tactile humain, destiné à transférer des compétences de manipulation fine vers des robots. La méthode s'appuie sur des espaces tactiles et d'action unifiés, maintenus identiques pendant les phases de pré-entraînement et de post-entraînement, afin de préserver les connaissances acquises lors du passage de l'humain au robot. Un module expert dédié prédit l'évolution future du signal tactile, ce qui permet de modéliser explicitement la dynamique de contact et les interactions physiques fines. Les auteurs rapportent des performances supérieures aux approches existantes, en simulation comme sur robots réels, avec une bonne capacité de généralisation. Ce travail cible un verrou connu du secteur robotique: le toucher reste la modalité la moins exploitée dans les modèles Vision-Language-Action, alors qu'il est indispensable pour les tâches riches en contact où la vision seule ne suffit pas à estimer une force appliquée. Les jeux de données tactiles existants restent petits et couvrent peu de types de contacts, ce qui limite le plafond de performance des modèles VLA tactiles, dont le post-entraînement reste largement indifférent à la dynamique physique. En s'appuyant sur des vidéos humaines plutôt que sur de la téléopération robotique coûteuse à collecter, H-Tac vise à lever ce goulot d'étranglement de données, une stratégie déjà explorée pour le pré-entraînement d'actions mais rarement appliquée au tactile à cette échelle. Si les résultats se confirment sur d'autres plateformes, cela pourrait rapprocher les robots manipulateurs dextres de tâches fines comme l'insertion de précision ou la manipulation d'objets déformables, au-delà des démonstrations scénarisées. L'article s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix) qui combinent perception visuelle et langage mais négligent généralement le retour tactile faute de données adaptées. Publié sur arXiv (2607.01067v1) début juillet 2026, ce travail reste au stade de la recherche académique: aucun partenariat industriel ni déploiement commercial n'est mentionné, et les auteurs présentent TTP comme une preuve de concept ouvrant la voie à un pré-entraînement tactile transférable et passant à l'échelle, plutôt que comme un produit prêt à l'emploi.

RecherchePaper
1 source
Sparse2Act : apprendre des représentations 3D éparses alignées sur l'action pour la manipulation robotique multi-domaines
3arXiv cs.RO 

Sparse2Act : apprendre des représentations 3D éparses alignées sur l'action pour la manipulation robotique multi-domaines

Des chercheurs ont déposé le 12 juin 2026 sur arXiv (référence 2606.12759) Sparse2Act, un cadre de pré-entraînement pour encodeurs de nuages de points 3D épars appliqués à la manipulation robotique. La méthode exploite les actions de l'effecteur terminal en espace tâche comme supervision géométrique : des tokens 3D masqués sont entraînés à organiser les features de scène autour du mouvement de l'espace de travail associé à l'observation. Sur le benchmark LIBERO-10, le système atteint 86,9 % de taux de succès moyen après seulement 500 étapes de fine-tuning. Le même encodeur pré-entraîné permet un transfert inter-domaines de LIBERO vers Meta-World, avec 73,4 % de succès moyen sur le benchmark Meta-World-5. En condition réelle, après pré-entraînement en simulation suivi d'un fine-tuning limité sur données réelles, le système obtient 72,5 % de succès sur quatre tâches de manipulation distinctes. Ce que démontre Sparse2Act, c'est qu'un encodeur 3D peut être pré-entraîné de façon générique et réutilisé tel quel par des politiques aux architectures et espaces d'action différents, y compris des commandes en espace articulaire. C'est un changement de paradigme par rapport aux représentations 3D apprises via des objectifs de tâche spécifiques, qui restent liées à une distribution de données particulière et ne se transfèrent pas. Le sim-to-real à 72,5 % avec fine-tuning limité est un résultat concret que les pipelines VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou OpenVLA peinent à reproduire proprement sur des tâches de manipulation fine. Les ablations publiées dans le papier confirment que le gain provient du signal d'alignement action-masque, et non de la capacité du décodeur, ce qui oriente les futures architectures vers une supervision géométrique légère. L'intérêt pour les représentations 3D explicites en manipulation robotique s'est accentué depuis 2023, en réponse aux limites des politiques purement pixel-based sur les saisies occludées ou en précision sub-centimétrique. Sparse2Act s'inscrit dans le courant du pré-entraînement de représentations robotiques génériques, aux côtés de R3M, MVP ou SPA, mais se distingue par l'usage des actions comme signal de supervision géométrique plutôt que du contrastif visuel ou de la reconstruction d'image. Les concurrents directs incluent les fondations visuelles fine-tunées (DINO, SAM) adaptées à la manipulation et les politiques diffusion-based comme Pi-0.2 ou RDT-1B. La prochaine étape naturelle pour ce travail est l'extension à des morphologies variées (bras bimanuel, robot mobile) et à des scènes hors environnements tabletop standardisés comme LIBERO et Meta-World.

RecherchePaper
1 source
AdvDex : apprentissage de la manipulation dextérique à partir de démonstrations humaines par actions alignées sur les articulations et apprentissage adversarial
4arXiv cs.RO 

AdvDex : apprentissage de la manipulation dextérique à partir de démonstrations humaines par actions alignées sur les articulations et apprentissage adversarial

Une équipe de recherche présente AdvDex, un framework Vision-Language-Action (VLA) pour la manipulation dextre, dans un article publie sur arXiv (2608.14028v1). Le système combine trois éléments : OmniShare, un jeu de données multimodal de démonstrations de manipulation humaine offrant une supervision cinématique fine et des mesures tactiles sans recourir a une téléopération robotique couteuse ; le Joint-Aligned Action Space (JAAS), une représentation canonique de l'action associant une pose de poignet en SE(3) et 15 articulations des doigts, qui aligne fonctionnellement mains humaines, mains robotiques dextres et pinces parallèles ; et un apprentissage adversarial de domaine qui retire des représentations visuelles les indices spécifiques a chaque morphologie robotique. Les tests, portant sur la prédiction d'actions manuelles et sur des taches réelles de manipulation dextre, montrent des gains constants face aux méthodes de référence. Ce résultat répond a deux obstacles concrets du secteur : le cout de collecte des démonstrations robotiques et la faible portabilité d'une politique entre embodiments différents. AdvDex démontre un transfert zero-shot de l'humain vers le robot, une généralisation a des objets et environnements inédits, ainsi qu'une adaptation few-shot économe en données. Ce résultat appuie empiriquement une hypothèse centrale pour les modèles VLA comme Pi-0, GR00T N2 ou Helix : qu'une action canonique partagée peut réduire la dépendance a des flottes de téléopération dédiées par plateforme, un enjeu direct pour la vitesse de commercialisation des mains robotiques dextres. Le papier s'inscrit dans un courant de recherche visant a unifier les espaces d'action entre humains et robots pour exploiter les volumes de vidéo de manipulation humaine déjà disponibles, une direction également suivie par les équipes derrière Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). Classe comme nouvelle publication sur arXiv, AdvDex reste a ce stade une contribution académique évaluée sur des bancs d'essai internes, sans date de commercialisation, partenaire industriel ni déploiement annonce. La taille exacte du jeu OmniShare et les conditions précises des tests de généralisation ne sont pas détaillées, ce qui limite l'évaluation de la portée réelle de ces résultats hors du cadre expérimental du papier.

RechercheActu
1 source