Aller au contenu principal
RecherchearXiv cs.RO 

ExoBridge : apprendre la correspondance entre main nue et exosquelette de main grâce au couplage des membres humains

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.07692) ExoBridge, un cadre d'apprentissage qui prédit l'état moteur et tactile d'un exosquelette instrumenté à partir d'une simple vidéo de main nue. La collecte repose sur un protocole bimanuel. Une main reste nue et fournit les observations visuelles, tandis que l'autre porte l'exosquelette et fournit des mesures synchronisées de mouvement et de toucher. Ces démonstrations appariées entraînent un modèle visuel temporel qui prédit trois grandeurs à partir de la seule vidéo de la main nue : le contact des bouts de doigts, l'intensité tactile continue et le mouvement relatif des encodeurs. L'évaluation porte sur 1 215 démonstrations réparties sur quatre tâches de manipulation, avec des sessions de collecte mises de côté pour le test. Elle donne une AUROC de 0,916 pour la détection de tout contact et une corrélation de Pearson de 0,790 pour l'intensité tactile. Le modèle prédit aussi les variations relatives de configuration de l'exosquelette. Les mesures sont agrégées sur l'ensemble des tâches. L'article ne donne ni le détail par tâche, ni le nombre d'opérateurs, ni les objets manipulés. Aucune démonstration sur robot n'est annoncée. Il s'agit d'un résultat de recherche, sans produit ni déploiement.

L'enjeu est la pénurie de données pour la manipulation dextre. Les vidéos humaines sont abondantes et bon marché, mais elles ne contiennent ni force ni contact, et ce sont justement ces signaux qui distinguent une saisie réussie d'un glissement. Les gants et exosquelettes mesurent ces grandeurs, mais ils gênent le geste, déforment la prise naturelle et se déploient mal à grande échelle. ExoBridge propose de n'instrumenter qu'une main pendant la collecte, puis de ne conserver que la vidéo à l'inférence. Si cela se confirme, un corpus de vidéos de mains nues pourrait recevoir des pseudo-étiquettes tactiles utilisables pour entraîner des politiques de type VLA. Les limites sont nettes. La méthode suppose que les deux mains se comportent de façon couplée, ce qui exclut les gestes asymétriques. Un AUROC de 0,916 sur le contact binaire ne garantit pas une estimation de force assez précise pour piloter un contrôleur. Le lien avec une main robotique passe par une calibration existante de l'exosquelette, et non par une validation de bout en bout.

Ce travail s'inscrit dans l'effort général pour apprendre la dextérité à partir de l'humain. Il croise la téléopération par exosquelette, les gants tactiles et les approches par vidéo seule, qui renoncent au tactile. ExoBridge se place entre les deux, en utilisant le capteur comme enseignant temporaire plutôt que comme équipement permanent. La suite logique est de tester la chaîne complète sur une main dextre réelle, de vérifier la généralisation à d'autres opérateurs, objets et caméras, et de mesurer le gain obtenu en politique apprise par rapport à une simple imitation visuelle. Ces éléments ne figurent pas encore dans l'article.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

SEED-UMI : exosquelette partagé entre humain et robot pour une démonstration dextérique en correspondance directe
1arXiv cs.RO 

SEED-UMI : exosquelette partagé entre humain et robot pour une démonstration dextérique en correspondance directe

Publié le 11 septembre 2026 sur arXiv (2609.11753), SEED-UMI est un framework d'apprentissage par imitation pour mains robotiques dextres qui fait porter le même exosquelette à l'humain et au robot. Les codeurs articulaires de l'exosquelette deviennent une mesure physique partagée, et des caméras fixées au poignet observent le même mécanisme pendant la collecte des démonstrations humaines et pendant l'exécution robotique. Le transfert de mouvement (retargeting) devient ainsi une supervision appariée entre les deux incarnations, ce qui permet d'entraîner les politiques directement sur les images brutes du poignet, sans segmentation ni inpainting. Sur cinq tâches riches en contacts, SEED-UMI collecte les données trois fois plus vite que la téléopération par exosquelette classique et atteint 70,0% de réussite moyenne en exécution. L'enjeu dépasse la prouesse technique : la collecte de démonstrations dextres reste le principal frein à l'entraînement à grande échelle des modèles vision-langage-action, alors que les mains robotiques accusent un retard net sur les progrès réalisés en locomotion bipède. Les exosquelettes actuels n'enregistrent que le côté humain et retargettent via des correspondances calibrées à vide, qui se dégradent dès qu'un contact physique intervient, un problème critique pour l'assemblage ou la préhension fine. En partageant le même exosquelette entre humain et robot, SEED-UMI supprime cette source de désalignement, ce qui pourrait réduire le coût des jeux de données pour les intégrateurs travaillant sur des mains robotiques commerciales. Un taux de réussite de 70% reste néanmoins loin de la fiabilité industrielle attendue en production, ce qui situe ce travail au stade de la recherche. Le nom du framework renvoie à UMI (Universal Manipulation Interface), une lignée de travaux ayant popularisé la capture de démonstrations par caméra portée à la main plutôt que par téléopération robotique directe. SEED-UMI s'inscrit dans un paysage où coexistent gants de motion capture et exosquelettes de téléopération, tandis que des modèles fondation comme Pi-0, GR00T N2 ou Helix cherchent à généraliser à partir de tels jeux de données pour piloter mains et humanoïdes variés. Publié comme simple preprint arXiv, sans institution ni calendrier de déploiement précisés, SEED-UMI reste une contribution méthodologique dont la reproductibilité et l'extension à d'autres mains robotiques restent à démontrer par la communauté.

RecherchePaper
1 source
MatchingPolicy : une politique consciente des correspondances permet l'apprentissage en contexte entre objets différents
2arXiv cs.RO 

MatchingPolicy : une politique consciente des correspondances permet l'apprentissage en contexte entre objets différents

Des chercheurs présentent MatchingPolicy, un nouveau framework d'apprentissage par imitation en contexte (in-context imitation learning) destine a la manipulation robotique, décrit dans un article publie sur arXiv sous la référence 2608.16715v1. Contrairement aux approches classiques qui mélangent identification de correspondances et adaptation de l'action dans un même module, MatchingPolicy sépare explicitement ces deux étapes: une politique de diffusion dite correspondence-aware conditionne directement les actions du robot sur des correspondances sémantiques denses établies entre la démonstration fournie et la scene observée. Le système combine des modèles de vision fondationnels (vision foundation models) avec un algorithme de mise en correspondance en deux étapes, conçu pour établir dynamiquement des correspondances fiables même face a des objets jamais rencontres. La méthode est évaluée sur le benchmark de simulation RLBench ainsi que sur des taches de manipulation en conditions réelles, mais l'article ne communique pas, dans son résume, de chiffres précis de taux de réussite, de temps de cycle ou de charge utile, ce qui limite pour l'instant toute comparaison directe avec des systèmes commerciaux. L'enjeu vise directement l'un des points faibles récurrents de l'apprentissage par imitation en few-shot: la dégradation des performances des qu'un robot rencontre un objet ou un scenario absent de ses démonstrations d'entrainement. En découplant architecturalement la reconnaissance de correspondances et l'apprentissage de la politique, les auteurs affirment résoudre un conflit interne qui, selon eux, bridait jusqu'ici la capacité de transfert hors distribution des politiques en contexte. Pour les intégrateurs et laboratoires travaillant sur des architectures vision-langage-action, un tel résultat, s'il se confirme a plus grande échelle, appuierait l'idée qu'une meilleure structuration de la représentation des correspondances sémantiques compte autant que le volume de données d'entrainement pour généraliser a de nouveaux objets, une piste alternative aux stratégies purement data-driven adoptees par des modèles comme GR00T N2 ou Pi-0. MatchingPolicy s'inscrit dans la lignée des travaux récents sur l'apprentissage en contexte applique a la robotique, qui cherchent a réduire le nombre de démonstrations nécessaires pour qu'un robot exécuté une nouvelle tache en s'appuyant sur des modèles de vision pré-entraines plutôt que sur un reentrainement complet. La comparaison est menée sur RLBench, benchmark standard de manipulation simulée largement utilise par la communauté recherche pour évaluer la généralisation des politiques robotiques, ce qui permettra une confrontation directe avec les méthodes concurrentes publiées sur le même banc d'essai. L'article, encore au stade de preprint arXiv non revu par les pairs, ne précise ni calendrier de déploiement ni application industrielle immédiate: il s'agit pour l'heure d'une contribution méthodologique destinée a la communauté de recherche en apprentissage par imitation, dont l'impact réel dépendra de sa reproduction et de son adoption par des équipes tierces au-delà des résultats présentes par les auteurs eux-mêmes.

RecherchePaper
1 source
Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet
3arXiv cs.RO 

Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet

Une équipe de recherche publie sur arXiv, le 16 septembre 2026 (arXiv:2609.16683), Weave, un framework pour apprendre à des robots humanoïdes la loco-manipulation dextre en corps entier à partir de démonstrations humaines capturées. Ces interactions humain-objet sont converties en références exécutables par le robot via un retargeting sensible aux contacts et une complétion du mouvement d'approche. Une politique consciente des contacts et de la géométrie commande ensuite simultanément 29 articulations corporelles et 12 articulations de doigts actionnées, sur plusieurs objets et séquences d'interaction. Sur neuf objets testés, le taux de réussite atteint 92,5 % pour les interactions entraînées et 65,0 % pour des séquences totalement inédites, sans entraînement supplémentaire. Les auteurs publient aussi environ 9 000 exécutions physiques réelles, soit près de 23 heures de trajectoires robot-objet annotées en contacts. Coordonner équilibre, locomotion et contact dextre des doigts reste l'un des obstacles majeurs pour faire passer les humanoïdes de la démonstration scriptée à la manipulation réelle d'objets variés, un enjeu direct pour les intégrateurs visant l'entrepôt ou l'usine. En retargetant des captures de mouvement humain vers l'embodiment du robot, Weave s'attaque frontalement au fossé entre démonstration et contrôle réel. Le score de 65 % sur des séquences jamais vues, même limité à neuf objets, suggère que la politique apprend des primitives de contact réutilisables plutôt que de simples trajectoires mémorisées, une distinction clé face aux démonstrations vidéo soigneusement sélectionnées courantes dans le secteur. Le jeu de données publié constitue par ailleurs une ressource comparable, dans son esprit, aux corpus servant à entraîner des modèles vision-langage-action comme Pi-0 ou GR00T N2. Il s'agit d'un travail de recherche en preprint, sans partenaire industriel ni plateforme robotique nommée dans le résumé, pas encore relu par les pairs : une démonstration de laboratoire, non un produit déployé ni un pilote commercial. Weave s'inscrit dans la vague de recherches sur l'apprentissage par imitation à partir de capture de mouvement humain, aux côtés d'initiatives comme Helix chez Figure ou les politiques de Physical Intelligence, qui visent toutes à résoudre le transfert humain-vers-robot pour la manipulation dextre. Aucun calendrier de déploiement n'est annoncé ; la suite logique, ouverte par la publication du jeu de données, est son adoption par d'autres équipes pour entraîner ou évaluer leurs propres politiques d'interaction, plutôt qu'un lancement produit à court terme.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
4arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source