Aller au contenu principal
RecherchearXiv cs.RO 

Imitation morphométrique : du retargeting de mains sensible au contact vers une politique visuomotrice simulation-vers-réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un papier de recherche publié sur arXiv sous la référence 2609.28660v1 présente "Morphometric Imitation", un framework en trois étapes qui convertit des démonstrations humaines main-objet en politiques robotiques visuomotrices déployables directement en conditions réelles, sans réentraînement supplémentaire (zero-shot sim-to-real). La première étape, l'optimisation morphométrique (MMO), retargete cinématiquement le mouvement humain vers différentes morphologies de mains robotiques tout en préservant les contacts observés. La deuxième étape s'appuie sur de l'apprentissage par renforcement résiduel, nourri par la pose de l'objet et les informations de contact issues du mouvement humain, pour produire des démonstrations robotiques dynamiquement réalisables. La troisième étape distille ces démonstrations en politiques visuomotrices entraînables. Testé sur trois mains robotiques différentes et dix interactions main-objet, MMO améliore le score F1 de contact d'au moins 8 points par rapport au meilleur des cinq méthodes de référence comparées, pour chaque main testée, et augmente jusqu'à 35 points le taux de réussite du retargeting dynamique en aval. Les politiques visuomotrices finales atteignent 89,3% de réussite en zero-shot sur 300 essais réels menés sur 30 objets. Une page projet dédiée accompagne la publication.

Ce travail cible un verrou central de la manipulation dextre : exploiter la richesse des démonstrations humaines reconstruites sans être bloqué par l'écart de morphologie entre main humaine et main robotique, ni par l'irréalisme dynamique de trajectoires simplement retargetées. Le taux de succès zero-shot de 89,3% en conditions réelles, même mesuré sur un nombre restreint d'objets et en cadre contrôlé, constitue une preuve empirique que le transfert sim-to-real pour la manipulation dextre à partir de données humaines peut fonctionner sans passer par un réentraînement lourd sur le robot cible. C'est un signal utile pour les équipes de recherche et intégrateurs travaillant sur des politiques visuomotrices dextres, un domaine où l'écart entre démonstrations vidéo soignées et robustesse réelle reste souvent le point faible des annonces du secteur.

Il s'agit d'une contribution académique en preprint, non d'un produit commercial ni d'un déploiement industriel : les résultats viennent d'essais de laboratoire, pas d'un site client. La démarche s'inscrit dans la recherche sur l'apprentissage par imitation à partir de vidéos d'interactions humaines pour la manipulation dextre, où le sim-to-real reste l'obstacle technique principal identifié par la communauté. Les auteurs comparent leur méthode à cinq approches de référence existantes pour le retargeting de mouvement, situant la contribution dans un champ de recherche actif. La suite logique, non détaillée dans le résumé, serait l'extension à davantage d'objets et de morphologies de mains, ainsi que des tâches de manipulation plus complexes ; la page projet (morphometricimitation.github.io) sert de référence pour le code et les démonstrations vidéo.

Dans nos dossiers

À lire aussi

Où toucher, comment entrer en contact : un cadre hiérarchique RL-MPC pour une manipulation sim-vers-réel sensible à la géométrie
1arXiv cs.RO 

Où toucher, comment entrer en contact : un cadre hiérarchique RL-MPC pour une manipulation sim-vers-réel sensible à la géométrie

Une équipe de recherche propose une architecture hiérarchique combinant apprentissage par renforcement (RL) et commande prédictive (MPC) pour la manipulation dextre en contact riche, détaillée dans un article arXiv (2601.10930, quatrième révision). Le système sépare la décision en deux niveaux: une politique RL de haut niveau détermine "où toucher", c'est à dire un point de contact sur la surface de l'objet ainsi qu'une pose cible à atteindre après ce contact, un concept que les auteurs nomment "intention de contact". Un contrôleur MPC de bas niveau, dit à contact implicite, prend ensuite le relais pour optimiser en temps réel les modes de contact locaux et replanifier la trajectoire du robot à travers la dynamique de contact, non lissée par nature. Le framework a été testé sur des tâches de manipulation non préhensile: poussée généralisée sur des objets de formes variées, réorientation par pivotement ou basculement, et repositionnement assisté par l'environnement. Les résultats annoncés montrent un taux de réussite élevé, un transfert simulation vers réel sans réentraînement (zero shot), et surtout un besoin en données dix fois inférieur à celui des politiques de bout en bout classiques. Cette approche s'attaque directement à l'un des points faibles des politiques end to end actuelles, y compris les modèles vision langage action de type VLA: leur appétit en données et leur difficulté à transférer proprement de la simulation vers le réel. En réintroduisant une décomposition géométrique explicite plutôt que de tout confier à un réseau appris de bout en bout, les auteurs cherchent à concilier la généralisation apprise par renforcement avec la robustesse physique garantie par la commande prédictive. Pour les équipes travaillant sur la manipulation robotique, la promesse d'un facteur dix sur les données nécessaires est significative si elle se confirme au delà des tâches non préhensiles testées ici. Le travail s'inscrit dans un courant de recherche plus large sur la manipulation en contact riche, domaine où la difficulté vient précisément de devoir raisonner conjointement sur la géométrie globale des objets et sur une dynamique de contact non lisse, difficile à différentier et à planifier. Contrairement aux approches purement data driven qui dominent la littérature récente, ce travail mise sur une structure hybride inspirée de la robotique classique. L'article, republié dans sa quatrième version, ne précise pas de calendrier de déploiement matériel à plus grande échelle ni de partenariat industriel.

RecherchePaper
1 source
ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
2arXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques. Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final. Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

RecherchePaper
1 source
Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte
3arXiv cs.RO 

Le contexte peut-il combler l'écart de réalité ? Transfert simulation-réel des politiques sensibles au contexte

Le sim-to-real transfer, c'est-à-dire le passage d'une politique de contrôle entraînée en simulation vers un robot réel, reste l'un des obstacles majeurs de l'apprentissage par renforcement (RL) en robotique. Une équipe de recherche propose dans cet article (arXiv:2511.04249, version révisée) d'intégrer un module d'estimation du contexte, c'est-à-dire une estimation des paramètres dynamiques de l'environnement, directement dans le pipeline d'entraînement basé sur la Domain Randomization (DR). Les chercheurs comparent plusieurs stratégies de supervision de cet estimateur de contexte, considérées comme état de l'art, et évaluent les politiques résultantes sur deux terrains : un benchmark de contrôle standard en simulation, et une tâche réelle de poussée d'objet (pushing) exécutée avec un bras robotique Franka Emika Panda. L'enjeu dépasse la seule prouesse technique : la Domain Randomization, qui consiste à exposer la politique à une large gamme de dynamiques aléatoires pendant l'entraînement pour la rendre robuste, améliore le transfert vers le réel mais dégrade souvent les performances, car la politique doit rester valable pour tous les cas randomisés plutôt que de s'optimiser pour un seul. En conditionnant la politique sur une estimation du contexte plutôt qu'en l'entraînant à l'ignorer, les auteurs cherchent à réconcilier robustesse et performance, un compromis central pour quiconque déploie du RL sur du matériel réel en usine ou en logistique. Les résultats montrent que les politiques context-aware surpassent systématiquement la baseline context-agnostic sur tous les scénarios testés, ce qui confirme l'intérêt de cette approche, mais sans stratégie de supervision universelle : le choix optimal dépend de la tâche. Ce travail s'inscrit dans une lignée de recherches visant à combler l'écart de réalité (reality gap) qui limite le RL appliqué à la robotique depuis plusieurs années, la DR classique restant la référence malgré ses limites connues. En publiant une version révisée sur arXiv, les auteurs affinent une méthode déjà proposée plutôt que d'annoncer un nouveau système. La validation reste à ce stade circonscrite à une tâche de manipulation simple sur un seul bras robotique commercial ; l'étape suivante consisterait à tester la généralisation de cette approche sur des tâches plus complexes et des plateformes variées avant d'envisager une adoption industrielle.

RecherchePaper
1 source
ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main
4arXiv cs.RO 

ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main

Une équipe de recherche présente ObjRetarget, un nouveau framework de retargeting de mouvement humain vers robot destiné à l'apprentissage de la manipulation dextre à partir de vidéos humaines, décrit dans un article publié sur arXiv (2607.03828v1). Le problème visé est classique en intelligence incarnée : transférer fidèlement l'intention humaine observée dans une vidéo vers des actions robotiques exécutables, tout en conservant un contact main-objet stable pendant la manipulation. La méthode combine deux briques. Pour le bras, des trajectoires de référence extraites des vidéos humaines servent de point de départ, affinées par des contraintes anthropomorphiques et une optimisation tenant compte de la redondance cinématique, afin de produire des mouvements naturels et précis. Pour la main, ObjRetarget modélise les contacts multi-doigts via des clusters polyédriques (polytopes) et préserve la structure de contact grâce à des invariants géométriques, ce qui améliore la stabilité du geste. Les tests sur robots réels montrent une amélioration des taux de réussite de manipulation et de la stabilité de contact sur plusieurs tâches dextres, avec une bonne généralisation à de nouvelles démonstrations, poses d'objets et configurations de tâche. Ce travail s'inscrit dans un enjeu central pour l'industrie robotique actuelle : faire fonctionner l'apprentissage par imitation à partir de vidéos humaines à grande échelle, un des piliers annoncés des modèles VLA (vision-language-action) comme GR00T N2, Pi-0 ou Helix. Le point faible historique de ces approches est justement le retargeting, l'étape où l'intention humaine capturée en vidéo doit être traduite en gestes robotiques exploitables sans perdre la qualité du contact physique. En modélisant explicitement le contact plutôt qu'en s'en remettant au reinforcement learning, souvent gourmand en données et peu généralisable, ObjRetarget répond à une limite concrète freinant le passage de la démonstration vidéo à une manipulation dextre fiable en conditions réelles, un enjeu direct pour les intégrateurs travaillant sur des mains robotiques multi-doigts. Le papier se positionne en creux face aux méthodes existantes de retargeting, jugées insuffisantes faute de modélisation de contact explicite. Il s'agit ici d'une contribution de recherche publiée sur arXiv, validée expérimentalement sur robots réels mais sans déploiement industriel ni partenaire commercial annoncé à ce stade, les suites logiques étant une intégration possible dans des pipelines d'apprentissage de politiques robotiques plus larges.

RecherchePaper
1 source