Aller au contenu principal
ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main
RecherchearXiv cs.RO 

ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ObjRetarget, un nouveau framework de retargeting de mouvement humain vers robot destiné à l'apprentissage de la manipulation dextre à partir de vidéos humaines, décrit dans un article publié sur arXiv (2607.03828v1). Le problème visé est classique en intelligence incarnée : transférer fidèlement l'intention humaine observée dans une vidéo vers des actions robotiques exécutables, tout en conservant un contact main-objet stable pendant la manipulation. La méthode combine deux briques. Pour le bras, des trajectoires de référence extraites des vidéos humaines servent de point de départ, affinées par des contraintes anthropomorphiques et une optimisation tenant compte de la redondance cinématique, afin de produire des mouvements naturels et précis. Pour la main, ObjRetarget modélise les contacts multi-doigts via des clusters polyédriques (polytopes) et préserve la structure de contact grâce à des invariants géométriques, ce qui améliore la stabilité du geste. Les tests sur robots réels montrent une amélioration des taux de réussite de manipulation et de la stabilité de contact sur plusieurs tâches dextres, avec une bonne généralisation à de nouvelles démonstrations, poses d'objets et configurations de tâche.

Ce travail s'inscrit dans un enjeu central pour l'industrie robotique actuelle : faire fonctionner l'apprentissage par imitation à partir de vidéos humaines à grande échelle, un des piliers annoncés des modèles VLA (vision-language-action) comme GR00T N2, Pi-0 ou Helix. Le point faible historique de ces approches est justement le retargeting, l'étape où l'intention humaine capturée en vidéo doit être traduite en gestes robotiques exploitables sans perdre la qualité du contact physique. En modélisant explicitement le contact plutôt qu'en s'en remettant au reinforcement learning, souvent gourmand en données et peu généralisable, ObjRetarget répond à une limite concrète freinant le passage de la démonstration vidéo à une manipulation dextre fiable en conditions réelles, un enjeu direct pour les intégrateurs travaillant sur des mains robotiques multi-doigts.

Le papier se positionne en creux face aux méthodes existantes de retargeting, jugées insuffisantes faute de modélisation de contact explicite. Il s'agit ici d'une contribution de recherche publiée sur arXiv, validée expérimentalement sur robots réels mais sans déploiement industriel ni partenaire commercial annoncé à ce stade, les suites logiques étant une intégration possible dans des pipelines d'apprentissage de politiques robotiques plus larges.

Dans nos dossiers

À lire aussi

Imitation morphométrique : du retargeting de mains sensible au contact vers une politique visuomotrice simulation-vers-réel
1arXiv cs.RO 

Imitation morphométrique : du retargeting de mains sensible au contact vers une politique visuomotrice simulation-vers-réel

Un papier de recherche publié sur arXiv sous la référence 2609.28660v1 présente "Morphometric Imitation", un framework en trois étapes qui convertit des démonstrations humaines main-objet en politiques robotiques visuomotrices déployables directement en conditions réelles, sans réentraînement supplémentaire (zero-shot sim-to-real). La première étape, l'optimisation morphométrique (MMO), retargete cinématiquement le mouvement humain vers différentes morphologies de mains robotiques tout en préservant les contacts observés. La deuxième étape s'appuie sur de l'apprentissage par renforcement résiduel, nourri par la pose de l'objet et les informations de contact issues du mouvement humain, pour produire des démonstrations robotiques dynamiquement réalisables. La troisième étape distille ces démonstrations en politiques visuomotrices entraînables. Testé sur trois mains robotiques différentes et dix interactions main-objet, MMO améliore le score F1 de contact d'au moins 8 points par rapport au meilleur des cinq méthodes de référence comparées, pour chaque main testée, et augmente jusqu'à 35 points le taux de réussite du retargeting dynamique en aval. Les politiques visuomotrices finales atteignent 89,3% de réussite en zero-shot sur 300 essais réels menés sur 30 objets. Une page projet dédiée accompagne la publication. Ce travail cible un verrou central de la manipulation dextre : exploiter la richesse des démonstrations humaines reconstruites sans être bloqué par l'écart de morphologie entre main humaine et main robotique, ni par l'irréalisme dynamique de trajectoires simplement retargetées. Le taux de succès zero-shot de 89,3% en conditions réelles, même mesuré sur un nombre restreint d'objets et en cadre contrôlé, constitue une preuve empirique que le transfert sim-to-real pour la manipulation dextre à partir de données humaines peut fonctionner sans passer par un réentraînement lourd sur le robot cible. C'est un signal utile pour les équipes de recherche et intégrateurs travaillant sur des politiques visuomotrices dextres, un domaine où l'écart entre démonstrations vidéo soignées et robustesse réelle reste souvent le point faible des annonces du secteur. Il s'agit d'une contribution académique en preprint, non d'un produit commercial ni d'un déploiement industriel : les résultats viennent d'essais de laboratoire, pas d'un site client. La démarche s'inscrit dans la recherche sur l'apprentissage par imitation à partir de vidéos d'interactions humaines pour la manipulation dextre, où le sim-to-real reste l'obstacle technique principal identifié par la communauté. Les auteurs comparent leur méthode à cinq approches de référence existantes pour le retargeting de mouvement, situant la contribution dans un champ de recherche actif. La suite logique, non détaillée dans le résumé, serait l'extension à davantage d'objets et de morphologies de mains, ainsi que des tâches de manipulation plus complexes ; la page projet (morphometricimitation.github.io) sert de référence pour le code et les démonstrations vidéo.

RecherchePaper
1 source
HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets
2arXiv cs.RO 

HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets

Des chercheurs ont publié HiPHI, un jeu de données de mouvement humain corps entier et d'interaction avec des objets, dépassant les 600 heures d'enregistrement, décrit dans un article déposé sur arXiv en août 2026 sous la référence 2608.16222. Construit à partir d'un pipeline de capture de mouvement optique, HiPHI atteint une précision de suivi des marqueurs spatiaux inférieure au millimètre pour le mouvement corps entier, ainsi que des trajectoires d'objets au niveau du maillage (mesh-level). Le dataset s'appuie théoriquement sur FrameNet, un cadre linguistique qui organise les primitives du mouvement humain. Les auteurs publient aussi une suite de benchmarks évaluant quatre axes : la diversité de l'espace des mouvements, l'ancrage des interactions (interaction grounding), la cohérence des objets manipulés, et les applications d'IA physique. Selon les analyses présentées, HiPHI élargit sensiblement la couverture des mouvements par rapport aux jeux de données existants, tout en conservant une fidélité élevée dans la qualité des interactions capturées. Ce travail cible un goulot d'étranglement jugé critique pour l'apprentissage de politiques robotiques humanoïdes à grande échelle : les vidéos issues d'internet, bien qu'abondantes, manquent d'états physiques précis et d'ancrage réel des interactions, tandis que les jeux de données de capture en laboratoire offrent une haute fidélité mais une couverture comportementale trop étroite. Pour les intégrateurs et laboratoires qui entraînent des modèles vision-langage-action à l'image de Pi-0 ou GR00T N2, ce type de fondation de données conditionne directement la capacité à généraliser des politiques apprises vers des tâches réelles incarnées, autrement dit le passage du simulateur au monde physique. Le papier revendique une amélioration mesurable de la diversité de mouvement, mais il s'agit à ce stade d'un benchmark académique évalué par ses propres auteurs, sans déploiement industriel ni adoption confirmée par un fabricant de robots humanoïdes. HiPHI s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les grands corpus vidéo génériques et les datasets de mouvement capturés en studio, un problème documenté depuis plusieurs années dans la littérature sur l'apprentissage par imitation pour humanoïdes. Les auteurs positionnent leur contribution face aux jeux de données de mouvement existants, jugés soit trop limités en diversité soit insuffisamment ancrés physiquement, sans nommer de concurrent unique. Le texte souligne une application transversale au-delà de la robotique : les mêmes extensions de couverture pourraient aussi nourrir des modèles de prior de mouvement en infographie, utilisés notamment pour l'animation de personnages. Publié comme preprint arXiv, HiPHI demeure pour l'instant une ressource de recherche ouverte plutôt qu'un produit commercial ; sa valeur pour l'industrie dépendra de la publication effective du dataset et du code, de comparaisons indépendantes, et d'une éventuelle intégration dans des pipelines d'entraînement de robots humanoïdes commerciaux.

RecherchePaper
1 source
Planification et contrôle de mouvement sensibles au risque sous dynamique inconnue avec observations hybrides
3arXiv cs.RO 

Planification et contrôle de mouvement sensibles au risque sous dynamique inconnue avec observations hybrides

Des chercheurs ont publié sur arXiv (arXiv:2609.23792v1, septembre 2026) un nouveau cadre de planification de mouvement et de commande robotique pour des systèmes à dynamique inconnue et observations d'état hybrides, c'est-à-dire des cas où le robot ne dispose de mesures d'état complètes que dans certaines zones de l'espace d'état, laissant des "régions aveugles" ailleurs. Le travail s'appuie sur un cadre hiérarchique existant qui combine identification de système, calcul d'atteignabilité prédite, recherche de graphe et synthèse de contrôleur, en modélisant la dynamique par des approximations affines locales sur un découpage polytopique de l'espace d'état. Pour traiter les zones aveugles, où l'identification et la rétroaction deviennent impossibles faute de mesures, les auteurs proposent de sélectionner une dynamique nominale et de précalculer une séquence de commande en boucle ouverte avant la perte d'observation. Comme la dynamique réelle peut s'écarter de ce modèle nominal, le robot risque de quitter un polytope aveugle par une facette non prévue ; ce risque de transition est quantifié puis intégré dans un système de transition stochastique, et le problème de planification de haut niveau est reformulé comme un plus court chemin stochastique dont la politique guide la synthèse finale du contrôleur. Une étude de cas illustre la méthode en montrant un robot rejoindre un état cible en arbitrant entre efficacité de trajet et risque de traversée des zones aveugles. L'apport concret vise les robots opérant dans des environnements où la perception est intermittente ou partielle, occlusions, angles morts de capteurs, zones hors portée de caméras ou de lidars, un scénario fréquent en robotique industrielle et de champ mais souvent ignoré par les méthodes de planification qui supposent une observabilité complète de l'état. En quantifiant explicitement le risque associé à la navigation sans retour capteur plutôt qu'en l'ignorant ou en l'interdisant, l'approche s'adresse aux intégrateurs devant certifier ou arbitrer des trajectoires en environnements partiellement instrumentés, un enjeu distinct de la course actuelle aux modèles vision-langage-action (VLA) appris de bout en bout, qui promettent la généralisation mais restent peu auditables sur le plan du risque. Ce travail prolonge une lignée de recherche en planification formelle sous incertitude qui allie identification de système et synthèse de contrôleurs garantis, plutôt que les approches par apprentissage bout en bout actuellement médiatisées en robotique humanoïde. Il reste à ce stade une contribution algorithmique validée par simulation via une étude de cas, sans précision sur une plateforme matérielle réelle ni déploiement en conditions industrielles ; les auteurs ne mentionnent pas d'étape suivante de validation sur robot physique, ce qui invite à considérer ces résultats comme une preuve de concept méthodologique plutôt qu'une solution prête à l'industrialisation.

RecherchePaper
1 source
OTRetarget : retargeting conjoint du mouvement du robot et de l'objet par transport optimal
4arXiv cs.RO 

OTRetarget : retargeting conjoint du mouvement du robot et de l'objet par transport optimal

Des chercheurs publient sur arXiv (2609.36602) OTRetarget, une méthode qui transfère des démonstrations humaines vers un humanoïde en retargetant conjointement le mouvement du robot et celui des objets manipulés. Elle représente les interactions de surface par trois quantités : distances signées, points les plus proches sur la surface et directions relatives. Un transport optimal entropique projette ces grandeurs entre les géométries de l'humain, du robot et des objets. Les cibles obtenues alimentent une cinématique inverse sous contraintes, qui arbitre à chaque frame entre préservation des contacts et style du mouvement, en optimisant simultanément les poses du robot et des objets. Sur le jeu de données OMOMO, les auteurs annoncent un score de Jaccard d'interaction robot-objet de 87 % et une erreur de profondeur de 8,7 mm, contre 28 % et 29,3 mm pour OmniRetarget. La validation physique porte sur un humanoïde Unitree G1, avec des politiques corps entier entraînées par apprentissage par renforcement sur les références retargetées. Les mouvements testés incluent la dépose à deux mains d'une boîte sur une table. Le retargeting est un goulot d'étranglement peu visible de la chaîne qui va de la capture humaine aux politiques de loco-manipulation. Quand les proportions du robot diffèrent de celles de l'opérateur, les contacts avec le sol et les objets dérivent, et les politiques apprennent alors sur des références physiquement incohérentes. La plupart des approches figent la trajectoire de l'objet ou remettent à l'échelle la scène et la démonstration. OTRetarget laisse l'objet libre de s'adapter à la morphologie du robot, sans changer l'échelle de la scène. Le gain annoncé face à OmniRetarget est important, mais il vient d'un benchmark sur données de capture, avec une métrique de contact définie par les auteurs. Il ne dit pas encore quel taux de réussite on obtiendrait sur des tâches longues ou contraintes en cadence. La démonstration matérielle se limite à un G1 de petite taille et à des tâches simples. Aucun temps de cycle, aucune charge utile ni aucun taux d'échec n'est mentionné dans le résumé. Ces travaux s'inscrivent dans la vague de pipelines « humain vers humanoïde » qui cherchent à produire des données d'entraînement à grande échelle sans téléopération coûteuse. OmniRetarget en est la référence directe, et OTRetarget se positionne explicitement contre lui. Le G1 est devenu la plateforme de recherche par défaut, car elle est abordable et largement répandue dans les laboratoires. Les VLA généralistes comme Pi-0, GR00T N2 ou Helix ont besoin de données cohérentes en contacts, ce qui donne à cette brique un intérêt direct. Les prochaines étapes à surveiller sont la diffusion du code, la validation sur des humanoïdes plus grands et sur des objets déformables ou articulés, ainsi qu'une évaluation sur des scènes multi-objets plus encombrées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source