Aller au contenu principal
RecherchearXiv cs.RO 

OTRetarget : retargeting conjoint du mouvement du robot et de l'objet par transport optimal

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.36602) OTRetarget, une méthode qui transfère des démonstrations humaines vers un humanoïde en retargetant conjointement le mouvement du robot et celui des objets manipulés. Elle représente les interactions de surface par trois quantités : distances signées, points les plus proches sur la surface et directions relatives. Un transport optimal entropique projette ces grandeurs entre les géométries de l'humain, du robot et des objets. Les cibles obtenues alimentent une cinématique inverse sous contraintes, qui arbitre à chaque frame entre préservation des contacts et style du mouvement, en optimisant simultanément les poses du robot et des objets. Sur le jeu de données OMOMO, les auteurs annoncent un score de Jaccard d'interaction robot-objet de 87 % et une erreur de profondeur de 8,7 mm, contre 28 % et 29,3 mm pour OmniRetarget. La validation physique porte sur un humanoïde Unitree G1, avec des politiques corps entier entraînées par apprentissage par renforcement sur les références retargetées. Les mouvements testés incluent la dépose à deux mains d'une boîte sur une table.

Le retargeting est un goulot d'étranglement peu visible de la chaîne qui va de la capture humaine aux politiques de loco-manipulation. Quand les proportions du robot diffèrent de celles de l'opérateur, les contacts avec le sol et les objets dérivent, et les politiques apprennent alors sur des références physiquement incohérentes. La plupart des approches figent la trajectoire de l'objet ou remettent à l'échelle la scène et la démonstration. OTRetarget laisse l'objet libre de s'adapter à la morphologie du robot, sans changer l'échelle de la scène. Le gain annoncé face à OmniRetarget est important, mais il vient d'un benchmark sur données de capture, avec une métrique de contact définie par les auteurs. Il ne dit pas encore quel taux de réussite on obtiendrait sur des tâches longues ou contraintes en cadence. La démonstration matérielle se limite à un G1 de petite taille et à des tâches simples. Aucun temps de cycle, aucune charge utile ni aucun taux d'échec n'est mentionné dans le résumé.

Ces travaux s'inscrivent dans la vague de pipelines « humain vers humanoïde » qui cherchent à produire des données d'entraînement à grande échelle sans téléopération coûteuse. OmniRetarget en est la référence directe, et OTRetarget se positionne explicitement contre lui. Le G1 est devenu la plateforme de recherche par défaut, car elle est abordable et largement répandue dans les laboratoires. Les VLA généralistes comme Pi-0, GR00T N2 ou Helix ont besoin de données cohérentes en contacts, ce qui donne à cette brique un intérêt direct. Les prochaines étapes à surveiller sont la diffusion du code, la validation sur des humanoïdes plus grands et sur des objets déformables ou articulés, ainsi qu'une évaluation sur des scènes multi-objets plus encombrées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Robot IA : le shooting par contact retargete le mouvement dynamique sans lissage discontinu
1arXiv cs.RO 

Robot IA : le shooting par contact retargete le mouvement dynamique sans lissage discontinu

Publié sur arXiv le 5 août 2026 (référence 2608.03116), un article de recherche présente DSMS (Direct Simulation-based Multiple Shooting), une méthode qui corrige un défaut courant du retargeting de mouvement pour humanoïdes. Les techniques actuelles privilégient la ressemblance cinématique avec le mouvement humain source, au détriment de la dynamique corps entier et de la cohérence des contacts, produisant des références difficiles à reproduire en apprentissage par renforcement, surtout pour des comportements riches en contacts. DSMS intègre un simulateur différentiable dans un programme d'optimisation non linéaire, résolvant en interne contacts, friction, impacts, auto-collisions et limites articulaires, sans calendrier de contact imposé. Les auteurs démontrent un transfert sim-to-real zero-shot sur le Unitree G1 : un rampement pilotable riche en contacts et un saut-pivot dynamique à 180 degrés. Ce travail cible un point de friction central pour l'industrie humanoïde : l'écart entre démonstrations simulées et comportements fiables sur robot réel, frein majeur à une commercialisation crédible au-delà des vidéos promotionnelles. Les pipelines de motion imitation actuels, qu'ils reposent sur du RL ou des architectures VLA, héritent souvent de références physiquement irréalistes, ce qui allonge l'entraînement et fragilise les politiques face aux contacts imprévus. En rendant les références dynamiquement cohérentes en amont, DSMS accélérerait l'entraînement et améliorerait le taux de succès et la précision de suivi par rapport aux méthodes existantes, selon les auteurs. Le résumé ne fournit toutefois aucun chiffre comparatif précis, ce qui invite à la prudence sur l'ampleur réelle du gain avant validation indépendante. La publication s'inscrit dans l'effort de recherche intense sur le sim-to-real pour humanoïdes, qui mobilise aussi bien des laboratoires académiques que Nvidia avec GR00T, Figure avec Helix, ou les équipes internes d'Unitree et de Boston Dynamics. Le G1, plateforme largement utilisée en recherche pour son coût relativement accessible et ses capacités dynamiques, sert de banc d'essai standard pour ce type de démonstration. Publié en preprint, non encore validé par revue par les pairs, l'article ne mentionne ni partenariat industriel ni feuille de route commerciale : il s'agit d'une contribution méthodologique destinée à la communauté du contrôle robotique et du RL, dont l'impact réel dépendra de sa reproductibilité par d'autres équipes.

RecherchePaper
1 source
2arXiv cs.RO 

Retargeting de mouvement du haut du corps, de l'humain au robot, préservant la géométrie à partir d'une vidéo monoculaire

Des chercheurs proposent un cadre de retargeting de mouvement qui convertit une simple vidéo RVB monoculaire en mouvements coordonnés du haut du corps pour un robot dual-bras à main dextre. Le système repose sur une reconstruction unifiée corps-mains : les estimations image par image du corps, les observations à l'échelle de la vidéo et les détails des mains contraignent ensemble un unique état du Momentum Human Rig (MHR), un modèle corporel différentiable. Les artefacts transitoires sur les mains sont corrigés directement dans l'espace des paramètres. Le mouvement est ensuite décrit par des grandeurs géométriques (directions des segments du bras, configuration du coude, orientation relative des paumes, relations bilatérales des poignets), puis exécuté par une cinématique inverse en plusieurs étapes et une adaptation propre à la main du robot. Au sein d'un système plus large, Across-VAM gère la génération vidéo et Across-WAM la mise en correspondance humain-robot. L'évaluation porte sur 16 vidéos (1 769 images source), dont 10 séquences de langue des signes et 6 de saisie. L'erreur moyenne de reprojection des mains passe de 22,36 à 7,21 pixels par rapport à SAM 3D Body. Les 16 trajectoires ont été rejouées en simulation cinématique, et deux mouvements représentatifs (signes, saisie) ont été démontrés sur un robot réel. Pour l'industrie, l'intérêt tient à la source de données. La vidéo monoculaire est la matière première la moins chère pour l'apprentissage par démonstration, bien moins coûteuse que la téléopération ou les gants de capture. Mais le transfert vers un robot bute sur un problème concret : corps et mains sont reconstruits à des échelles différentes, les cinématiques divergent et les mouvements distaux fins se perdent. Une réduction de l'erreur de reprojection de plus des deux tiers sur les mains est significative pour la dextérité, là où les pipelines existants dégradent le plus. Des réserves s'imposent toutefois. L'échantillon est très réduit (16 vidéos), le succès en simulation ne mesure que la faisabilité cinématique, sans dynamique ni contact, et la validation physique se limite à deux démonstrations qualitatives, sans taux de réussite chiffré. Le gain est mesuré contre un seul point de comparaison, et le cas de la langue des signes, bien que parlant, reste éloigné de la manipulation industrielle. Ce travail s'inscrit dans la course à la donnée pour les modèles de politique robotique. Les acteurs comme Figure, Tesla (Optimus) ou Physical Intelligence cherchent à exploiter des vidéos humaines à grande échelle pour nourrir leurs VLA, et la qualité du retargeting devient un goulot d'étranglement. La séparation entre génération vidéo (Across-VAM) et mapping humain-robot (Across-WAM) suggère une architecture modulaire pensée pour relier des modèles génératifs à l'exécution. Les prochaines étapes à surveiller sont une évaluation sur davantage de séquences, des taux de succès en manipulation réelle avec contacts, et une intégration avec des politiques apprises. Le papier est un preprint sur arXiv, non évalué par les pairs, et aucun calendrier de déploiement n'est annoncé.

RecherchePaper
1 source
Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde
3arXiv cs.RO 

Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde

Une équipe de chercheurs a publié NMR (Neural Motion Retargeting), un framework d'apprentissage automatique conçu pour résoudre l'un des verrous fondamentaux de la robotique humanoïde : transférer des mouvements humains bruts vers un robot physique sans générer d'artefacts cinématiques. Testé sur le Unitree G1, un humanoïde à 23 degrés de liberté commercialisé autour de 16 000 dollars, NMR démontre sa capacité sur des tâches dynamiquement exigeantes comme les arts martiaux et la danse. Les résultats publiés montrent une élimination quasi-totale des "joint jumps" (discontinuités articulaires) et une réduction significative des auto-collisions par rapport aux méthodes de référence actuelles, tout en accélérant la convergence des politiques de contrôle en aval. Le problème que NMR adresse est structurel. Les approches traditionnelles par optimisation géométrique sont non-convexes et convergent systématiquement vers des optima locaux, produisant des mouvements physiquement incohérents inutilisables pour l'entraînement de politiques de contrôle. NMR reformule le problème différemment : au lieu de chercher une solution optimale, il apprend la distribution des données de mouvement valides. Le pipeline repose sur CEPR (Clustered-Expert Physics Refinement), qui utilise un VAE pour regrouper les mouvements humains hétérogènes en motifs latents homogènes, puis fait intervenir des experts en reinforcement learning massivement parallèle pour projeter chaque cluster sur le manifold de mouvements réalisables du robot. Ces données haute-fidélité supervisent ensuite un réseau hybride CNN-Transformer non-autoregressif capable de raisonner sur le contexte temporel global, évitant les pièges géométriques locaux. L'implication pour les intégrateurs est directe : un pipeline de retargeting plus robuste signifie moins de curation manuelle des données de démonstration, goulot d'étranglement majeur dans le développement de politiques whole-body. Ce travail s'inscrit dans une compétition intense autour du sim-to-real et du retargeting humain-robot, domaine où s'affrontent des approches comme SMPL-based retargeting, PhysHOI ou encore les pipelines de Berkeley Humanoid. Unitree, fabricant chinois qui positionne le G1 comme plateforme de recherche accessible face aux robots Figure, Agility ou Boston Dynamics, bénéficie directement de ces avancées publiées en open research. La prochaine étape naturelle sera la validation sur des tâches de manipulation en environnement non structuré, où la cohérence whole-body entre locomotion et bras reste le défi non résolu du secteur.

RecherchePaper
1 source
HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier
4arXiv cs.RO 

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier

Des chercheurs présentent HOTICE, un framework d'apprentissage pour robots humanoïdes dédié au transport d'objets en environnement encombré, détaillé dans un preprint publié sur arXiv (2609.25363v1). Le système combine des « champs de potentiel découplés humanoïde-objet », qui calculent simultanément l'évitement de collision pour le corps du robot et pour l'objet porté, et une architecture de renforcement à deux agents séparant le contrôle du haut et du bas du corps tout en gardant une coordination globale via des observations et récompenses partagées. Pour généraliser à des scènes variées, les auteurs distillent plusieurs politiques enseignantes « privilégiées » en une seule politique étudiante déployable. HOTICE a été testé en simulation MuJoCo puis sur un robot Unitree G1 réel, transportant des objets de formes différentes à travers des obstacles ; le papier ne cite toutefois aucun chiffre de taux de réussite, de charge utile ou de temps de cycle, se limitant à des qualificatifs comme « efficace » et « robuste ». Le transport d'objets en espace contraint reste une capacité rare dans les démonstrations humanoïdes actuelles, la plupart des systèmes commerciaux comme Figure 03 ou Optimus Gen 3 étant montrés en environnement dégagé. En traitant simultanément l'évitement de collision du robot et de sa charge, HOTICE cible un problème concret pour les intégrateurs logistiques confrontés à des couloirs d'entrepôt ou des ateliers exigus. L'approche illustre aussi une alternative aux modèles vision-langage-action monolithiques comme Pi-0 ou GR00T N2 : découper la loco-manipulation en agents spécialisés coordonnés réduit l'espace d'action à apprendre et facilite, selon les auteurs, le transfert de la simulation vers un robot réel. HOTICE demeure un résultat de recherche en preprint, sans affiliation institutionnelle précisée ni partenariat industriel ou pilote commercial annoncé. Il s'inscrit dans une recherche active sur la loco-manipulation humanoïde, où plusieurs équipes explorent des architectures multi-agents pour coordonner bras et jambes, aux côtés de modèles généralistes comme Helix chez Figure AI ou GR00T N2 chez NVIDIA. Le choix du Unitree G1, plateforme chinoise largement adoptée par les laboratoires académiques pour son coût abordable, confirme son rôle de banc d'essai de référence pour ce type de travaux. Aucun calendrier de transfert vers un produit n'est mentionné ; les auteurs annoncent seulement la validation technique de leur méthode.

RecherchePaper
1 source