Retargeting de mouvement du haut du corps, de l'humain au robot, préservant la géométrie à partir d'une vidéo monoculaire
Des chercheurs proposent un cadre de retargeting de mouvement qui convertit une simple vidéo RVB monoculaire en mouvements coordonnés du haut du corps pour un robot dual-bras à main dextre. Le système repose sur une reconstruction unifiée corps-mains : les estimations image par image du corps, les observations à l'échelle de la vidéo et les détails des mains contraignent ensemble un unique état du Momentum Human Rig (MHR), un modèle corporel différentiable. Les artefacts transitoires sur les mains sont corrigés directement dans l'espace des paramètres. Le mouvement est ensuite décrit par des grandeurs géométriques (directions des segments du bras, configuration du coude, orientation relative des paumes, relations bilatérales des poignets), puis exécuté par une cinématique inverse en plusieurs étapes et une adaptation propre à la main du robot. Au sein d'un système plus large, Across-VAM gère la génération vidéo et Across-WAM la mise en correspondance humain-robot. L'évaluation porte sur 16 vidéos (1 769 images source), dont 10 séquences de langue des signes et 6 de saisie. L'erreur moyenne de reprojection des mains passe de 22,36 à 7,21 pixels par rapport à SAM 3D Body. Les 16 trajectoires ont été rejouées en simulation cinématique, et deux mouvements représentatifs (signes, saisie) ont été démontrés sur un robot réel.
Pour l'industrie, l'intérêt tient à la source de données. La vidéo monoculaire est la matière première la moins chère pour l'apprentissage par démonstration, bien moins coûteuse que la téléopération ou les gants de capture. Mais le transfert vers un robot bute sur un problème concret : corps et mains sont reconstruits à des échelles différentes, les cinématiques divergent et les mouvements distaux fins se perdent. Une réduction de l'erreur de reprojection de plus des deux tiers sur les mains est significative pour la dextérité, là où les pipelines existants dégradent le plus. Des réserves s'imposent toutefois. L'échantillon est très réduit (16 vidéos), le succès en simulation ne mesure que la faisabilité cinématique, sans dynamique ni contact, et la validation physique se limite à deux démonstrations qualitatives, sans taux de réussite chiffré. Le gain est mesuré contre un seul point de comparaison, et le cas de la langue des signes, bien que parlant, reste éloigné de la manipulation industrielle.
Ce travail s'inscrit dans la course à la donnée pour les modèles de politique robotique. Les acteurs comme Figure, Tesla (Optimus) ou Physical Intelligence cherchent à exploiter des vidéos humaines à grande échelle pour nourrir leurs VLA, et la qualité du retargeting devient un goulot d'étranglement. La séparation entre génération vidéo (Across-VAM) et mapping humain-robot (Across-WAM) suggère une architecture modulaire pensée pour relier des modèles génératifs à l'exécution. Les prochaines étapes à surveiller sont une évaluation sur davantage de séquences, des taux de succès en manipulation réelle avec contacts, et une intégration avec des politiques apprises. Le papier est un preprint sur arXiv, non évalué par les pairs, et aucun calendrier de déploiement n'est annoncé.
Dans nos dossiers



