Aller au contenu principal
RecherchearXiv cs.RO 

Retargeting de mouvement du haut du corps, de l'humain au robot, préservant la géométrie à partir d'une vidéo monoculaire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un cadre de retargeting de mouvement qui convertit une simple vidéo RVB monoculaire en mouvements coordonnés du haut du corps pour un robot dual-bras à main dextre. Le système repose sur une reconstruction unifiée corps-mains : les estimations image par image du corps, les observations à l'échelle de la vidéo et les détails des mains contraignent ensemble un unique état du Momentum Human Rig (MHR), un modèle corporel différentiable. Les artefacts transitoires sur les mains sont corrigés directement dans l'espace des paramètres. Le mouvement est ensuite décrit par des grandeurs géométriques (directions des segments du bras, configuration du coude, orientation relative des paumes, relations bilatérales des poignets), puis exécuté par une cinématique inverse en plusieurs étapes et une adaptation propre à la main du robot. Au sein d'un système plus large, Across-VAM gère la génération vidéo et Across-WAM la mise en correspondance humain-robot. L'évaluation porte sur 16 vidéos (1 769 images source), dont 10 séquences de langue des signes et 6 de saisie. L'erreur moyenne de reprojection des mains passe de 22,36 à 7,21 pixels par rapport à SAM 3D Body. Les 16 trajectoires ont été rejouées en simulation cinématique, et deux mouvements représentatifs (signes, saisie) ont été démontrés sur un robot réel.

Pour l'industrie, l'intérêt tient à la source de données. La vidéo monoculaire est la matière première la moins chère pour l'apprentissage par démonstration, bien moins coûteuse que la téléopération ou les gants de capture. Mais le transfert vers un robot bute sur un problème concret : corps et mains sont reconstruits à des échelles différentes, les cinématiques divergent et les mouvements distaux fins se perdent. Une réduction de l'erreur de reprojection de plus des deux tiers sur les mains est significative pour la dextérité, là où les pipelines existants dégradent le plus. Des réserves s'imposent toutefois. L'échantillon est très réduit (16 vidéos), le succès en simulation ne mesure que la faisabilité cinématique, sans dynamique ni contact, et la validation physique se limite à deux démonstrations qualitatives, sans taux de réussite chiffré. Le gain est mesuré contre un seul point de comparaison, et le cas de la langue des signes, bien que parlant, reste éloigné de la manipulation industrielle.

Ce travail s'inscrit dans la course à la donnée pour les modèles de politique robotique. Les acteurs comme Figure, Tesla (Optimus) ou Physical Intelligence cherchent à exploiter des vidéos humaines à grande échelle pour nourrir leurs VLA, et la qualité du retargeting devient un goulot d'étranglement. La séparation entre génération vidéo (Across-VAM) et mapping humain-robot (Across-WAM) suggère une architecture modulaire pensée pour relier des modèles génératifs à l'exécution. Les prochaines étapes à surveiller sont une évaluation sur davantage de séquences, des taux de succès en manipulation réelle avec contacts, et une intégration avec des politiques apprises. Le papier est un preprint sur arXiv, non évalué par les pairs, et aucun calendrier de déploiement n'est annoncé.

À lire aussi

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire
1arXiv cs.RO 

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire

Une équipe de recherche propose BeyondRetarget, un framework qui apprend des mouvements exécutables pour robots humanoïdes directement à partir de vidéos RGB monoculaires, sans passer par l'étape classique de reconstruction explicite du mouvement humain puis de retargeting vers le squelette du robot. Décrit dans un preprint arXiv publié fin septembre 2026, le système apprend une représentation implicite orientée robot directement depuis les images, complétée par un mécanisme d'optimisation de mouvement dit "contact-aware" censé améliorer la cohérence temporelle et la plausibilité physique des trajectoires générées. Les auteurs rapportent des gains en précision, en robustesse et en taux de réussite d'exécution, ainsi qu'une latence réduite, à la fois en simulation et sur des robots humanoïdes réels. L'abstract ne fournit toutefois aucun chiffre précis (pas de taux de succès, de latence en millisecondes, ni de payload ou DOF du robot testé), ce qui limite pour l'instant l'évaluation indépendante de l'ampleur réelle des gains annoncés. L'enjeu dépasse le simple gain de performance technique. Les pipelines actuels d'apprentissage par démonstration à partir de vidéos humaines butent sur un problème structurel: les différences de morphologie et de degrés de liberté entre humain et robot rendent les mouvements retargetés difficiles à exécuter, et les erreurs d'estimation de pose humaine se propagent sans pouvoir être corrigées a posteriori par optimisation conjointe. En supprimant cette étape intermédiaire, BeyondRetarget s'attaque directement à un goulot d'étranglement identifié par une large partie du secteur: la capacité à exploiter le volume massif de vidéos humaines disponibles (tutoriels, contenus web) pour entraîner des humanoïdes sans dépendre uniquement de téléopération coûteuse ou de données de mouvement capturées en laboratoire. Si les résultats se confirment à plus grande échelle, cela renforcerait la piste "apprentissage par imitation vidéo" comme alternative ou complément aux approches VLA entraînées sur données robot réelles. Le travail se positionne dans la lignée des méthodes de retargeting de mouvement humain vers robot, dominantes dans la littérature récente sur l'apprentissage de démonstrations pour humanoïdes, mais s'en distingue en éliminant la représentation humaine intermédiaire. Il s'agit d'un résultat de recherche publié en preprint, non encore validé par relecture par les pairs ni associé à un déploiement industriel ou à un partenaire robotique identifié dans l'abstract, ce qui en fait pour l'instant une contribution méthodologique à suivre plutôt qu'une solution prête à l'emploi.

RecherchePaper
1 source
C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire
2arXiv cs.RO 

C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire

Des chercheurs publient sur arXiv (arXiv:2608.07045v1) un article intitulé C2Dex, un framework qui transfère des démonstrations de manipulation extraites de simples vidéos monoculaires de mains humaines vers des robots à mains dextres. Le système repose sur une représentation partagée de contacts stables côté objet, reconstruits en agrégeant des observations bruitées image par image dans un espace canonique de l'objet. Ces contacts servent à la fois de contraintes de trajectoire pour stabiliser la reconstruction 3D de l'interaction main-objet humaine, et de cibles explicites pour le transfert vers la main robotique, via une optimisation laplacienne de l'interaction qui préserve la géométrie locale du contact malgré le changement de morphologie, puis un raffinement par apprentissage par renforcement résiduel en simulation. Sur les benchmarks DexYCB et TACO, C2Dex atteint des taux de réussite de trajectoire de bout en bout de 57,78% et 26,67% respectivement, contre 17,78% et 10% pour les meilleures méthodes de référence testées dans les mêmes conditions. Des essais de rejeu sur robot réel confirment la faisabilité physique des trajectoires générées sur des tâches de manipulation riches en contacts. Cette avancée s'attaque à un goulot d'étranglement central de la manipulation dextre : la collecte de démonstrations de qualité via téléopération ou capture de mouvement reste coûteuse et lente, alors que les vidéos humaines existent en abondance et à bas coût. Réussir à extraire de ces vidéos des trajectoires physiquement plausibles et transférables à des mains robotiques de morphologies différentes est jugé nécessaire pour entraîner à grande échelle des politiques de manipulation, dans la même logique que les modèles vision-langage-action utilisés par l'industrie humanoïde. Le gain observé face aux méthodes concurrentes, avec des taux de réussite multipliés par trois sur les deux jeux de données, suggère que l'instabilité des contacts reconstruits depuis la vidéo, jusqu'ici un frein majeur, peut être significativement atténuée. Les taux de réussite absolus restent toutefois modestes, en particulier sur TACO (26,67%), ce qui signale que le transfert vidéo vers robot dextre reste loin d'être résolu pour des tâches complexes. C2Dex s'inscrit dans un axe de recherche actif visant à exploiter les vidéos humaines comme source de données pour l'apprentissage par imitation en robotique, en complément ou substitut des démonstrations téléopérées. L'article, classé comme nouvelle soumission sur arXiv, n'a pas encore fait l'objet d'une publication évaluée par les pairs et ne décrit ni déploiement industriel ni intégration produit : il s'agit d'un travail de recherche comparé à des méthodes existantes de reconstruction d'interaction main-objet et de retargeting, jugées moins performantes dans les mêmes conditions d'évaluation. Une page projet dédiée met à disposition davantage de détails techniques et, potentiellement, des démonstrations vidéo. Les auteurs ne précisent pas de calendrier de suite des travaux, mais la démonstration sur robot réel laisse entrevoir une prochaine étape naturelle vers des évaluations en conditions moins contrôlées et sur un éventail plus large de tâches et de morphologies de mains robotiques.

RecherchePaper
1 source
OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue
3arXiv cs.RO 

OC-VLA++ : cohérence multi-vue guidée par géométrie monoculaire pour une manipulation robotique robuste au point de vue

Le laboratoire à l'origine d'OC-VLA publie une extension baptisée OC-VLA++, qui vise à corriger un angle mort connu des modèles vision-langage-action (VLA) pour la manipulation robotique : la généralisation à des points de vue caméra non vus pendant l'entraînement. La méthode originale, OC-VLA, ancrait déjà les prédictions d'action dans le repère de la caméra plutôt que dans le repère robot, pour aligner la supervision avec l'observation visuelle. Mais les auteurs montrent que cet ancrage seul reste sujet au surapprentissage lorsque peu de points de vue sont couverts à l'entraînement. OC-VLA++ ajoute deux mécanismes : une supervision par paires de vues guidée par la géométrie, et un objectif explicite d'équivariance d'action inter-vues. Concrètement, le modèle reçoit des paires d'observations d'une même scène de manipulation, prises sous des angles géométriquement reliés, et apprend à produire des prédictions dans l'espace caméra qui correspondent à la même action une fois ramenées au repère du robot. Le papier, publié en preprint sur arXiv (2608.01066v1), rapporte des gains « substantiels » en généralisation à des vues inédites sous couverture caméra limitée, avec une dégradation plus progressive à mesure que le déplacement de caméra augmente, sans toutefois fournir de chiffres précis de taux de réussite dans le résumé, ce qui invite à rester prudent avant validation indépendante. Pour les intégrateurs et les équipes robotique, le sujet touche à un problème très concret : la plupart des déploiements industriels utilisent un nombre restreint de caméras fixes, et un modèle VLA entraîné sur ces angles précis échoue souvent dès qu'une caméra est repositionnée, remplacée ou que la cellule de travail change de configuration. Si l'équivariance d'action inter-vues tient ses promesses au-delà du cadre expérimental du papier, elle pourrait réduire le besoin de collecter des données massives multi-caméras pour chaque nouvelle installation, un poste de coût important dans le déploiement des VLA à grande échelle. Cela s'inscrit dans un débat plus large du secteur sur l'écart entre démonstrations en laboratoire et robustesse réelle : beaucoup de modèles VLA impressionnent sur les vues d'entraînement mais généralisent mal dès que l'environnement visuel bouge, un des obstacles cités au passage à l'échelle des humanoïdes et bras manipulateurs. Le travail se situe dans la lignée directe d'OC-VLA, dont il corrige une limite identifiée par ses propres auteurs plutôt que de proposer une architecture radicalement nouvelle. Le papier ne mentionne pas de comparaison directe avec les autres familles de VLA du moment comme Pi-0, GR00T N2 ou Helix, et ne précise pas si les expériences ont été menées en simulation, sur robot réel, ou les deux, une information qu'on aimerait voir clarifiée avant de juger de la portée réelle des résultats. Les auteurs présentent ces résultats comme un argument en faveur de l'équivariance d'action inter-vues comme complément à l'ancrage centré sur l'observation, en vue d'un déploiement robuste en conditions réelles, mais aucun calendrier de test terrain ni partenariat industriel n'est annoncé à ce stade. Le texte reste, pour l'instant, une contribution de recherche publiée en preprint, sans revue par les pairs ni suite commerciale connue.

RechercheActu
1 source
4arXiv cs.RO 

OTRetarget : retargeting conjoint du mouvement du robot et de l'objet par transport optimal

Des chercheurs publient sur arXiv (2609.36602) OTRetarget, une méthode qui transfère des démonstrations humaines vers un humanoïde en retargetant conjointement le mouvement du robot et celui des objets manipulés. Elle représente les interactions de surface par trois quantités : distances signées, points les plus proches sur la surface et directions relatives. Un transport optimal entropique projette ces grandeurs entre les géométries de l'humain, du robot et des objets. Les cibles obtenues alimentent une cinématique inverse sous contraintes, qui arbitre à chaque frame entre préservation des contacts et style du mouvement, en optimisant simultanément les poses du robot et des objets. Sur le jeu de données OMOMO, les auteurs annoncent un score de Jaccard d'interaction robot-objet de 87 % et une erreur de profondeur de 8,7 mm, contre 28 % et 29,3 mm pour OmniRetarget. La validation physique porte sur un humanoïde Unitree G1, avec des politiques corps entier entraînées par apprentissage par renforcement sur les références retargetées. Les mouvements testés incluent la dépose à deux mains d'une boîte sur une table. Le retargeting est un goulot d'étranglement peu visible de la chaîne qui va de la capture humaine aux politiques de loco-manipulation. Quand les proportions du robot diffèrent de celles de l'opérateur, les contacts avec le sol et les objets dérivent, et les politiques apprennent alors sur des références physiquement incohérentes. La plupart des approches figent la trajectoire de l'objet ou remettent à l'échelle la scène et la démonstration. OTRetarget laisse l'objet libre de s'adapter à la morphologie du robot, sans changer l'échelle de la scène. Le gain annoncé face à OmniRetarget est important, mais il vient d'un benchmark sur données de capture, avec une métrique de contact définie par les auteurs. Il ne dit pas encore quel taux de réussite on obtiendrait sur des tâches longues ou contraintes en cadence. La démonstration matérielle se limite à un G1 de petite taille et à des tâches simples. Aucun temps de cycle, aucune charge utile ni aucun taux d'échec n'est mentionné dans le résumé. Ces travaux s'inscrivent dans la vague de pipelines « humain vers humanoïde » qui cherchent à produire des données d'entraînement à grande échelle sans téléopération coûteuse. OmniRetarget en est la référence directe, et OTRetarget se positionne explicitement contre lui. Le G1 est devenu la plateforme de recherche par défaut, car elle est abordable et largement répandue dans les laboratoires. Les VLA généralistes comme Pi-0, GR00T N2 ou Helix ont besoin de données cohérentes en contacts, ce qui donne à cette brique un intérêt direct. Les prochaines étapes à surveiller sont la diffusion du code, la validation sur des humanoïdes plus grands et sur des objets déformables ou articulés, ainsi qu'une évaluation sur des scènes multi-objets plus encombrées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source