Aller au contenu principal
RecherchearXiv cs.RO 

Au-delà du retargeting : téléopération humanoïde du corps entier, à faible latence et robuste, grâce à des primitives de mouvement atomiques apprises

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une politique de téléopération du corps entier pour humanoïde qui supprime l'étape de retargeting en ligne, jusqu'ici standard dans ce type de système. Détaillée dans un preprint arXiv (2610.07891v1), l'approche mappe le mouvement humain brut directement vers les commandes articulaires du robot, en une seule passe avant du réseau de neurones. Elle a été testée sur un Unitree G1, en simulation puis sur matériel réel, avec quatre sources d'entrée : casque de réalité virtuelle, capture optique de mouvement, génération de mouvement à partir de texte et vidéo monoculaire. Selon les auteurs, la méthode surpasse les approches de référence en latence et en robustesse. L'abstract ne fournit toutefois ni valeur de latence en millisecondes, ni taux de réussite, ni détail sur les baselines retenues.

L'enjeu est double. Le retargeting en ligne, qui adapte la cinématique humaine à la morphologie du robot, ajoute du délai et peut produire des cibles physiquement infaisables, source d'instabilité. Le deuxième problème est la fragilité face aux données hors distribution : les entrées réelles sont bruitées, partielles ou inhabituelles, et les politiques apprises sur des mouvements propres se dégradent alors. Pour y répondre, les auteurs apprennent un codebook de primitives de mouvement du corps entier. Il projette les observations atypiques sur des prototypes de mouvement plausibles et reconstruit un mouvement complet à partir d'entrées incomplètes, par exemple une vidéo qui ne montre qu'une partie du corps. Si les résultats se confirment, cela rapproche la téléopération de la collecte de données à grande échelle, où un opérateur avec un simple casque VR ou une caméra pourrait piloter un humanoïde sans pipeline de calibration lourd. Reste à vérifier la tenue sur des tâches longues, avec contacts et manipulation, qu'un travail de ce type ne démontre pas forcément.

Ce travail s'inscrit dans la lignée des politiques de suivi de mouvement pour humanoïdes entraînées en simulation puis transférées au réel, où le G1 de Unitree est devenu la plateforme académique par défaut grâce à son prix relativement bas. Les systèmes de téléopération du corps entier existants reposent généralement sur une chaîne en deux temps, retargeting puis contrôleur de suivi, que cette étude fusionne en une seule politique. Les travaux concurrents poursuivent des objectifs voisins, notamment les modèles de contrôle généralistes comme GR00T chez NVIDIA, qui visent aussi une interface unifiée pour piloter les humanoïdes. Il s'agit ici d'une publication de recherche, pas d'un produit : aucun déploiement industriel ni calendrier commercial n'est annoncé. La prochaine étape logique serait une validation sur d'autres morphologies que le G1 et sur des tâches de manipulation, ainsi que la publication du code et des mesures de latence détaillées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Coordination corps-main à résidu contrôlé pour la téléopération humanoïde du corps entier
1arXiv cs.RO 

Coordination corps-main à résidu contrôlé pour la téléopération humanoïde du corps entier

Un article publié sur arXiv (2609.18763v1) décrit une méthode pour corriger un défaut connu des systèmes de téléopération de robots humanoïdes à corps entier : la désynchronisation entre le suivi de mouvement du corps et le repositionnement des mains, deux modules aujourd'hui indépendants qui ne préservent pas la géométrie corps-mains, d'où des décalages de pose au poignet et aux doigts lors d'interactions bimanuelles. La méthode, baptisée "gated residual coordination", laisse ces deux modules gelés et leur ajoute des corrections bornées via une porte d'action conditionnée au mouvement, qui répartit l'autorité de correction entre groupes d'articulations, et des portes de récompense liées à la géométrie de référence pendant l'entraînement. Le contrôleur corporel de référence est calibré sur la plateforme humanoïde Agile One par une calibration morphologique multi-pose, puis entraîné avec un tracker basé sur SONIC et un jeu de données de mouvement construit par étapes. En simulation, les erreurs de géométrie poignet-doigts baissent de 39,2 à 56,3% sur des mouvements bimanuels issus du jeu GRAB, tandis que le taux de succès du suivi corporel global sur AMASS passe de 89,03% à 89,29%. Le problème visé est concret pour les intégrateurs de téléopération humanoïde : la cohérence corps-mains conditionne la fiabilité des tâches bimanuelles comme la saisie ou le transfert d'objet entre les mains, un enjeu direct pour la collecte de démonstrations servant à entraîner des modèles vision-language-action et pour le contrôle téléopéré en environnement industriel. L'atout de la méthode tient à sa modularité : elle évite de réentraîner les politiques de suivi corporel ou de retargeting déjà déployées, ce qui limite le coût d'intégration pour des équipes disposant d'une pile de téléopération existante. Le gain de 39 à 56% sur la précision géométrique est net, mais l'amélioration du taux de succès global du suivi corporel reste marginale, et les résultats ne sont pour l'instant validés qu'en simulation, sans démonstration publiée sur robot physique. Ce travail s'inscrit dans la lignée des pipelines de téléopération combinant un tracker de mouvement corporel et un module de retargeting dextre séparé, architecture répandue dans le secteur mais dépourvue jusqu'ici de coordination explicite entre les deux flux de commandes. Les auteurs s'appuient sur les jeux de capture de mouvement AMASS et GRAB, références classiques pour évaluer respectivement le suivi corporel global et l'interaction main-objet. À la différence d'une approche end-to-end entraînée depuis zéro, cette méthode résiduelle vise la compatibilité avec des modules déjà en production, ce qui pourrait faciliter son adoption par des équipes ayant déjà investi dans une pile de téléopération. Les prochaines étapes attendues sont une validation sur robot réel et une extension à des tâches de manipulation plus variées que celles couvertes par GRAB et AMASS.

RecherchePaper
1 source
Des jambes aux roues : retargeting de mouvement humain adapté à l'embodiment pour humanoïdes à base mobile
2arXiv cs.RO 

Des jambes aux roues : retargeting de mouvement humain adapté à l'embodiment pour humanoïdes à base mobile

Des chercheurs publient sur arXiv (2610.08381v1) un cadre de retargeting de mouvement humain conçu pour les humanoïdes à base mobile, c'est-à-dire des robots dotés d'une base à roues, d'un axe de levage vertical et de deux bras, sans jambes. Le système prend en entrée un mouvement humain reconstruit à partir de vidéo et le répartit entre trois responsabilités, la base, le lift et les bras, avant toute adaptation propre à un robot donné. Un module d'allocation conserve le chemin issu de l'humain, stabilise le cap, sépare rotation et translation quand c'est nécessaire, recadre temporellement les commandes pour respecter les limites de la base, puis répare les trajectoires du lift et des bras. Un adaptateur de déploiement convertit ensuite la référence en commandes à 50 Hz, grâce à la détection de base immobile, à un filtrage par zone morte et limitation de pente (slew-rate), à une mise à l'échelle de lecture cohérente dans le temps et à des gains linéaire et angulaire distincts. L'évaluation combine des comparaisons dans l'espace de la tâche par rapport à l'humain, un rejeu en simulation sans politique apprise et une exécution qualitative sur un robot physique. L'abstract ne fournit ni payload, ni DOF, ni taux de réussite chiffré, ni nom de plateforme. L'enjeu est pratique. La vidéo humaine est l'une des rares sources de démonstrations réellement extensibles, mais la plupart des méthodes de retargeting supposent un robot à jambes à cinématique proche de l'humain. Or une grande partie des humanoïdes commercialisés pour la logistique et l'industrie sont des manipulateurs mobiles bimanuels sur roues, plus simples à stabiliser et à déployer que la marche bipède. Pour eux, marcher devient un mouvement de base et se pencher devient une coordination entre lift et bras. Combler ce fossé élargit la quantité de données exploitable par ces plateformes. Il faut toutefois relativiser. L'évaluation reste modeste : une exécution physique seulement qualitative, pas d'entraînement de politique, pas de comparaison chiffrée avec des méthodes concurrentes. Le travail démontre la faisabilité d'une référence cinématique propre, pas encore la rentabilité de cette voie par rapport à la téléopération. Ce travail s'inscrit dans le mouvement qui cherche à apprendre à partir de vidéo humaine, dans le prolongement des méthodes de retargeting conçues pour des humanoïdes bipèdes. La contribution est ici l'adaptation à une morphologie différente, plus proche des architectures hybrides roues et bras que privilégient plusieurs acteurs industriels. La suite logique serait une validation quantitative sur des tâches réelles et le couplage de ces références avec l'apprentissage de politiques de type VLA ou par imitation, afin de mesurer le gain réel en volume de données exploitables et en taux de réussite. Aucun pilote, partenaire industriel ni calendrier n'est annoncé à ce stade.

RecherchePaper
1 source
FlashDexRetarget : accélérer la génération de données de manipulation dextérique grâce au retargeting multi-mouvement
3arXiv cs.RO 

FlashDexRetarget : accélérer la génération de données de manipulation dextérique grâce au retargeting multi-mouvement

Des chercheurs du laboratoire DAVIAN Robotics ont publié sur arXiv (2610.01849) FlashDexRetarget, un cadre d'apprentissage par renforcement (RL) qui convertit des démonstrations humaines main-objet en mouvements réalisables par des mains robotiques. Le système combine des observations en nuage de points de l'objet, des caractéristiques de distance main-objet et des encodages de trajectoire future, avec des récompenses complémentaires portant sur le mouvement de l'objet et sur la relation main-objet de référence. Il utilise des réseaux acteur-critique séparés pour la main gauche et la main droite, et adapte l'algorithme off-policy FlashSAC au suivi de mouvement dextre. Sur un benchmark de 50 mouvements, avec un ou deux objets, il atteint 90 % de réussite, soit environ 2,5 fois les méthodes de référence par échantillonnage évaluées. Il demande jusqu'à 100 fois moins de calcul d'entraînement que les références RL évaluées. Les gains sont constants sur deux mains robotiques, la XHand et la Sharpa Wave Hand. Des essais à 200, 500 et 1 000 mouvements montrent une stabilité à plus grande échelle. L'enjeu est celui des données. Les démonstrations humaines forment une source réutilisable pour entraîner des politiques de manipulation dextre, mais elles ne servent que si le retargeting respecte la physique : contacts, forces et dynamique de l'objet. Les approches par échantillonnage réussissent rarement, et les approches RL existantes réclament un entraînement coûteux pour chaque mouvement. Un taux de 90 % avec un calcul très réduit rend plausible la production de grands jeux de données de manipulation, nécessaires aux modèles VLA (vision-langage-action) pour mains à nombreux degrés de liberté. Le résultat le plus intéressant est que l'efficacité s'améliore quand le jeu d'entraînement grandit : le coût par mouvement réussi baisse avec l'échelle, ce qui est contraire à l'intuition. Il faut toutefois rester prudent. Les chiffres viennent d'un benchmark conçu par les auteurs, comparé à des références que ceux-ci ont choisies et évaluées. Le facteur 100 est une borne haute. La validation sur matériel réel se limite à des rejeux qualitatifs de démonstrations capturées, sans politique entraînée à partir de ces données ni déploiement. Le travail s'inscrit dans la course aux données pour la dextérité, où la téléopération, les gants de capture et la vidéo humaine se disputent le rôle de source principale. Le retargeting physique est le maillon qui permet de transformer cette matière humaine en données exploitables par des mains robotiques aux morphologies variées. La présence de la Sharpa Wave Hand, une main dextre récente, montre que la méthode vise des plateformes actuelles. Les auteurs annoncent la mise à disposition de la vidéo et du code sur la page du projet. L'étape suivante à surveiller est l'entraînement de politiques sur ces données retargetées et leur transfert sur robot réel, seul test capable de dire si ce taux de succès en simulation se traduit en capacité de manipulation.

RecherchePaper
1 source
Téléopération bilatérale du corps entier avec estimation multi-étapes des paramètres d'objets pour la locomanipulation humanoïde à roues
4arXiv cs.RO 

Téléopération bilatérale du corps entier avec estimation multi-étapes des paramètres d'objets pour la locomanipulation humanoïde à roues

Un article mis à jour sur arXiv (référence 2508.09846, version 2) décrit un système de téléopération bilatérale corps entier pour un robot humanoïde à roues effectuant des tâches de manipulation en mouvement. L'apport technique central est un module d'estimation en ligne, en plusieurs étapes, des paramètres inertiels de l'objet saisi (masse, centre de masse, inertie). Le pipeline enchaîne un estimateur de taille par vision, une estimation initiale générée par un grand modèle vision-langage (VLM), puis un raffinement par échantillonnage hiérarchique découplé en plusieurs hypothèses, conçu pour limiter l'impact d'une erreur du VLM. Ce module tourne en parallèle d'une simulation haute-fidélité et du matériel réel, avec mise à jour en temps réel du point d'équilibre du robot. Les auteurs valident l'approche sur un prototype maison équipé d'une pince robotique et d'une interface homme-machine, démontrant en temps réel des tâches de levage, transport et dépose d'une charge représentant environ un tiers du poids corporel du robot. Pour l'industrie robotique, ce travail cible un verrou concret de la téléopération à retour haptique : sans connaissance des propriétés physiques de l'objet manipulé, le retour de force transmis à l'opérateur reste imprécis, ce qui brise la dynamique du contrôle corps entier. Combiner vision et VLM pour réduire l'espace de recherche avant d'affiner par échantillonnage accélérerait, selon les auteurs, l'estimation par rapport à des méthodes purement stochastiques ; l'abstract ne fournit toutefois aucun temps de cycle chiffré ni comparaison directe, ce qui invite à la prudence sur l'ampleur réelle du gain. L'intérêt pour les intégrateurs est de voir les VLM utilisés non pas pour générer des politiques d'action autonomes à la manière des approches VLA, mais comme prior physique exploitable en téléopération, une piste intermédiaire entre autonomie complète et contrôle humain pur. Cette publication s'inscrit dans la recherche sur la téléopération bilatérale de robots humanoïdes, où l'estimation dynamique des objets manipulés reste un problème ouvert. Elle se distingue des approches commerciales dominantes de robots humanoïdes bipèdes visant l'autonomie complète via des modèles VLA génératifs, en misant plutôt sur une plateforme à roues pilotée par un opérateur humain en boucle, un choix qui privilégie stabilité et charge utile relative. L'article ne précise ni institution porteuse ni calendrier de commercialisation : il s'agit d'une démonstration de faisabilité en laboratoire, sans pilote industriel ni partenaire annoncé à ce stade.

RecherchePaper
1 source