Aller au contenu principal
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
RecherchearXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux.

DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique.

L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

À lire aussi

Retargeting d'impédance par décomposition continue de variétés pour l'apprentissage par imitation à contacts riches
1arXiv cs.RO 

Retargeting d'impédance par décomposition continue de variétés pour l'apprentissage par imitation à contacts riches

CMDIR (Continuous Manifold-Decomposed Impedance Retargeting), présentée dans un article publié le 15 septembre 2026 sur arXiv (2609.15716), transforme des démonstrations à impédance fixe en contrôleurs à impédance variable continue destinés à l'apprentissage par imitation dans des tâches manipulatives à contact riche. La méthode s'appuie sur une représentation continue appelée TMIR (Task-Manifold Impedance Representation), qui associe un repère de tâche évolutif à des instructions de contrôle, et sur un module nommé Quality-to-Fast qui compile automatiquement une structure de solveur à partir de trajectoires de développement dans un espace fini prédéfini, puis certifie chaque candidat par évaluation multi-résolution. Sur 225 essais de contrôleurs retargetés répartis sur trois tâches de contact réelles, CMDIR complet améliore la rétention moyenne d'une métrique proxy de tâche et réduit l'écart de pose, les fluctuations de force et la force de pointe par rapport à MDIR discret. Une variante d'optimisation, FastMPO, affiche une accélération de 5,8 à 9,4 fois par rapport à C-MPO pour des résultats en boucle fermée comparables. Pour l'industrie robotique, ce travail s'attaque à un problème concret: la plupart des politiques apprises par imitation peinent sur les tâches de contact où la rigidité du contrôleur doit varier en continu, comme l'insertion de pièces, l'assemblage ou la manipulation d'objets fragiles, faute de quoi les forces générées deviennent instables. En montrant que l'interface complète de supervision TMIR est apprenable, et que les exécutions réussies présentent moins de fluctuations de force et une force de pointe plus faible, l'étude renforce l'idée que le contrôle d'impédance variable peut être intégré nativement dans les pipelines VLA plutôt que traité comme un module ajouté après coup. Les auteurs tempèrent toutefois eux-mêmes leurs résultats: la fiabilité de complétion des tâches reste inégale selon les tâches et environnements testés, un aveu qui tranche avec le ton parfois promotionnel du secteur et rappelle que la robustesse à l'échelle industrielle n'est pas acquise. CMDIR prolonge MDIR (Manifold-Decomposed Impedance Retargeting), dont elle étend le principe des démonstrations discrètes vers un régime continu, une évolution classique en apprentissage par imitation où chaque génération cherche à lisser les contraintes de la précédente. Le résumé ne cite aucune entreprise ni laboratoire nommément et se positionne comme une contribution méthodologique plutôt qu'un produit commercial: il s'agit d'un travail de recherche testé sur des tâches de contact réelles en conditions de laboratoire, pas d'un système déployé en usine. Le gain de vitesse de FastMPO ouvre des pistes pour rendre ces méthodes de retargeting d'impédance praticables à plus grande échelle, mais les suites attendues portent sur l'élargissement des tâches testées, l'amélioration de la fiabilité de complétion et une validation sur des plateformes industrielles avant toute adoption par des intégrateurs.

RecherchePaper
1 source
L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
2arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines
3arXiv cs.RO 

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines

Une équipe de chercheurs a publié sur arXiv (identifiant arXiv:2606.16436v1) un framework baptisé V2P-Manip, conçu pour extraire des politiques de manipulation dextre directement à partir de vidéos monoculaires de démonstrations humaines. L'architecture propose un pipeline intégré en trois étapes : acquisition d'assets 3D, estimation de trajectoires, puis apprentissage de politique de manipulation. Pour réconcilier perception visuelle et contraintes physiques, les auteurs introduisent un processus de raffinement en deux étapes imposant à la fois un alignement spatial et une cohérence physique. Le système a été évalué sur les benchmarks TACO et OakInk, deux jeux de données de référence en manipulation dextre, et affiche un taux de réussite moyen supérieur à 75 % sur des tâches de manipulation synthétiques, avec une généralisation démontrée sur plusieurs morphologies de mains robotiques différentes. L'enjeu central que V2P-Manip cherche à résoudre est celui du coût de collecte des données d'entraînement : la télé-opération reste lente, coûteuse et difficile à standardiser à grande échelle. Utiliser des vidéos monoculaires standard, sans capteurs de profondeur ni mocap, représente un levier de scalabilité potentiellement majeur pour les fabricants d'effecteurs dextres et les laboratoires à budget limité. Le pipeline démontre aussi une transférabilité des "manipulation priors" entre embodiments différents, ce qui est un résultat non trivial. Il faut néanmoins noter que le taux de 75 % est mesuré sur des tâches synthétiques et que les vidéos utilisées en entrée sont des démonstrations humaines sélectionnées -- le real-world gap reste à quantifier sur du matériel réel déployé en conditions industrielles non contrôlées. La manipulation dextre constitue l'une des frontières les plus dures de la robotique, un domaine où des acteurs comme Dexterous Robotics, Shadow Robot (UK) ou Psyonic tentent d'atteindre la maturité produit. Côté recherche, les approches concurrentes s'appuient généralement sur la télé-opération (Pi-0 de Physical Intelligence, ACT, DROID dataset) ou sur des capteurs de profondeur calibrés. L'originalité de V2P-Manip est de contourner ces contraintes matérielles en exploitant uniquement la vision monoculaire. La validation reste pour l'instant confinée à des benchmarks académiques, et aucun déploiement ou partenariat industriel n'est annoncé dans cette version préliminaire.

RecherchePaper
1 source
Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit
4arXiv cs.RO 

Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit

Des chercheurs ont publié le 18 septembre 2026 sur arXiv (référence 2609.19272) une méthode de navigation autonome pour robots humanoïdes baptisée RoM-Nav, testée sur un Unitree G1. Le problème de départ est concret: un pipeline d'apprentissage par renforcement (RL) classique à un seul étage échoue à monter en échelle sur des terrains multi-niveaux et multi-étages, freiné par la difficulté des interactions pied-terrain complexes comme les escaliers. La solution proposée décompose la navigation en deux étapes. D'abord, une politique entraînée sur une dynamique d'ordre réduit (reduced order model) mais alimentée par des observations LiDAR 3D complètes apprend à se repérer dans un terrain complexe à plusieurs étages. Cette connaissance sert ensuite à amorcer une seconde politique opérant sur la dynamique complète du robot, avec une politique de locomotion déjà entraînée et figée intégrée dans la boucle. Un filtre de sécurité dit de Poisson est ajouté en sortie de la politique de navigation pour garantir la sécurité face à des obstacles inédits, sans dégrader le taux de réussite. Sur le G1, les essais ont couvert une navigation sans carte préalable (mapless) avec plus de 10 mètres de dénivelé vertical cumulé et plus de 100 mètres de trajet parcouru. L'intérêt pour le secteur tient à ce que ce travail s'attaque directement à un angle mort connu de la robotique humanoïde: la locomotion pure a beaucoup progressé, mais l'autonomie de navigation en environnement bâti réel, avec escaliers et changements d'étage, reste un goulot d'étranglement pour tout déploiement industriel ou logistique. En montrant qu'une décomposition hiérarchique (modèle réduit puis politique complète) permet de dépasser les limites du RL monolithique, et qu'un filtre de sécurité formel peut être ajouté sans sacrifier la performance, l'étude apporte un argument concret dans le débat sur la fiabilité des humanoïdes hors des démonstrations scénarisées. Ce résultat s'inscrit dans une recherche académique en cours plutôt que dans un produit commercial: il s'agit d'un preprint arXiv, non encore validé par relecture par les pairs, mais démontré sur du matériel réel plutôt qu'en simulation seule. Le choix du Unitree G1, plateforme largement utilisée par les laboratoires universitaires pour son accessibilité, souligne aussi que ce type d'expérimentation reste pour l'instant du ressort de la recherche plutôt que du déploiement en flotte. Les auteurs mettent à disposition une page projet avec vidéos (wdc3iii.github.io/rom-nav) mais n'annoncent pas de calendrier de transfert vers l'industrie.

RecherchePaper
1 source