Aller au contenu principal
RecherchearXiv cs.RO 

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose BeyondRetarget, un framework qui apprend des mouvements exécutables pour robots humanoïdes directement à partir de vidéos RGB monoculaires, sans passer par l'étape classique de reconstruction explicite du mouvement humain puis de retargeting vers le squelette du robot. Décrit dans un preprint arXiv publié fin septembre 2026, le système apprend une représentation implicite orientée robot directement depuis les images, complétée par un mécanisme d'optimisation de mouvement dit "contact-aware" censé améliorer la cohérence temporelle et la plausibilité physique des trajectoires générées. Les auteurs rapportent des gains en précision, en robustesse et en taux de réussite d'exécution, ainsi qu'une latence réduite, à la fois en simulation et sur des robots humanoïdes réels. L'abstract ne fournit toutefois aucun chiffre précis (pas de taux de succès, de latence en millisecondes, ni de payload ou DOF du robot testé), ce qui limite pour l'instant l'évaluation indépendante de l'ampleur réelle des gains annoncés.

L'enjeu dépasse le simple gain de performance technique. Les pipelines actuels d'apprentissage par démonstration à partir de vidéos humaines butent sur un problème structurel: les différences de morphologie et de degrés de liberté entre humain et robot rendent les mouvements retargetés difficiles à exécuter, et les erreurs d'estimation de pose humaine se propagent sans pouvoir être corrigées a posteriori par optimisation conjointe. En supprimant cette étape intermédiaire, BeyondRetarget s'attaque directement à un goulot d'étranglement identifié par une large partie du secteur: la capacité à exploiter le volume massif de vidéos humaines disponibles (tutoriels, contenus web) pour entraîner des humanoïdes sans dépendre uniquement de téléopération coûteuse ou de données de mouvement capturées en laboratoire. Si les résultats se confirment à plus grande échelle, cela renforcerait la piste "apprentissage par imitation vidéo" comme alternative ou complément aux approches VLA entraînées sur données robot réelles.

Le travail se positionne dans la lignée des méthodes de retargeting de mouvement humain vers robot, dominantes dans la littérature récente sur l'apprentissage de démonstrations pour humanoïdes, mais s'en distingue en éliminant la représentation humaine intermédiaire. Il s'agit d'un résultat de recherche publié en preprint, non encore validé par relecture par les pairs ni associé à un déploiement industriel ou à un partenaire robotique identifié dans l'abstract, ce qui en fait pour l'instant une contribution méthodologique à suivre plutôt qu'une solution prête à l'emploi.

Dans nos dossiers

À lire aussi

Apprentissage d'une démarche humanoïde expressive à partir de vidéos monoculaires de podium pour les défilés de mode robotiques
1arXiv cs.RO 

Apprentissage d'une démarche humanoïde expressive à partir de vidéos monoculaires de podium pour les défilés de mode robotiques

Un article de recherche publié sur arXiv fin septembre 2026 décrit un système permettant à des robots humanoïdes d'imiter la démarche de mannequins sur un podium de mode. L'équipe a conçu un pipeline complet transformant une simple vidéo monoculaire de défilé en une politique de locomotion déployable : récupération du mouvement à partir de la vidéo, retargeting vers la morphologie du robot, correction du mouvement, entraînement de la politique, évaluation en simulation, puis déploiement physique. Le framework a été testé sur le robot humanoïde Booster K1, conçu par la société chinoise Booster Robotics. Lors des essais physiques réels, le robot a exécuté l'intégralité des passages sans chuter, en reproduisant les traits caractéristiques du catwalk : pose des pieds resserrée et coordination fine entre jambes, torse et bras. Le papier ne précise ni le nombre exact d'essais ni de temps de cycle chiffré, ce qui limite l'évaluation quantitative de la robustesse annoncée. Ce travail illustre un déplacement d'objectif dans la locomotion humanoïde : la plupart des politiques de marche actuelles sont optimisées pour la stabilité et la vitesse, pas pour l'expressivité gestuelle. Or les défilés de mode sont devenus un terrain de démonstration prisé par les fabricants de robots humanoïdes pour prouver leur dextérité au grand public. En montrant qu'une vidéo 2D ordinaire, sans capture de mouvement dédiée, suffit à transférer un style de démarche stylisé vers un robot réel, l'étude appuie l'idée que l'apprentissage par imitation à partir de vidéos grand public peut réduire le coût d'acquisition de comportements expressifs, un enjeu direct pour les intégrateurs qui cherchent à diversifier les usages des humanoïdes au-delà de la logistique et de l'industrie, vers le divertissement et la communication de marque. Cette recherche s'inscrit dans la multiplication des vitrines chorégraphiques de robots humanoïdes, un registre où Unitree, Figure, Tesla avec Optimus ou Boston Dynamics ont déjà mis en scène danse, boxe ou marche stylisée pour illustrer leurs progrès en contrôle moteur. Booster Robotics, éditeur du K1 utilisé ici, est surtout connu pour la compétition de football robotique RoboCup et propose une plateforme humanoïde de taille moyenne relativement accessible à la recherche académique. Le travail présenté reste un prototype de laboratoire, évalué sur un nombre limité d'essais physiques, sans annonce de déploiement commercial ni de calendrier de pilotes ; les auteurs évoquent seulement une extension possible à d'autres scénarios de performance robotique.

UEImpact indirect seulement: la méthode d'imitation vidéo pourrait intéresser des intégrateurs européens cherchant a diversifier les usages des humanoïdes, mais aucun acteur ni déploiement européen n'est implique dans ces travaux.

RecherchePaper
1 source
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
2arXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux. DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique. L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire
3arXiv cs.RO 

C2Dex : reconstruction et retargeting cohérents avec le contact pour la manipulation dextérique à partir de vidéo monoculaire

Des chercheurs publient sur arXiv (arXiv:2608.07045v1) un article intitulé C2Dex, un framework qui transfère des démonstrations de manipulation extraites de simples vidéos monoculaires de mains humaines vers des robots à mains dextres. Le système repose sur une représentation partagée de contacts stables côté objet, reconstruits en agrégeant des observations bruitées image par image dans un espace canonique de l'objet. Ces contacts servent à la fois de contraintes de trajectoire pour stabiliser la reconstruction 3D de l'interaction main-objet humaine, et de cibles explicites pour le transfert vers la main robotique, via une optimisation laplacienne de l'interaction qui préserve la géométrie locale du contact malgré le changement de morphologie, puis un raffinement par apprentissage par renforcement résiduel en simulation. Sur les benchmarks DexYCB et TACO, C2Dex atteint des taux de réussite de trajectoire de bout en bout de 57,78% et 26,67% respectivement, contre 17,78% et 10% pour les meilleures méthodes de référence testées dans les mêmes conditions. Des essais de rejeu sur robot réel confirment la faisabilité physique des trajectoires générées sur des tâches de manipulation riches en contacts. Cette avancée s'attaque à un goulot d'étranglement central de la manipulation dextre : la collecte de démonstrations de qualité via téléopération ou capture de mouvement reste coûteuse et lente, alors que les vidéos humaines existent en abondance et à bas coût. Réussir à extraire de ces vidéos des trajectoires physiquement plausibles et transférables à des mains robotiques de morphologies différentes est jugé nécessaire pour entraîner à grande échelle des politiques de manipulation, dans la même logique que les modèles vision-langage-action utilisés par l'industrie humanoïde. Le gain observé face aux méthodes concurrentes, avec des taux de réussite multipliés par trois sur les deux jeux de données, suggère que l'instabilité des contacts reconstruits depuis la vidéo, jusqu'ici un frein majeur, peut être significativement atténuée. Les taux de réussite absolus restent toutefois modestes, en particulier sur TACO (26,67%), ce qui signale que le transfert vidéo vers robot dextre reste loin d'être résolu pour des tâches complexes. C2Dex s'inscrit dans un axe de recherche actif visant à exploiter les vidéos humaines comme source de données pour l'apprentissage par imitation en robotique, en complément ou substitut des démonstrations téléopérées. L'article, classé comme nouvelle soumission sur arXiv, n'a pas encore fait l'objet d'une publication évaluée par les pairs et ne décrit ni déploiement industriel ni intégration produit : il s'agit d'un travail de recherche comparé à des méthodes existantes de reconstruction d'interaction main-objet et de retargeting, jugées moins performantes dans les mêmes conditions d'évaluation. Une page projet dédiée met à disposition davantage de détails techniques et, potentiellement, des démonstrations vidéo. Les auteurs ne précisent pas de calendrier de suite des travaux, mais la démonstration sur robot réel laisse entrevoir une prochaine étape naturelle vers des évaluations en conditions moins contrôlées et sur un éventail plus large de tâches et de morphologies de mains robotiques.

RecherchePaper
1 source
WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action
4arXiv cs.RO 

WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action

Des chercheurs présentent WALA (arXiv:2607.11397), un framework qui apprend des actions latentes exécutables à partir de deux types de données distincts : des démonstrations robotiques annotées d'actions et de simples vidéos sans annotation d'action. Le problème visé est bien connu du secteur : les démonstrations robotiques étiquetées coûtent cher à collecter et passent mal à l'échelle, alors que les vidéos humaines et robotiques disponibles en masse restent inexploitables faute d'étiquettes d'action exécutables. WALA fonctionne en deux temps. D'abord, un pré-entraînement d'un modèle d'action latente sémantique-géométrique sur des vidéos, en modélisant l'évolution entre l'observation courante et des observations futures échantillonnées de façon éparse. Plutôt que de reconstruire les pixels bruts, le système prédit les deltas futurs dans l'espace de features DINOv3 et dans l'espace de profondeur dense, ce qui conserve la structure sémantique et géométrique utile à la tâche tout en réduisant la sensibilité aux détails d'apparence. Lors de l'entraînement de la politique, l'encodeur pré-entraîné fournit des cibles d'action latente stables, et le décodeur sert de modèle du monde latent entraînable, avec une supervision conjointe par prédiction d'action robotique, correspondance de cible d'action latente et prédiction de dynamique future. Résultat annoncé : un nouveau record sur RoboCasa avec 75,2% de taux de réussite moyen, ainsi que de bonnes performances sur RoboTwin et en manipulation réelle. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la promesse de découplage entre données d'entraînement et coût d'annotation. Si une politique VLA peut effectivement tirer une supervision de dynamique utile de vidéos non annotées, cela ouvre la voie à des jeux de données d'entraînement bien plus vastes sans multiplier les campagnes de téléopération robotique, un goulot d'étranglement connu pour tout intégrateur ou labo qui cherche à généraliser au-delà d'un jeu de tâches restreint. Cela dit, il s'agit d'un résultat de recherche publié sur arXiv, pas d'un produit déployé : les métriques de succès sur RoboCasa et RoboTwin sont des benchmarks de simulation ou semi-contrôlés, et la mention de "manipulation réelle" reste peu détaillée dans l'abstract, sans précision sur le nombre de tâches, le taux de réussite exact en conditions réelles ni le hardware utilisé. Le travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, langage et contrôle moteur dans un même backbone, et dans la tendance plus large des "world models" latents pour la robotique, où l'usage de features pré-entraînées (ici DINOv3) remplace la reconstruction pixel pour la supervision. Aucun acteur français ou européen n'est mentionné dans cet abstract. Les suites logiques incluraient une publication complète avec code et poids, ainsi que des tests de généralisation croisée entre familles de robots, un point sur lequel l'abstract reste volontairement vague.

RechercheActu
1 source