BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire
Une équipe de recherche propose BeyondRetarget, un framework qui apprend des mouvements exécutables pour robots humanoïdes directement à partir de vidéos RGB monoculaires, sans passer par l'étape classique de reconstruction explicite du mouvement humain puis de retargeting vers le squelette du robot. Décrit dans un preprint arXiv publié fin septembre 2026, le système apprend une représentation implicite orientée robot directement depuis les images, complétée par un mécanisme d'optimisation de mouvement dit "contact-aware" censé améliorer la cohérence temporelle et la plausibilité physique des trajectoires générées. Les auteurs rapportent des gains en précision, en robustesse et en taux de réussite d'exécution, ainsi qu'une latence réduite, à la fois en simulation et sur des robots humanoïdes réels. L'abstract ne fournit toutefois aucun chiffre précis (pas de taux de succès, de latence en millisecondes, ni de payload ou DOF du robot testé), ce qui limite pour l'instant l'évaluation indépendante de l'ampleur réelle des gains annoncés.
L'enjeu dépasse le simple gain de performance technique. Les pipelines actuels d'apprentissage par démonstration à partir de vidéos humaines butent sur un problème structurel: les différences de morphologie et de degrés de liberté entre humain et robot rendent les mouvements retargetés difficiles à exécuter, et les erreurs d'estimation de pose humaine se propagent sans pouvoir être corrigées a posteriori par optimisation conjointe. En supprimant cette étape intermédiaire, BeyondRetarget s'attaque directement à un goulot d'étranglement identifié par une large partie du secteur: la capacité à exploiter le volume massif de vidéos humaines disponibles (tutoriels, contenus web) pour entraîner des humanoïdes sans dépendre uniquement de téléopération coûteuse ou de données de mouvement capturées en laboratoire. Si les résultats se confirment à plus grande échelle, cela renforcerait la piste "apprentissage par imitation vidéo" comme alternative ou complément aux approches VLA entraînées sur données robot réelles.
Le travail se positionne dans la lignée des méthodes de retargeting de mouvement humain vers robot, dominantes dans la littérature récente sur l'apprentissage de démonstrations pour humanoïdes, mais s'en distingue en éliminant la représentation humaine intermédiaire. Il s'agit d'un résultat de recherche publié en preprint, non encore validé par relecture par les pairs ni associé à un déploiement industriel ou à un partenaire robotique identifié dans l'abstract, ce qui en fait pour l'instant une contribution méthodologique à suivre plutôt qu'une solution prête à l'emploi.
Dans nos dossiers




