RoboMirror : comprendre avant d'imiter pour la locomotion humanoïde à partir de vidéo
Des chercheurs présentent RoboMirror, un système qui permet a un robot humanoïde d'apprendre a marcher directement a partir de vidéos, sans capture de mouvement ni retargeting du squelette. Contrairement aux méthodes existantes, qui s'appuient soit sur des trajectoires de motion capture organisées, soit sur des commandes textuelles éparses, RoboMirror utilise des modèles vision-langage (VLM) pour extraire l'intention de mouvement visuelle brute de vidéos filmées a la première personne (égocentriques) ou a la troisième personne, et alimente directement avec cette intention une politique de contrôle basée sur la diffusion générant des mouvements physiquement plausibles sans reconstruction explicite de pose. Selon les expériences rapportées par les auteurs, le système permet la téléprésence via vidéo égocentrique, réduit de 80% la latence de contrôle en mode troisième personne, et obtient un taux de réussite des taches supérieur de 3,7% par rapport aux méthodes de référence. Le papier, publie sur arXiv sous l'identifiant 2512.23649, en est a sa quatrième version révisée.
Ce travail s'attaque a un problème concret pour l'industrie de la robotique humanoïde: la difficulté de transférer un mouvement observe en vidéo vers un contrôleur robotique sans étape intermédiaire couteuse et sujette aux erreurs, comme la capture de mouvement ou le retargeting manuel. Si les résultats se confirment a plus grande échelle, cela ouvrirait la voie a l'apprentissage de locomotion a partir de vidéo "en conditions réelles" plutôt que de jeux de données de motion capture couteux a produire. Pour les équipes de R&D en téléopération, la réduction de latence en contrôle troisième personne cible un goulot d'étranglement connu, ou le délai entre observation vidéo et exécution du mouvement dégradé la réactivité et la stabilité. Ces chiffres restent toutefois issus d'évaluations internes des auteurs sur des baselines qu'ils ont eux-mêmes sélectionnées, sans validation indépendante ni déploiement documente sur robot physique en conditions réelles.
Cette approche s'inscrit dans un mouvement de recherche plus large visant a combler l'écart entre compréhension visuelle et action chez les humanoïdes, un axe pousse notamment par les modèles vision-langage-action. Les méthodes précédentes se divisaient en deux camps limites: les approches texte-vers-mouvement, pénalisées par la pauvreté sémantique du texte et l'accumulation d'erreurs dans des pipelines a étapes multiples, et les approches vidéo-vers-mouvement, qui se contentaient d'une imitation mécanique de la pose sans véritable compréhension du contenu. RoboMirror revendique être la première méthode vidéo-vers-locomotion sans retargeting en conditionnant directement une politique de diffusion sur l'intention extraite par un VLM. Le résume ne précise ni affiliation institutionnelle des auteurs ni calendrier de déploiement sur matériel réel: il s'agit a ce stade d'une contribution de recherche académique, sans pilote industriel ni partenariat annonce.
Dans nos dossiers



