Aller au contenu principal
MimicX : affinage de la supervision avec politique dans la boucle pour le suivi de mouvements humanoïdes à partir de vidéos
RecherchearXiv cs.RO 

MimicX : affinage de la supervision avec politique dans la boucle pour le suivi de mouvements humanoïdes à partir de vidéos

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

MimicX, un framework décrit dans un preprint arXiv (2610.09055v1), propose d'utiliser les échecs d'exécution d'une politique de contrôle comme signal pour corriger la supervision d'un humanoïde qui apprend à imiter des vidéos humaines. Le système part d'un mouvement reconstruit à partir d'une vidéo puis retargeté sur le robot. Il localise ensuite les transitions difficiles et les parties du corps concernées. Il ajuste conjointement les objectifs de suivi (tracking) et le curriculum de réinitialisation, c'est-à-dire les états de départ proposés à la politique lors de la reprise de l'entraînement. Des rollouts répétés servent à vérifier chaque modification, et seules les améliorations qui privilégient l'exécution sans dégrader des garde-fous de suivi sont conservées. Sur quatre tâches vidéo de référence, la méthode réduit en moyenne l'erreur de suivi du corps de 25,7 % et augmente de 255,6 % le Robust Execution Horizon, la durée pendant laquelle le robot exécute le mouvement sans échec, par rapport à la base de comparaison « Fixed Reference », qui conserve la référence initiale inchangée. Des études complémentaires portent sur d'autres vidéos, d'autres références de mouvement et des scènes avec collisions. Une variante, MimicX-HLoop, accélère la boucle de rétroaction grâce à une exécution hétérogène.

L'intérêt tient à un constat que connaissent les équipes qui travaillent sur le suivi de mouvement : une référence visuellement plausible n'est pas forcément exécutable sous contraintes physiques. Les pipelines vidéo vers humanoïde traitent souvent la référence comme une vérité fixe et laissent la politique s'en accommoder, ce qui produit des échecs persistants sur certains passages. MimicX inverse la logique en considérant la référence et la supervision comme des variables à corriger. Pour un intégrateur ou un laboratoire, cela réduit le travail manuel de nettoyage des données de mouvement, souvent le goulot d'étranglement du transfert depuis la vidéo. Il faut toutefois relativiser. Le gain de 255,6 % porte sur une métrique d'horizon définie par les auteurs, mesurée sur seulement quatre tâches, face à une seule base de comparaison explicitement faible. Les résultats semblent obtenus en simulation, rien n'indique de validation sur robot réel, et les éléments fournis ne précisent ni la plateforme, ni les temps de calcul de la boucle.

Ce travail s'inscrit dans la lignée des méthodes d'imitation de mouvement humain pour humanoïdes, qui reposent sur la reconstruction de pose à partir de vidéos, le retargeting cinématique, puis l'apprentissage par renforcement en simulation. Les approches existantes se concentrent surtout sur la robustesse de la politique ou sur la qualité de la reconstruction, plus rarement sur la correction de la supervision elle-même à partir des échecs. Il s'agit d'un preprint, sans revue par les pairs, ni code ni déploiement annoncés dans le résumé. La suite logique serait une validation sur matériel et une comparaison avec des méthodes de nettoyage ou de filtrage de référence plus solides que la base fixe.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée
1arXiv cs.RO 

PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée

Un cadre nomme PLAT, pour Privileged LAtent Transition learning, a été publie sur arXiv sous la référence 2609.25754v1. Il s'attaque au contrôle de robots humanoïdes par "keyframes temporisées éparses" : le robot ne reçoit que quelques poses-clés futures et leurs instants d'arrivée souhaites, plutôt qu'une référence dense image par image comme le font les politiques de motion tracking classiques. L'entrainement se déroule en trois étapes : un expert de suivi de mouvement dense preentraine fournit d'abord un prior de mouvement robuste, un prior latent privilégié est ensuite appris par imitation de type DAgger a partir de séquences d'objectifs denses servant de supervision privilégiée, puis un apprentissage par renforcement affine les transitions dans l'espace latent plutôt que les actions elles-mêmes. Les auteurs rapportent un suivi stable et précis en simulation sur des horizons de planification variables, avec un avantage marque a long horizon, et un déploiement réussi sur un robot humanoïde Unitree G1. Le problème vise est concret pour les équipes de recherche et les intégrateurs en robotique humanoïde : les politiques de suivi dense, précises mais rigides, s'exploitent mal comme contrôleurs de haut niveau pour la planification de taches ou la génération interactive de mouvement, car elles exigent une référence complète a chaque instant. En rendant le contrôle pilotable par de simples poses-clés espacées dans le temps, PLAT propose une interface plus légère entre un module de décision, planificateur ou générateur de mouvement, et l'exécution bas niveau, une séparation qui rejoint la logique d'architectures décision/exécution comme GR00T N2 ou Helix. Le transfert réussi vers un robot physique va dans le sens d'un rapprochement simulation-déploiement, même si les résultats quantitatifs reposent surtout sur la simulation, avec un seul modèle de robot teste et aucun taux de réussite en conditions réelles communique dans le résume. Ce travail s'inscrit dans la lignée des politiques de suivi de mouvement entraînées en simulation puis transférées sur robot réel, méthode courante pour les humanoïdes Unitree et dans la recherche en contrôle appris. Il se distingue des modèles généralistes de type VLA, tels Pi-0 ou GR00T N2, en ciblant la couche de contrôle moteur bas niveau plutôt que la perception ou la planification, une brique complémentaire plutôt que rivale. Publie sous la catégorie "new" d'arXiv, sans partenariat industriel ni calendrier de déploiement annonces, PLAT demeure a ce stade une contribution de recherche dont la robustesse hors simulation et sur d'autres plateformes reste a démontrer.

RecherchePaper
1 source
KungfuAthleteBot : apprendre des mouvements humanoïdes très dynamiques à partir de vidéos, avec une récupération robuste unifiée
2arXiv cs.RO 

KungfuAthleteBot : apprendre des mouvements humanoïdes très dynamiques à partir de vidéos, avec une récupération robuste unifiée

Des chercheurs publient KungfuAthleteBot (KAB), un cadre d'apprentissage qui fait acquérir à un robot humanoïde des mouvements très dynamiques à partir de vidéos. Les auteurs ont constitué le jeu de données KungfuAthlete à partir de vidéos d'artistes martiaux de niveau national. Ils y appliquent une correction de trajectoire parabolique guidée par la physique. Elle supprime trois défauts de la reconstruction vidéo dans les phases aériennes et d'atterrissage : flottement en hauteur, pénétration du sol et vibrations haute fréquence. Ils introduisent ensuite un échantillonnage dit « pseudo-LKE » (low kinetic energy, faible énergie cinétique), qui oriente l'initialisation de l'entraînement vers des états dynamiquement faisables. Enfin, la récupération après perturbation et après chute est apprise dans la même politique que le suivi du mouvement vidéo. Cette approche n'exige ni données de référence de récupération ni bascule manuelle entre modes. Sur un robot humanoïde, les auteurs rapportent une récupération après des chutes arbitraires en environ 0,7 s. Ils la présentent comme la plus rapide publiée pour une politique unifiée. Le robot utilisé et le détail des conditions d'essai ne figurent pas dans le résumé de l'étude (preprint arXiv 2610.03388, non évalué par des pairs). L'intérêt tient au diagnostic plus qu'au record. La vidéo est une source de mouvement abondante et bon marché, mais reciblage direct d'une trajectoire reconstruite ne suffit pas. Elle est physiquement incohérente, ne contient aucune information de couple ou de force, et ne dit rien des échecs. Suivre strictement une telle référence est dynamiquement irréalisable, et une initialisation guidée par l'erreur relance sans cesse la politique depuis des poses aériennes impossibles. Les ablations indiquent que réparer et compenser les données vidéo compte plus que d'en accumuler davantage. Cette conclusion nuance la tendance à tout miser sur le volume de données pour les politiques de mouvement du corps entier. Pour un intégrateur, la fusion du suivi et de la récupération dans un seul réseau simplifie l'architecture de contrôle et réduit les transitions fragiles entre contrôleurs. Les réserves habituelles s'appliquent toutefois : le résultat vient d'un laboratoire, et le résumé ne donne ni taux de réussite ni nombre d'essais. Le chiffre de 0,7 s dépend aussi de la définition de la « récupération » et de la posture initiale de chute, que le résumé ne précise pas. Ces travaux s'inscrivent dans la série de méthodes qui apprennent à des humanoïdes des mouvements humains par suivi de référence en simulation, puis par transfert vers le robot réel. Des approches comme DeepMimic, puis les politiques de suivi du corps entier, ont popularisé cette logique. La difficulté restait le passage de mouvements capturés en studio à des mouvements acrobatiques extraits de vidéos. Les gestes de kung-fu, avec sauts et réceptions, sont un banc d'essai exigeant pour cette question. Les prochaines étapes à surveiller sont la publication du code et du jeu de données, la validation sur plusieurs plateformes et la mesure de la robustesse hors laboratoire. Aucun déploiement industriel ni produit n'est annoncé à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
3arXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux. DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique. L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
4arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source