Aller au contenu principal
PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée
RecherchearXiv cs.RO 

PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un cadre nomme PLAT, pour Privileged LAtent Transition learning, a été publie sur arXiv sous la référence 2609.25754v1. Il s'attaque au contrôle de robots humanoïdes par "keyframes temporisées éparses" : le robot ne reçoit que quelques poses-clés futures et leurs instants d'arrivée souhaites, plutôt qu'une référence dense image par image comme le font les politiques de motion tracking classiques. L'entrainement se déroule en trois étapes : un expert de suivi de mouvement dense preentraine fournit d'abord un prior de mouvement robuste, un prior latent privilégié est ensuite appris par imitation de type DAgger a partir de séquences d'objectifs denses servant de supervision privilégiée, puis un apprentissage par renforcement affine les transitions dans l'espace latent plutôt que les actions elles-mêmes. Les auteurs rapportent un suivi stable et précis en simulation sur des horizons de planification variables, avec un avantage marque a long horizon, et un déploiement réussi sur un robot humanoïde Unitree G1.

Le problème vise est concret pour les équipes de recherche et les intégrateurs en robotique humanoïde : les politiques de suivi dense, précises mais rigides, s'exploitent mal comme contrôleurs de haut niveau pour la planification de taches ou la génération interactive de mouvement, car elles exigent une référence complète a chaque instant. En rendant le contrôle pilotable par de simples poses-clés espacées dans le temps, PLAT propose une interface plus légère entre un module de décision, planificateur ou générateur de mouvement, et l'exécution bas niveau, une séparation qui rejoint la logique d'architectures décision/exécution comme GR00T N2 ou Helix. Le transfert réussi vers un robot physique va dans le sens d'un rapprochement simulation-déploiement, même si les résultats quantitatifs reposent surtout sur la simulation, avec un seul modèle de robot teste et aucun taux de réussite en conditions réelles communique dans le résume.

Ce travail s'inscrit dans la lignée des politiques de suivi de mouvement entraînées en simulation puis transférées sur robot réel, méthode courante pour les humanoïdes Unitree et dans la recherche en contrôle appris. Il se distingue des modèles généralistes de type VLA, tels Pi-0 ou GR00T N2, en ciblant la couche de contrôle moteur bas niveau plutôt que la perception ou la planification, une brique complémentaire plutôt que rivale. Publie sous la catégorie "new" d'arXiv, sans partenariat industriel ni calendrier de déploiement annonces, PLAT demeure a ce stade une contribution de recherche dont la robustesse hors simulation et sur d'autres plateformes reste a démontrer.

À lire aussi

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
1arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
ForgetMimic : désapprentissage de mouvements pour le contrôle par apprentissage par renforcement d'humanoïdes
2arXiv cs.RO 

ForgetMimic : désapprentissage de mouvements pour le contrôle par apprentissage par renforcement d'humanoïdes

ForgetMimic, une méthode de désapprentissage au niveau du mouvement pour les politiques de contrôle de robots humanoïdes entraînées par apprentissage par renforcement à partir de démonstrations humaines, a été décrite dans un preprint arXiv (2609.28378) et testée sur les robots Unitree G1 et H2, sur douze mouvements incluant danse, combat et saut (flip). Le principe : à partir d'une politique entraînée sur N mouvements, la méthode dégrade sélectivement la performance sur un sous-ensemble ciblé de K mouvements tout en préservant les N-K mouvements restants. Les auteurs indiquent avoir identifié et corrigé deux mécanismes d'entraînement responsables des échecs de désapprentissage observés dans les approches naïves, et montrent expérimentalement que la mémoire des mouvements visés est effacée sans dégrader les autres comportements appris. L'enjeu dépasse la prouesse technique : les politiques RL pour humanoïdes s'appuient sur des bibliothèques de démonstrations pouvant contenir des mouvements malveillants, corrompus, sous-optimaux ou protégés par le droit d'auteur, et la seule parade jusqu'ici consistait à réentraîner la politique entière à partir d'un jeu de données expurgé, une opération coûteuse en calcul. Pour les intégrateurs et fabricants, retirer un mouvement précis sans tout reprendre représente un gain opérationnel direct, notamment face à des obligations comme le droit à l'oubli du RGPD européen appliqué aux données de capture de mouvement humain. ForgetMimic ouvre ainsi une voie technique concrète pour la gouvernance des données de mouvement en robotique, même si l'étude reste un travail académique mené sur deux plateformes et ne constitue pas un produit déployé. Le contrôle humanoïde par imitation de démonstrations via le RL s'est imposé ces dernières années comme un paradigme dominant pour obtenir des locomotions agiles et naturelles, porté par des plateformes comme les Unitree G1 et H2, souvent choisies en recherche académique pour leur coût accessible face aux humanoïdes de Boston Dynamics, Figure ou Tesla. ForgetMimic se présente, selon ses auteurs, comme la première méthode de désapprentissage conçue spécifiquement pour le contrôle humanoïde en monde physique, un champ distinct de l'oubli sélectif déjà étudié pour les grands modèles de langage. Le papier ne mentionne aucun pilote industriel ni calendrier de déploiement : il s'agit d'une contribution de recherche tout juste publiée, dont la portée reste circonscrite aux douze mouvements testés en laboratoire, avec pour suites attendues l'extension à des répertoires plus larges et la validation sur d'autres plateformes.

UELa méthode pourrait offrir une réponse technique aux obligations de droit à l'oubli du RGPD appliquées aux données de capture de mouvement humain, sans lien avec une entreprise ou institution française identifiée.

RecherchePaper
1 source
Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement
3arXiv cs.RO 

Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement

Un article de recherche publie sur arXiv (2609.21467v1) présente Distance-Conditioned Reference Recomposition (DCRR), une méthode pour entrainer des robots humanoïdes a la loco-manipulation d'objets a partir d'un seul clip de mouvement démontre. Les auteurs identifient un biais qu'ils nomment le "termination-versus-passage gap": une politique de suivi de mouvement entraînée sur une trajectoire fixe ne reproduit fidèlement que le point d'arrivée démontre, alors que la source visite déjà des positions intermédiaires de l'objet. DCRR déplace le segment de fin de démonstration vers ces états intermédiaires, les rejoue via un teacher de suivi fige, puis distille les résultats reetiquetes dans une politique sans référence. Sur quatre taches (porter, pousser au pied, pousser accroupi, trainer), DCRR-BC obtient une erreur moyenne normalisée de 0,15 contre 0,28 pour un clonage comportemental classique; un affinage par renforcement améliore ensuite la robustesse, confirmée sur robot physique. Cette contribution s'attaque a une limite connue des pipelines d'imitation pour humanoïdes: une politique apprise par retargeting d'un mouvement humain unique reproduit généralement une seule démonstration figée, sans capacité a viser une distance de transport arbitraire a l'inférence. Pour un intégrateur industriel, déposer une caisse a 30 centimètres ou a 1,20 mètre exigerait normalement autant de démonstrations que de distances cibles. En montrant qu'un clip source unique, recompose puis redistribue, suffit a produire un comportement conditionne par la distance, l'étude réduit le besoin de collecte de données, un goulot d'étranglement reconnu face aux approches VLA gourmandes en téléopération. Elle rappelle aussi que le transfert simulation-vers-réel reste teste, non acquis: les auteurs vérifient d'abord la robustesse en sim-to-sim avant le matériel. Il s'agit d'une publication de recherche (arXiv, catégorie "new"), sans robot ni entreprise identifies dans le résume: la méthode est validée en simulation puis sur du matériel générique, sans que la plateforme humanoïde soit précisée. Elle s'inscrit dans la lignée des travaux combinant retargeting de mouvement humain et apprentissage par renforcement pour la loco-manipulation, une famille distincte des modèles VLA comme Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus multi-taches plutôt que sur un clip unique. Aucun pilote industriel ni calendrier de déploiement n'est annonce: c'est un résultat méthodologique destine a de futures politiques de transport conditionne, pas un produit prêt a intégrer.

RecherchePaper
1 source
De la cognition au contrôle : apprentissage multi-agents pour le transport collaboratif humain-humanoïde
4arXiv cs.RO 

De la cognition au contrôle : apprentissage multi-agents pour le transport collaboratif humain-humanoïde

Des chercheurs ont présenté C2C (Cognition-to-Control), une architecture de collaboration homme-robot pour le transport d'objets, dans une version mise à jour d'un article publié sur arXiv (2603.03768v2, catégorie "replace"). Plutôt que de standardiser les modules logiciels eux-mêmes (planificateur, modèle du partenaire, politique de coordination, contrôleur), C2C standardise les signaux physiques échangés entre eux : un chemin de charge vérifié géométriquement pour représenter l'intention de tâche, un état physique indépendant de sa source pour décrire le partenaire, des commandes bornées en espace de tâche à 11 dimensions pour la coordination apprise, la faisabilité propre au robot restant du ressort du contrôle corps entier (whole-body control). Le système de référence associe un modèle vision-langage, une vérification géométrique déterministe et de l'apprentissage par renforcement multi-agent (MARL) sensible au partenaire ; sur neuf scénarios de transport, les variantes MARL adaptatives atteignent 77,1 à 82,1 % de succès moyen, contre 56,5 % pour une référence à partenaire scripté. Sur robot physique, un Unitree G1 associé à un humain obtient 100 % de succès en transport dans un espace confiné et 80 % pour la manipulation d'objets très longs, et un système à trois porteurs (deux humanoïdes G1 et un humain) valide la même structure d'interface sur matériel réel. Le problème visé est concret pour les intégrateurs : les piles de collaboration homme-robot pleinement intégrées deviennent fragiles dès qu'on change un seul composant, par exemple en remplaçant un partenaire simulé par un humain, ou une équipe à deux porteurs par une équipe à trois. En montrant que la même interface reste fonctionnelle avec des acteurs neuronaux ou des arbres de décision interprétables, avec deux ou trois porteurs, et avec une substitution simulation-vers-réel, les auteurs suggèrent qu'un système de transport collaboratif homme-humanoïde peut être construit de façon modulaire plutôt que reconstruit à chaque itération. C'est un signal pertinent pour les déploiements d'humanoïdes en logistique et en usine, où la coordination physique fiable avec des opérateurs humains reste un frein avant la montée en échelle commerciale. Ce travail s'inscrit dans la vague de recherche combinant modèles vision-langage-action et apprentissage multi-agent pour la robotique humanoïde, où l'écart entre démonstrations simulées et performance réelle reste un point de friction classique du secteur. Le choix du Unitree G1, robot bipède largement utilisé par les laboratoires académiques pour ce type d'expérimentation en raison de sa disponibilité commerciale, situe l'étude comme une validation de laboratoire plutôt qu'un déploiement industriel : l'article ne mentionne ni institution ni entreprise partenaire, ni calendrier de mise en production, et les scénarios à deux et trois porteurs testés ouvrent la voie à une généralisation vers des équipes homme-robot plus larges comme prochaine étape.

RecherchePaper
1 source