Aller au contenu principal
RecherchearXiv cs.RO 

ForgetMimic : désapprentissage de mouvements pour le contrôle par apprentissage par renforcement d'humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ForgetMimic, une méthode de désapprentissage au niveau du mouvement pour les politiques de contrôle de robots humanoïdes entraînées par apprentissage par renforcement à partir de démonstrations humaines, a été décrite dans un preprint arXiv (2609.28378) et testée sur les robots Unitree G1 et H2, sur douze mouvements incluant danse, combat et saut (flip). Le principe : à partir d'une politique entraînée sur N mouvements, la méthode dégrade sélectivement la performance sur un sous-ensemble ciblé de K mouvements tout en préservant les N-K mouvements restants. Les auteurs indiquent avoir identifié et corrigé deux mécanismes d'entraînement responsables des échecs de désapprentissage observés dans les approches naïves, et montrent expérimentalement que la mémoire des mouvements visés est effacée sans dégrader les autres comportements appris.

L'enjeu dépasse la prouesse technique : les politiques RL pour humanoïdes s'appuient sur des bibliothèques de démonstrations pouvant contenir des mouvements malveillants, corrompus, sous-optimaux ou protégés par le droit d'auteur, et la seule parade jusqu'ici consistait à réentraîner la politique entière à partir d'un jeu de données expurgé, une opération coûteuse en calcul. Pour les intégrateurs et fabricants, retirer un mouvement précis sans tout reprendre représente un gain opérationnel direct, notamment face à des obligations comme le droit à l'oubli du RGPD européen appliqué aux données de capture de mouvement humain. ForgetMimic ouvre ainsi une voie technique concrète pour la gouvernance des données de mouvement en robotique, même si l'étude reste un travail académique mené sur deux plateformes et ne constitue pas un produit déployé.

Le contrôle humanoïde par imitation de démonstrations via le RL s'est imposé ces dernières années comme un paradigme dominant pour obtenir des locomotions agiles et naturelles, porté par des plateformes comme les Unitree G1 et H2, souvent choisies en recherche académique pour leur coût accessible face aux humanoïdes de Boston Dynamics, Figure ou Tesla. ForgetMimic se présente, selon ses auteurs, comme la première méthode de désapprentissage conçue spécifiquement pour le contrôle humanoïde en monde physique, un champ distinct de l'oubli sélectif déjà étudié pour les grands modèles de langage. Le papier ne mentionne aucun pilote industriel ni calendrier de déploiement : il s'agit d'une contribution de recherche tout juste publiée, dont la portée reste circonscrite aux douze mouvements testés en laboratoire, avec pour suites attendues l'extension à des répertoires plus larges et la validation sur d'autres plateformes.

Impact France/UE

La méthode pourrait offrir une réponse technique aux obligations de droit à l'oubli du RGPD appliquées aux données de capture de mouvement humain, sans lien avec une entreprise ou institution française identifiée.

À lire aussi

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
1arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares
2arXiv cs.RO 

MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares

Des chercheurs ont publié sur arXiv (2606.10288) MARCH, un cadre d'apprentissage par renforcement assisté par modèles pour la locomotion bipedale sur appuis épars. La méthode repose sur trois étapes : générer une trajectoire de référence sûre à partir de modèles dynamiques simplifiés, entraîner une politique "enseignante" guidée par un reward basé sur une Control Lyapunov Function (CLF), puis distiller cette politique dans une politique "étudiante" visuelle déployable sur robot réel. L'ensemble a été validé en simulation et déployé sur un Unitree G1, humanoïde commercialisé autour de 16 000 dollars, naviguant sur des appuis épars avec contraintes latérales. L'enjeu est de réconcilier deux familles de méthodes historiquement opposées : les approches basées modèle (MPC, optimisation de contact) sont précises mais fragiles face à l'incertitude de terrain, tandis que le RL pur est robuste mais peine à découvrir les mouvements finement contraints nécessaires à la locomotion safety-critical, où une erreur de quelques centimètres peut provoquer une chute. Le reward CLF injecte une connaissance physique dans la boucle d'apprentissage sans curriculum d'entraînement complexe, améliorant l'efficacité d'échantillonnage et produisant une locomotion plus fluide. Les performances sur stepping stones sont déclarées comparables aux baselines RL purs, ce qui suggère que l'hybridation modèle/apprentissage est viable à coût computationnel comparable. Ce travail s'inscrit dans l'axe locomotion perceptive porté par ETH Zurich (parkour RL, 2023), Carnegie Mellon et Berkeley. La distillation teacher-student, popularisée par Agility Robotics et ANYbotics dans leurs pipelines de développement, est ici enrichie d'une contrainte CLF théoriquement fondée. Le Unitree G1 est devenu une plateforme quasi-standard dans les labos de locomotion pour sa documentation et son prix accessible. Il s'agit d'un preprint arXiv non évalué par les pairs, sans déploiement industriel ni timeline commerciale annoncés. Les prochaines étapes naturelles seraient une validation sur terrain extérieur non structuré et une comparaison directe avec les approches MPC de nouvelle génération.

UEImpact marginal : ETH Zurich (Suisse, hors UE) est cité en travaux connexes, mais aucun labo ou industriel européen n'est directement impliqué dans ce preprint.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
3arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source
ResSafe : filtrage de sécurité par apprentissage par renforcement résiduel pour humanoïdes
4arXiv cs.RO 

ResSafe : filtrage de sécurité par apprentissage par renforcement résiduel pour humanoïdes

ResSafe, une architecture de contrôle en deux politiques pour les robots humanoïdes, a été publiée le 15 septembre 2026 sur arXiv sous la référence 2609.15988. La méthode sépare performance et sécurité : une politique nominale est entraînée uniquement pour accomplir la tâche, tandis qu'une politique résiduelle apprend en parallèle des corrections de sécurité qui ajustent ses actions. Cette seconde politique agit comme un filtre de sécurité implicite, censé limiter chutes et instabilités liées à la dynamique à haute dimensionnalité et aux interactions riches en contacts propres aux humanoïdes. L'abstract ne cite aucune plateforme robotique ni aucun chiffre de performance (taux de chute, distance parcourue, degrés de liberté), signe d'une recherche encore amont, sans validation matérielle détaillée. Pour l'industrie, ce découplage répond à un problème connu : faire arbitrer par une seule politique performance, robustesse et sécurité oblige à régler manuellement plusieurs termes de récompense concurrents, un exercice fragile qui complique le passage du simulateur au robot réel. En sortant la sécurité de cette équation unique, ResSafe propose une approche modulaire qui, si elle se confirme sur du matériel, pourrait faciliter l'ajout de correctifs de sécurité sans réentraîner toute la politique de locomotion. L'enjeu parle directement aux intégrateurs et décideurs du secteur, confrontés à un écart persistant entre démonstrations en simulation et fiabilité en conditions réelles. Le travail s'inscrit dans une recherche académique plus large sur le contrôle par apprentissage des humanoïdes, où le RL pour la locomotion et le suivi de mouvement s'est largement généralisé ces dernières années. Il se distingue des méthodes de filtrage de sécurité explicite, fondées sur des barrières de contrôle ou des modèles analytiques de la dynamique, souvent coûteuses ou difficiles à généraliser à un système aussi complexe. L'article ne mentionne ni code source, ni partenaire industriel, ni calendrier d'essais sur robot physique : ResSafe reste, à ce stade, une contribution de recherche dont l'apport devra être confirmé au-delà de la simulation.

RecherchePaper
1 source