ForgetMimic : désapprentissage de mouvements pour le contrôle par apprentissage par renforcement d'humanoïdes
ForgetMimic, une méthode de désapprentissage au niveau du mouvement pour les politiques de contrôle de robots humanoïdes entraînées par apprentissage par renforcement à partir de démonstrations humaines, a été décrite dans un preprint arXiv (2609.28378) et testée sur les robots Unitree G1 et H2, sur douze mouvements incluant danse, combat et saut (flip). Le principe : à partir d'une politique entraînée sur N mouvements, la méthode dégrade sélectivement la performance sur un sous-ensemble ciblé de K mouvements tout en préservant les N-K mouvements restants. Les auteurs indiquent avoir identifié et corrigé deux mécanismes d'entraînement responsables des échecs de désapprentissage observés dans les approches naïves, et montrent expérimentalement que la mémoire des mouvements visés est effacée sans dégrader les autres comportements appris.
L'enjeu dépasse la prouesse technique : les politiques RL pour humanoïdes s'appuient sur des bibliothèques de démonstrations pouvant contenir des mouvements malveillants, corrompus, sous-optimaux ou protégés par le droit d'auteur, et la seule parade jusqu'ici consistait à réentraîner la politique entière à partir d'un jeu de données expurgé, une opération coûteuse en calcul. Pour les intégrateurs et fabricants, retirer un mouvement précis sans tout reprendre représente un gain opérationnel direct, notamment face à des obligations comme le droit à l'oubli du RGPD européen appliqué aux données de capture de mouvement humain. ForgetMimic ouvre ainsi une voie technique concrète pour la gouvernance des données de mouvement en robotique, même si l'étude reste un travail académique mené sur deux plateformes et ne constitue pas un produit déployé.
Le contrôle humanoïde par imitation de démonstrations via le RL s'est imposé ces dernières années comme un paradigme dominant pour obtenir des locomotions agiles et naturelles, porté par des plateformes comme les Unitree G1 et H2, souvent choisies en recherche académique pour leur coût accessible face aux humanoïdes de Boston Dynamics, Figure ou Tesla. ForgetMimic se présente, selon ses auteurs, comme la première méthode de désapprentissage conçue spécifiquement pour le contrôle humanoïde en monde physique, un champ distinct de l'oubli sélectif déjà étudié pour les grands modèles de langage. Le papier ne mentionne aucun pilote industriel ni calendrier de déploiement : il s'agit d'une contribution de recherche tout juste publiée, dont la portée reste circonscrite aux douze mouvements testés en laboratoire, avec pour suites attendues l'extension à des répertoires plus larges et la validation sur d'autres plateformes.
La méthode pourrait offrir une réponse technique aux obligations de droit à l'oubli du RGPD appliquées aux données de capture de mouvement humain, sans lien avec une entreprise ou institution française identifiée.
Dans nos dossiers




