DAMP : locomotion humanoïde par apprentissage de croyance débruitée et a priori de mouvement adverses

Des chercheurs publient sur arXiv (2610.11505) DAMP, un cadre d'apprentissage par renforcement conçu pour la locomotion de robots humanoïdes sur terrains difficiles, sans aucune information perçue : ni caméra, ni lidar, ni carte de hauteur. Le système repose sur des réseaux de neurones récurrents qui exploitent les dépendances temporelles pour inférer de façon implicite l'information dite privilégiée (celle dont dispose le simulateur mais pas le robot réel) ainsi que d'autres variables latentes utiles à la tâche. Les représentations apprises sont alignées sur l'objectif de la tâche, ce qui doit produire une politique robuste et cohérente avec le but visé. Le titre indique aussi l'emploi de « denoised belief learning », c'est-à-dire un état de croyance débruité, et d'« adversarial motion priors », des a priori de mouvement adversariaux qui poussent la démarche vers un style naturel. L'ensemble est entraîné de bout en bout puis transféré de la simulation au monde réel. Les auteurs annoncent une démonstration sur robot physique, disponible en vidéo. Le résumé ne donne ni plateforme, ni chiffres de performance, ni description des terrains testés.
L'intérêt tient à l'hypothèse de départ. Beaucoup de contrôleurs de marche humanoïde récents s'appuient sur la perception extéroceptive pour franchir marches, pentes et obstacles, ce qui ajoute des capteurs, de la latence et des modes de défaillance : occlusions, poussière, éclairage, calibration. Une politique aveugle, qui déduit le terrain de la seule proprioception et de l'historique des mouvements, offrirait une couche de repli fiable et moins coûteuse pour des machines destinées à des sites industriels ou logistiques. Elle illustre aussi une tendance de fond de la recherche : distiller dans une politique déployable le savoir du simulateur, un schéma enseignant-élève rendu plus propre par la mémoire récurrente. Il faut toutefois rester prudent. Il s'agit d'un préprint, sans évaluation indépendante, et une vidéo de démonstration ne renseigne ni sur le taux de réussite, ni sur la sévérité des terrains, ni sur la reproductibilité. La notion de « terrain complexe » n'est pas chiffrée dans le texte disponible.
Ce travail s'inscrit dans une lignée bien établie. Les politiques de locomotion aveugles entraînées par RL et transférées de la simulation au réel se sont imposées sur les quadrupèdes, avec l'apprentissage de type enseignant-élève popularisé autour de l'ETH Zurich. Les adversarial motion priors, issus de l'animation de personnages, servent à obtenir des allures plus humaines sans réécrire à la main les fonctions de récompense. Côté humanoïdes, les acteurs industriels (Figure, Tesla avec Optimus, Agility Robotics, Unitree, Boston Dynamics) combinent de plus en plus RL en simulation et perception, tandis que des acteurs européens comme Wandercraft ou Enchanted Tools travaillent aussi sur la marche robuste. Reste à savoir si DAMP sera accompagné d'un code ouvert, de comparaisons chiffrées avec des méthodes de référence et de tests sur plusieurs morphologies, éléments qui permettront de juger sa portée réelle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




