La fluidité comme contrainte pour une locomotion humanoïde stable
Un article de recherche publié sur arXiv (2609.24552) présente DeCap, un algorithme d'apprentissage par renforcement sous contraintes pour le contrôle corps entier des robots humanoïdes. Le constat de départ : le bas du corps doit rester réactif pour l'équilibre, tandis que le haut du corps doit être fortement régulé pour la stabilité, une distinction que les méthodes RL classiques ignorent en imposant la fluidité via des récompenses auxiliaires uniformes, qui entrent en concurrence avec les objectifs de tâche. DeCap découple les contraintes en deux groupes, haut et bas du corps, formulées comme des limites physiques explicites de vitesse et d'accélération, complétées par une pénalité barrière qui s'active dès l'approche de ces limites sans diverger. Sur une tâche réelle de contrôle corps entier, il réduit le taux de variation des actions du haut du corps d'un facteur 2,50 et l'accélération d'un facteur 2,18 par rapport aux politiques basées récompense, tout en améliorant aussi la fluidité du bas du corps.
Ce résultat s'attaque à un compromis concret pour l'industrie : un haut du corps trop rigide limite la dextérité utile, un haut du corps mal amorti compromet l'équilibre et use l'actionnement, un frein réel au déploiement en usine ou en entrepôt où sécurité et répétabilité priment. Le tuning manuel des récompenses selon le terrain ou la tâche est un goulot d'étranglement connu du RL appliqué à la locomotion humanoïde ; qu'un même jeu de contraintes se transfère sans retuning à des terrains variés, si confirmé au-delà des conditions testées, réduirait le coût d'ingénierie pour les intégrateurs. L'approche questionne aussi la pratique dominante du reward shaping en RL, en montrant qu'une contrainte physique explicite offre un contrôle plus direct et prévisible que des pénalités négociées.
Le travail s'inscrit dans le champ du RL sous contraintes, une alternative au RL par récompense pure qui gagne du terrain à mesure que les humanoïdes passent des démonstrations en laboratoire à des essais en conditions réelles, où la marge d'erreur mécanique est faible. Il agit à un niveau différent de celui des modèles vision-langage-action qui pilotent la planification haut niveau des humanoïdes : DeCap se concentre sur la couche bas niveau de génération de mouvement. Classé comme nouvelle publication sur arXiv, l'article ne précise ni le robot ni le laboratoire à l'origine des essais réels et n'annonce aucun calendrier de déploiement : il s'agit à ce stade d'une contribution de recherche méthodologique, validée expérimentalement mais non commercialisée.
Dans nos dossiers




