Adaptation de la démarche économe en énergie par apprentissage par renforcement hiérarchique pour la locomotion quadrupède sur terrains variés
Des chercheurs proposent un cadre d'apprentissage par renforcement hiérarchique (HRL) qui sépare deux niveaux de contrôle pour la locomotion des robots quadrupèdes. Une politique haute fréquence assure l'exécution stable et robuste du mouvement au niveau des articulations. Une politique basse fréquence adapte la démarche en minimisant explicitement le coût de transport (CoT), c'est-à-dire l'énergie dépensée par unité de poids et de distance parcourue. L'entraînement se fait en trois étapes sous Isaac, le simulateur de NVIDIA. Il permet un transfert direct de la simulation au réel (zero-shot, sans réglage supplémentaire). Les auteurs le valident sur un quadrupède Unitree AlienGo. En simulation, ils le comparent à des politiques monolithiques et à des architectures hiérarchiques de référence. Ils annoncent un CoT réduit sur une large plage de vitesses commandées, avec une locomotion qui reste robuste sur sol plat, sol irrégulier et pentes. Le résumé publié ne donne aucun chiffre précis, ni pourcentage de réduction, ni valeur de CoT, ni vitesse maximale.
L'intérêt principal est de s'attaquer à un défaut connu des politiques entièrement apprises de bout en bout. Dans ces systèmes, la génération de la démarche, l'exécution du mouvement et l'optimisation énergétique sont étroitement imbriquées. Le résultat dépend alors fortement de la pondération des termes de récompense, ce qui rend les politiques fragiles et difficiles à ajuster. En isolant la minimisation du CoT dans un niveau dédié, l'approche rend l'efficacité énergétique plus contrôlable, sans dégrader le suivi de vitesse. La hiérarchie fait aussi émerger une adaptation automatique de la démarche : le robot passe de l'amble (pacing) à basse vitesse au trot à vitesse plus élevée. Cela rappelle les transitions de allures observées chez les animaux, sans qu'elles aient été programmées. Pour les intégrateurs, l'autonomie est un facteur limitant des quadrupèdes d'inspection industrielle. Un gain énergétique obtenu par la politique seule, sans changement matériel, serait donc précieux. Il faudra toutefois le confirmer par des mesures d'autonomie réelles.
Cette publication s'inscrit dans une série de travaux sur la locomotion apprise, qui ont largement utilisé Isaac Gym et Isaac Lab pour entraîner des politiques déployées sur des plateformes Unitree. Les approches hiérarchiques existent déjà. Elles séparent en général un planificateur de démarche ou de pas d'un contrôleur bas niveau. Ici, la particularité tient à l'optimisation explicite du CoT au niveau supérieur. Les limites sont claires. Il s'agit d'un preprint arXiv (2610.10297v1) non évalué par les pairs. Le test matériel porte sur un seul robot, l'AlienGo, plateforme plus ancienne que les Go2 ou B2 actuels de Unitree. Les terrains testés restent relativement simples. La suite logique serait de valider sur des plateformes plus récentes, avec des mesures de consommation en conditions réelles. Il faudrait aussi tester des terrains plus difficiles comme les escaliers, et comparer avec les contrôleurs commerciaux.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




