
Brachiation robuste sur un robot bibras taille humaine grâce à l'apprentissage par renforcement guidé par points de passage
Une prépublication arXiv (2608.17320), publiée mi-août 2026, décrit une méthode d'apprentissage par renforcement permettant à un robot bipède à deux bras de taille humaine de pratiquer la brachiation, le déplacement par les bras seuls comme chez les primates sur des barres suspendues. Baptisée Waypoint-Guided Reinforcement Learning (WGRL), la technique ne spécifie que quelques points de passage épars pour la trajectoire de l'effecteur terminal; le mouvement complet du corps est ensuite généré par renforcement, guidé par une récompense mêlant respect des points de passage, réussite de la tâche et efficacité énergétique. Conçu pour le transfert sim-to-real, l'entraînement a été validé par des essais sim-to-sim sur des parcours de barres à géométrie variable, puis par des tests sur le robot physique, confirmant une brachiation robuste avec récupération après échec de prise.
Le résultat s'attaque à un verrou resté ouvert sur les plateformes grandeur nature: la coordination fine et le timing précis pour saisir et relâcher un appui, sans données de démonstration humaine disponibles, la tâche étant trop spécifique pour un jeu d'apprentissage par imitation. En s'appuyant sur de simples points de passage plutôt que sur des trajectoires complètes annotées, la méthode contourne ce manque de données, un frein courant à l'apprentissage par renforcement en robotique réelle. Pour les chercheurs en locomotion et les intégrateurs travaillant sur des humanoïdes, elle élargit les modes de déplacement envisageables au-delà de la marche bipède, qui concentre l'essentiel des efforts du secteur, vers des structures, échafaudages ou sites industriels sans appui continu au sol.
La brachiation robotique est étudiée depuis plusieurs décennies, mais les démonstrations concluantes restaient jusqu'ici cantonnées à des simulateurs ou à des robots miniatures et légers, la coordination bras-corps se compliquant nettement à l'échelle humaine entre inertie et contraintes de couple. Ce travail prolonge un courant de recherche qui combine apprentissage par renforcement et transfert sim-to-real pour la locomotion dynamique, déjà exploité pour la marche et la course des humanoïdes bipèdes. L'article ne précise ni le laboratoire d'origine ni le nom commercial de la plateforme testée, et présente ses résultats comme des lignes directrices méthodologiques réutilisables plutôt que comme un produit finalisé, sans calendrier de déploiement ni partenariat industriel annoncé.
Dans nos dossiers




