Bicyclette Acrobatique : l'Apprentissage par Renforcement en Action
Des chercheurs ont entraîné par apprentissage par renforcement (RL) un robot en forme de vélo, l'Ultra Mobility Vehicle (UMV), une plateforme bicyclette construite sur mesure, à exécuter tout un répertoire de figures acrobatiques dynamiques. Décrite dans la prépublication arXiv:2608.00880v1, l'équipe combine plusieurs formulations de RL (suivi de points de passage, atteinte de pose, suivi de vitesse angulaire, suivi guidé et imitation de mouvement) pour apprendre au robot à sauter en avant et sur le côté, en solo ou par-dessus plusieurs tables, à orienter ses sauts, à enchaîner front flips, kip-ups et kip-downs, ainsi qu'à rouler, faire des wheelies, des bunny hops et des demi-tours en trois points. Un orchestrateur gère les transitions entre ces politiques grâce à des déclencheurs conditionnés à l'état du robot, ce qui permet d'enchaîner des séquences longues sans intervention humaine. En simulation comme sur le matériel réel, l'UMV franchit répétitivement des tables allant jusqu'à 1 mètre de haut, réalise plus de 15 sauts autonomes consécutifs en suivant des points de passage, s'adapte à des configurations de tables inédites, enchaîne kip-ups, sauts, flips et kip-downs sur plus de 20 essais consécutifs, et exécute plus de 10 répertoires consécutifs de wheelies, sauts latéraux et descentes sur une roue en configuration orientable.
Ce résultat déplace une frontière jusqu'ici associée presque exclusivement aux robots à pattes : la capacité à composer des figures acrobatiques complexes et robustes dans la durée. Un robot à roues, sous-actionné et soumis à des contraintes non-holonomes réputées difficiles à contrôler, atteint ici un niveau d'agilité comparable tout en conservant la vitesse et l'efficacité énergétique propres à la locomotion à roues. Pour les équipes de recherche en robotique mobile, cela confirme que le RL peut s'étendre à des morphologies non conventionnelles au-delà des humanoïdes et quadrupèdes, avec un intérêt potentiel pour la logistique ou les usages tout-terrain rapides.
Le travail s'inscrit dans la lignée des démonstrations d'agilité par RL popularisées par les robots à pattes (Boston Dynamics, Unitree), mais l'applique à une plateforme bicyclette peu explorée jusqu'ici en raison de sa dynamique d'équilibre complexe. Il s'agit pour l'instant d'une publication de recherche, pas d'un produit commercialisé : les auteurs présentent ces résultats comme une base pour de futurs travaux sur l'acrobatie à vélo, sans calendrier de déploiement industriel annoncé.
Dans nos dossiers




