RACER : estimation adaptative en boucle fermée des résidus pour la planification par échantillonnage de robots quadrupèdes à roues en course
Des chercheurs publient RACER, un cadre de contrôle hiérarchique pour la course de quadrupèdes à roues (wheeled-quadruped). L'architecture combine trois briques : un planificateur MPPI (Model Predictive Path Integral, planification par échantillonnage de trajectoires), un modèle de dynamique résiduelle appris, et un suiveur de vitesse de bas niveau entraîné par apprentissage par renforcement (RL). Le planificateur part d'un modèle cinématique nominal de type monocycle et lui ajoute un terme résiduel neuronal, chargé de capturer le comportement en boucle fermée de la politique RL. Pour entraîner ce résiduel avec peu de données réelles, l'équipe propose LoRRA (Low-Rank Residual Adaptation). La méthode procède en deux temps : un pré-entraînement sur un large volume de données de simulation, puis un ajustement fin sur un petit jeu de données réelles, sous contrainte de bas rang. Le résumé ne fournit ni vitesses, ni temps au tour, ni plateforme matérielle précise, ni volume de données.
Les résultats annoncés sont obtenus uniquement en simulation, selon trois constats. Premièrement, la dynamique résiduelle améliore la performance globale du pipeline, car elle corrige l'erreur de suivi du contrôleur RL dans les virages pris à haute vitesse. Deuxièmement, un résiduel entraîné sur données source (simulation) et cible (réel) donne de bien meilleures performances de course qu'un résiduel entraîné sur la seule cible. Troisièmement, la contrainte de bas rang à l'adaptation produit de meilleurs taux de réussite et de meilleures performances que l'ajustement complet ou l'entraînement from scratch, lorsque l'écart de domaine grandit, qu'il s'agisse du coefficient de sol ou des gains articulaires.
L'intérêt tient à un problème récurrent de la locomotion apprise : le planificateur raisonne sur un modèle simplifié, alors que la politique RL qui l'exécute s'en écarte précisément aux limites d'adhérence. Modéliser cet écart plutôt que de réentraîner toute la pile est une piste pragmatique pour les intégrateurs. L'usage de l'adaptation à bas rang, empruntée aux grands modèles de langage, suggère aussi une voie pour limiter le coût de collecte de données réelles lors d'un transfert sim-to-real. Une réserve s'impose toutefois : les validations citées sont simulées, et la robustesse du gain en conditions réelles reste à démontrer. Le résumé ne cite aucune comparaison avec des méthodes concurrentes de planification ni aucun essai sur robot physique.
Ce travail s'inscrit dans la lignée des quadrupèdes à roues, qui combinent la vitesse du roulage et la franchissabilité des pattes, et du contrôle prédictif par échantillonnage, déjà utilisé en conduite autonome agressive. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs. Les suites naturelles seraient des essais sur circuit réel et une comparaison à des contrôleurs de bout en bout. Aucun acteur industriel ni calendrier de déploiement n'est mentionné.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




