EIDA : adaptation de la dynamique d'exécution et d'interface pour la navigation de robots, du réel à la simulation puis au réel
Des chercheurs publient sur arXiv (2610.01219) EIDA, pour « Execution-Interface Dynamics Adaptation », une méthode qui vise à réduire l'écart entre simulation et robot réel en navigation. Le problème ciblé est précis. Une politique apprise en simulation échoue souvent parce que les commandes de vitesse produisent, sur la plateforme réelle, un mouvement et un retour de vitesse différents de ceux modélisés à l'entraînement. EIDA ajuste ces réponses à partir de données d'exécution recueillies sur la plateforme cible, sans reconstruire la dynamique des actionneurs. Un premier modèle, qui prédit les incréments de pose dans le repère du corps, met à jour la géométrie du simulateur. Un second modèle prédit le retour de vitesse que perçoit la politique, et un court historique de ce retour est ajouté à son entrée. Le tout tourne dans un simulateur léger parallélisé sur GPU. Sur les jeux de validation complets du Jackal (robot à roues) et du Unitree Go2 (quadrupède), les modèles ajustés réduisent les erreurs de position et de lacet par rapport au modèle de mouvement prédéfini du simulateur. Sur 100 environnements de navigation évalués dans un autre simulateur physique, EIDA obtient le meilleur taux de réussite et le meilleur score de navigation parmi les politiques apprises comparées, avec ou sans guidage global. Sur un Go2 réel, il atteint le but sans collision dans 20 essais sur 20 en scène statique, contre 4 sur 20 pour la base de référence.
L'intérêt tient à l'approche. Beaucoup d'équipes cherchent à résoudre le « sim-to-real » en modélisant finement les moteurs, les couples et les frottements, ce qui est coûteux et propre à chaque machine. EIDA place l'adaptation à l'interface d'exécution, c'est-à-dire entre la commande de vitesse et le mouvement observé, et s'appuie sur des données collectées à l'exécution. Pour un intégrateur qui déploie des politiques de navigation sur plusieurs plateformes, un recalage à partir d'un jeu de données de conduite est plus réaliste qu'une identification complète de la dynamique. Le résultat sur les ablations est aussi instructif : l'écart ne vient pas seulement du mouvement réel, mais de la manière dont la politique estime sa propre vitesse, ce qui oblige à aligner ces estimations. Il faut toutefois relativiser. Il s'agit d'un préprint non évalué par des pairs. Le test physique porte sur un seul robot, en scène statique, avec 20 essais, et rien n'indique encore une tenue en environnement dynamique ou sur d'autres morphologies.
Ce travail s'inscrit dans la lignée des méthodes « real-to-sim-to-real », qui vont des approches de randomisation de domaine à l'identification de systèmes et aux modèles de dynamique appris. La navigation par apprentissage par renforcement entraîné en simulation parallèle sur GPU est devenue courante pour les quadrupèdes comme le Go2, et la question du transfert reste son principal frein. Le choix du Jackal et du Go2 montre la volonté de couvrir un robot à roues et un robot à pattes, mais la validation en conditions réelles ne concerne que ce dernier. Les auteurs ne mentionnent ni pilote industriel ni calendrier. La suite logique serait des essais en scènes dynamiques, sur davantage de plateformes, et une comparaison avec des méthodes d'adaptation en ligne.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




