LocoWM : locomotion de haute précision grâce à une adaptation résiduelle guidée par un modèle du monde
LocoWM est un cadre de contrôle publié sur arXiv (version 1, identifiant 2609.39179) qui vise la locomotion de haute précision, c'est-à-dire le suivi de commandes de mouvement associé à une régulation fine d'états physiques utiles à la tâche. L'architecture combine trois briques. Une politique de base assure la locomotion qui suit les commandes. Un modèle du monde conditionné par l'action prédit une séquence d'états physiques futurs à partir de l'historique proprioceptif et de l'action proposée par la politique de base. Un adaptateur résiduel, alimenté par cette séquence prédite, produit des corrections additives censées compenser les écarts anticipés. L'entraînement se fait en deux étapes : la locomotion et la dynamique conditionnée par l'action sont d'abord apprises, puis les deux modules sont gelés pendant l'entraînement de l'adaptateur. Les auteurs testent trois scénarios, le nivellement de terrain, la compensation d'accélération et la récupération après poussée. Ils annoncent une meilleure précision de contrôle et une meilleure robustesse aux perturbations que des références de bout en bout et des références résiduelles réactives. Démonstrations et code sont publiés en ligne. Le résumé ne donne aucun chiffre, aucun robot ni aucune plateforme matérielle.
L'intérêt tient à un problème connu de l'apprentissage par renforcement pour la marche. Une optimisation conjointe de bout en bout sacrifie souvent les objectifs de précision au profit du suivi de vitesse et de la stabilité, car ces derniers dominent la récompense. Les correcteurs résiduels réactifs, eux, n'agissent qu'une fois l'écart observable, donc trop tard pour des tâches où la tolérance est serrée, par exemple porter une charge, niveler un sol ou tenir une posture en mouvement. Le caractère « préactif » de LocoWM, qui corrige avant que l'erreur ne se manifeste, répond à ce défaut. La séparation entre l'acquisition de la locomotion et l'adaptation de précision est aussi un choix d'ingénierie utile : la politique de base reste intacte et la couche de précision se greffe par-dessus. Reste à vérifier que cela tient au-delà de la simulation. Le résumé ne précise ni le transfert sim-to-real, ni le coût de calcul du modèle du monde à l'inférence, ni l'ampleur des gains. Il s'agit d'un travail de recherche et non d'un produit, sans déploiement industriel.
Ce travail s'inscrit dans le courant qui rapproche modèles du monde et contrôle bas niveau pour les robots à pattes et humanoïdes. Il existe déjà des politiques de locomotion apprises en simulation, des architectures à correction résiduelle et des modèles dynamiques appris pour la planification. Les acteurs industriels de l'humanoïde, comme Figure, Tesla ou Agility, dépendent de telles couches de contrôle bas niveau, sans qu'un lien avec LocoWM soit établi ici. Aucun calendrier de suite n'est annoncé. Les prochaines étapes à surveiller sont la validation sur robot réel, la comparaison chiffrée avec les méthodes existantes et la réutilisation du code publié par d'autres laboratoires.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




