Aller au contenu principal
CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède
RecherchearXiv cs.RO 

CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose CacheMPC, un mécanisme de mise en cache certifiée pour le Model Predictive Control (MPC) appliqué à la locomotion de robots quadrupèdes, publié sur arXiv (2606.28300). Le MPC constitue la couche prédictive standard dans les contrôleurs hiérarchiques de quadrupèdes, mais son solveur QP (programmation quadratique) recalculé à chaque cycle constitue un goulot d'étranglement sur processeur embarqué. Certified CacheMPC adresse ce problème via un cache indexé par Locality-Sensitive Hashing (LSH) de trajectoires de forces de contact, partitionné par mode de contact. Chaque entrée récupérée est acceptée uniquement si un certificat a posteriori confirme la faisabilité primale et une borne supérieure sur la sous-optimalité via le dual gap lagrangien. Le contrôleur combine récupération certifiée top-K, solveur QP à deadline bornée, et fallback sur la dernière solution certifiée. Validé sur un Unitree Go2, le système a été évalué sur 2 038 essais MuJoCo en froid contrôleur, dont une campagne de 600 essais à n=50 sur trois cellules à la frontière d'échec, puis déployé physiquement sur le NVIDIA Orin NX embarqué du robot. Le cache sans filtrage atteint un gain médian de 25x en temps de calcul en simulation, et 18,7x sur hardware réel.

L'enjeu industriel est direct : MPC haute fréquence sur SoC embarqué standard (Orin NX, environ 10-15W) sans recourir à un ASIC dédié ou à une approximation neuronale. Un facteur 18,7x de réduction du temps de solve ouvre la porte à des boucles de contrôle plus rapides sur des plateformes commerciales comme le Go2, utilisé massivement dans la recherche académique et les pilotes industriels légers. La certification formelle distingue cette approche des méthodes d'apprentissage du MPC (neural MPC, learning-based warm-starting) qui offrent des speedups similaires mais sans garantie exploitable. Nuance importante : la contribution du certificat à la stabilité en boucle fermée n'est pas statistiquement résolvable à la taille d'échantillon actuelle (n=50). Aucune différence significative n'a été détectée entre les variantes avec et sans cache, ce qui est honnête scientifiquement mais laisse la question de sécurité formelle ouverte.

Le MPC pour locomotion quadrupède s'est imposé depuis les travaux d'ETH Zurich (ANYmal) et du MIT (Cheetah), avec des implémentations ouvertes comme ACADOS ou OSQP qui restent les références en solve embarqué. CacheMPC s'inscrit dans un courant distinct : plutôt qu'accélérer le solveur ou substituer le MPC par un réseau de neurones, il exploite la répétabilité des gaits locomoteurs pour réutiliser des solutions passées. Les concurrents directs incluent les approches de warm-starting par apprentissage (DeepMPC, L4DC 2024) et les approximateurs explicites de MPC. Le Unitree Go2 est devenu le benchmark de facto à petit budget pour ce type de validation hardware. Les prochaines étapes naturelles seraient une campagne avec n significativement plus grand pour trancher sur la sécurité certifiée, et une extension aux bipèdes ou aux transitions de mode de contact plus complexes.

Dans nos dossiers

À lire aussi

Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique
1arXiv cs.RO 

Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique

Une équipe de chercheurs a publié le framework IFM (Imitating and Finetuning Model Predictive Control), une approche hybride pour le contrôle de robots quadrupèdes sur des terrains difficiles. La méthode, disponible sur arXiv sous la référence 2311.02304v3, s'articule en trois phases séquentielles : d'abord, un contrôleur MPC classique est construit à partir de la Programmation Dynamique Différentielle (DDP) couplée à l'heuristique de Raibert pour définir une politique experte ; ensuite, ce contrôleur est cloné par apprentissage par imitation afin de le rendre adaptable par gradient ; enfin, un deep reinforcement learning (RL) à exploration volontairement limitée affine la politique sur des terrains exigeants, notamment surfaces rugueuses, revêtements glissants et tapis roulants. Des expériences menées en simulation puis sur matériel réel valident les performances du framework dans ces trois configurations. Le principal apport d'IFM est de combiner la robustesse formelle du contrôle model-based et la flexibilité de l'apprentissage profond, sans les défauts propres à chaque approche prise isolément. En pratique, IFM produit des allures (gaits) significativement plus symétriques, périodiques et économes en énergie que le RL classique dit "Vanilla RL", tout en réduisant considérablement le travail de reward shaping, c'est-à-dire la conception laborieuse de fonctions de récompense qui constitue l'un des principaux freins industriels au RL pour la locomotion. L'exploration limitée en phase RL est une décision architecturale notable : elle contraint le réseau à rester proche de la politique MPC apprise, ce qui stabilise l'apprentissage sur des terrains hors distribution sans divergence comportementale, un résultat difficile à obtenir avec du RL pur. Le contrôle de la locomotion quadrupède est un champ de recherche dense depuis les travaux fondateurs de Marc Raibert au MIT Leg Lab dans les années 1980, dont l'heuristique de placement de pied est encore employée ici comme référence. Les approches récentes se partagent entre contrôle model-based pur (ETH Zurich avec ANYmal et le groupe RSL), RL pur (UC Berkeley, Carnegie Mellon) et hybrides croissants. IFM s'inscrit dans cette troisième catégorie, en compétition directe avec des pipelines teacher-student d'ETH Zurich ou des frameworks comme DribbleBot. La publication ne mentionne aucun déploiement industriel ni partenariat commercial : il s'agit d'une contribution académique, dont la valeur pratique dépendra de sa transferabilité à des robots commerciaux comme l'Unitree Go2 ou le Boston Dynamics Spot, plateformes sur lesquelles plusieurs groupes appliquent déjà des méthodologies similaires.

RecherchePaper
1 source
Modèle du monde conditionné par la morphologie pour la locomotion quadrupède multi-morphologie
2arXiv cs.RO 

Modèle du monde conditionné par la morphologie pour la locomotion quadrupède multi-morphologie

Une équipe de chercheurs présente le Quadrupedal World Model (QWM) dans une version révisée d'un article disponible sur arXiv (2604.08780v2). Le travail cible un verrou connu des modèles du monde en robotique légée : un modèle de dynamique entraîné sur un quadrupède ANYmal-D, conçu par l'entreprise suisse ANYbotics, échoue une fois transféré sur un Unitree Go1, car il surapprend la morphologie précise du robot d'origine plutôt que la dynamique de locomotion partagée entre plateformes. Le moindre changement d'actionneur ou de longueur de membre oblige alors à tout réentraîner. QWM contourne ce problème en formalisant les traits physiques de chaque robot dans une spécification de morphologie invariante à l'échelle, injectée dans un modèle génératif unique via un encodeur de morphologie, un normaliseur de récompense adaptatif et un conditionnement de morphologie dans la dynamique latente, les politiques de contrôle étant entraînées entièrement en imagination. À information de morphologie égale, une politique sans modèle obtient des résultats comparables à QWM sur les robots vus à l'entraînement, mais se dégrade sur des morphologies inédites, alors que QWM transfère en zero-shot, sans réglage fin ni adaptation. Pour les intégrateurs de robotique légée, cela suggère qu'un seul modèle du monde pourrait à terme piloter toute une famille de robots de gabarits différents sans réentraînement coûteux par machine, un frein connu au déploiement de flottes hétérogènes. Les auteurs revendiquent la première démonstration d'un transfert zero-shot cross-embodiment par modèle du monde au sein de la famille des quadrupèdes, un résultat encore limité à ce type de morphologie. Ce travail s'inscrit dans la lignée des modèles du monde, un paradigme visant à faire apprendre à un agent la physique de son environnement une seule fois pour en dériver des comportements efficacement, plutôt que de multiplier les interactions par tâche. Les deux plateformes testées, l'ANYmal-D suisse et le Go1 chinois de Unitree, comptent parmi les références les plus utilisées en recherche académique sur la locomotion quadrupède. La mention "replace" sur arXiv signale une version révisée sans détail public sur les changements apportés. À ce stade, QWM reste un résultat de recherche en preprint, sans annonce de déploiement industriel ni de partenariat constructeur ; une extension à d'autres familles de robots ou une validation sur matériel réel n'est pas précisée dans cet article.

RecherchePaper
1 source
AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal
3arXiv cs.RO 

AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal

Des chercheurs présentent AdaReP, une méthode qui modifie la façon dont les systèmes de controle predictif (MPC) bases sur des modèles du monde neuronaux décident de recalculer leur plan d'action. Habituellement, ces systèmes replanifient a chaque pas de temps pour limiter l'accumulation d'erreurs de prédiction, ce qui génère une charge de calcul importante. AdaReP est présente comme un wrapper "sans entrainement" (training-free) qui s'ajoute au-dessus d'un modèle du monde et d'un planificateur déjà appris, sans les modifier. Le système ajuste en continu la tolérance de replanification en fonction de l'écart mesure entre la trajectoire actuelle et le plan mis en cache, et d'une estimation locale de la sensibilité de la dynamique. Les auteurs valident l'approche sur trois types de taches : planification dans l'espace image, contrôle dans l'espace latent, et manipulation robotique réelle. Sur une étude physique de 50 essais avec un bras manipulateur, AdaReP réduit de plus de 80% le nombre de requêtes au planificateur tout en maintenant des performances comparables a une replanification systématique. Le papier, référence arXiv:2606.23079v2, est une version mise a jour d'une publication antérieure. Cette réduction cible un goulot d'étranglement connu des architectures MPC couplées a des modèles du monde neuronaux : chaque appel au planificateur, souvent un réseau lourd, coute cher en temps et en énergie, ce qui limite le déploiement embarque en temps réel sur des robots ou systèmes autonomes. En montrant qu'un plan mis en cache peut être réutilisé la plupart du temps sans dégrader la performance, AdaReP fournit un argument concret contre l'hypothèse selon laquelle replanifier a chaque pas serait nécessaire pour rester robuste aux erreurs de prédiction. Pour les intégrateurs et équipes de recherche, l'intérêt pratique tient au fait que la méthode ne nécessite ni reentrainement du modèle du monde ni modification du planificateur existant, ce qui facilite son adoption sur des piles déjà en production. Le gain mesure sur un robot physique et non uniquement en simulation répond a une critique fréquente du secteur : l'écart entre démonstrations simulées et comportement réel. Le problème s'inscrit dans la lignée des travaux sur le controle predictif base sur l'apprentissage, ou l'essor des modèles du monde neuronaux pour la robotique rend la replanification systématique de plus en plus couteuse a mesure que ces modèles gagnent en taille. Les auteurs formalisent le compromis entre réutilisation de plan et dérivé de prédiction via un cadre de regret dynamique base sur la perturbation, montrant que la pénalité d'un plan périmé dépend de trois facteurs : la tolérance de réutilisation choisie, l'écart de prédiction accumule depuis la dernière replanification, et la sensibilité locale de la dynamique. Le papier ne cite ni implémentation industrielle ni partenaire commercial, et aucun acteur français ou européen n'est mentionne dans cette publication de recherche méthodologique. Les suites évoquées concernent l'extension a d'autres familles de planificateurs et de modèles du monde, la validation restant pour l'instant limitee aux trois bancs d'essai décrits.

RecherchePaper
1 source
Bon modèle au bon moment : commande prédictive en cascade de fidélité pour la marche bipède en temps réel
4arXiv cs.RO 

Bon modèle au bon moment : commande prédictive en cascade de fidélité pour la marche bipède en temps réel

Des chercheurs ont soumis sur arXiv le 6 mai 2026 (arXiv:2605.04607) une méthode de contrôle prédictif multi-phase pour la marche bipède, validée en simulation MuJoCo sur HyPer-2, un robot bipède à 18 degrés de liberté. L'approche, dite "cascaded-fidelity MPC", divise l'horizon de prédiction en deux zones : les pas de temps proches s'appuient sur un modèle complet du corps entier (whole-body model), tandis que l'horizon lointain utilise un modèle simplifié à corps rigide unique (SRB). Le problème de commande optimale non linéaire résultant est résolu par programmation quadratique séquentielle (SQP) via le framework acados. Le contrôleur calcule directement des couples articulaires à partir d'un calendrier de contacts et d'une vitesse cible, sans exiger d'emplacements de pas prédéfinis. Il s'agit d'un preprint de recherche ; aucun transfert sur matériel physique n'est encore rapporté. L'enjeu est d'ordre computationnel : un MPC whole-body complet offre une haute précision dynamique mais reste prohibitif pour un contrôle embarqué temps réel, tandis que les méthodes simplifiées (LIPM, SRBD seul) dégradent la qualité de prédiction. Concentrer la fidélité du modèle sur l'horizon proche, là où elle impacte réellement la commande, est un compromis prometteur. L'absence de dépendance aux pas présélectionnés renforce également la robustesse potentielle en environnement non structuré. Ce travail s'inscrit dans une compétition académique dense autour du MPC pour la locomotion humanoïde. Des équipes comme ETH Zurich avec le framework OCS2, Carnegie Mellon ou des laboratoires européens explorent des hiérarchisations de modèles analogues. HyPer-2 semble être une plateforme de recherche universitaire non commercialisée. Les prochaines étapes attendues sont le transfert sim-to-real sur matériel physique et la validation sur terrain irrégulier.

RecherchePaper
1 source