Aller au contenu principal
TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU
RecherchearXiv cs.RO 

TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le Toyota Research Institute (TRI) a publié le 24 juin 2026 TurboMPC, un solveur MPC (commande prédictive par modèle) différentiable fonctionnant entièrement sur GPU. Implémenté en JAX-CUDA, il combine programmation quadratique séquentielle (SQP), solveur interne ADMM et différentiation implicite, tout en supportant contraintes d'inégalité sur états et contrôles, intégrateurs implicites, coûts couplés temporellement et variables de slack. Les gains de performance atteignent jusqu'à 15x par rapport aux solveurs CPU différentiables de référence et jusqu'à 58x face aux meilleurs solveurs GPU existants. Validé en simulation sur planification contrainte, imitation learning pour humanoïde et apprentissage par renforcement à fonction de coût neuronale, TurboMPC a également été testé sur un véhicule réel en conduite à temps minimal. L'optimisation bayésienne des paramètres MPC, rendue possible par le traitement par lots sur GPU, y produit des vitesses nettement supérieures au réglage manuel. Le solveur tient jusqu'à 8 000 points de trajectoire sans perdre le contrôle du véhicule. Le code est mis en open source sur GitHub (ToyotaResearchInstitute/turbompc).

L'apport central est la réconciliation entre pipelines GPU d'apprentissage profond et solveurs MPC traditionnellement CPU-centric, une friction qui forçait des transferts mémoire coûteux et une hétérogénéité matérielle pénalisante en production. En restant entièrement sur GPU et en étant différentiable de bout en bout, TurboMPC s'intègre directement dans des boucles d'entraînement par gradient, ce qui valide à grande échelle l'hypothèse des "differentiable MPC" longtemps discutée dans la littérature. La démonstration sur imitation learning humanoïde est particulièrement significative: elle montre que des formulations MPC expressives peuvent rivaliser avec les approches purement apprises pour des robots à haute dimensionnalité, sans abandonner les garanties de planification.

TRI, branche recherche de Toyota dédiée à la robotique et aux véhicules autonomes, publie face à des alternatives établies comme Crocoddyl du LAAS-CNRS (Toulouse, France), ALTRO (Stanford/CMU) et Theseus (Meta AI), tous majoritairement CPU-centric ou partiellement GPU. La présence de Crocoddyl dans ce paysage concurrentiel donne une visibilité directe au laboratoire toulousain, dont les travaux seront mis en compétition par ces nouveaux benchmarks. La mise en open source facilite l'intégration dans des simulateurs parallèles comme Isaac Lab ou Genesis. Les prochaines étapes probables incluent des évaluations sur plateformes humanoïdes réelles et une adoption dans des pipelines robotiques industriels.

Impact France/UE

Le LAAS-CNRS (Toulouse) voit son solveur Crocoddyl directement mis en compétition par TurboMPC sur les benchmarks GPU, ce qui expose la recherche française en commande prédictive robotique à une comparaison défavorable sur les critères de performance.

Dans nos dossiers

À lire aussi

GATO : optimisation de trajectoire accélérée par GPU et par lots pour la commande prédictive par modèle embarquée et évolutive
1arXiv cs.RO 

GATO : optimisation de trajectoire accélérée par GPU et par lots pour la commande prédictive par modèle embarquée et évolutive

Une équipe de chercheurs a publié sur arXiv (identifiant 2510.07625v2) GATO, un solveur open source conçu pour accélérer massivement les calculs de trajectoire en temps réel dans les systèmes de contrôle prédictif par modèle (MPC). Concrètement, GATO cible le régime de lots modérés, soit des dizaines à quelques centaines de problèmes d'optimisation de trajectoires non linéaires résolus simultanément à chaque cycle de contrôle. Les benchmarks sur simulateur affichent des gains de 18 à 21 fois par rapport aux solveurs CPU de référence, et de 1,4 à 16 fois par rapport aux approches GPU existantes selon la taille des lots. Le solveur a été validé sur matériel réel via un bras manipulateur industriel, ce qui dépasse le stade de la démonstration purement simulée. Ce résultat comble un angle mort persistant dans l'écosystème MPC pour la robotique : les approches GPU actuelles parallélisent efficacement une seule résolution, ou traitent de très grands lots à des cadences sous temps réel, mais aucune ne couvre bien le régime intermédiaire où opèrent de nombreuses applications avancées, notamment la planification de mouvement pour bras industriels, la locomotion d'humanoïdes ou la navigation d'AMR en environnement dynamique. GATO co-conçoit l'algorithme, le logiciel et l'architecture matérielle en exploitant le parallélisme à trois niveaux : bloc, warp et thread CUDA. Les études de cas montrent une meilleure rejection des perturbations et une convergence accélérée, deux métriques directement pertinentes pour les intégrateurs industriels et les équipes de contrôle embarqué. Le MPC est un standard de facto en robotique et en contrôle de procédés, mais son coût computationnel a longtemps limité son usage aux systèmes à dynamique lente ou aux architectures avec CPU puissants dédiés. Les GPU embarqués, désormais présents sur les plateformes robotiques modernes (Jetson, Orin), rendent ce type de co-design pertinent pour le déploiement edge. Aucun acteur industriel nommé n'est associé à ce travail, qui reste pour l'instant une contribution académique ouverte, sans annonce de commercialisation ni partenariat industriel déclaré. La mise à disposition en open source vise à favoriser la reproductibilité et l'adoption par les équipes de recherche et développement, avec un potentiel d'intégration dans des frameworks MPC existants comme Crocoddyl ou ALTRO.

UECrocoddyl, l'un des frameworks MPC cibles d'intégration mentionnés, est développé au LAAS-CNRS (Toulouse, France), ce qui rend GATO directement pertinent pour les équipes de recherche françaises en contrôle de robots.

RecherchePaper
1 source
SoRoMoX : des modèles de robots souples rapides, différentiables et parallélisables
2arXiv cs.RO 

SoRoMoX : des modèles de robots souples rapides, différentiables et parallélisables

SoRoMoX (Soft Robot Models in JAX) a été présente le 10 aout 2026 dans un preprint arXiv (2608.06650), un framework logiciel en Python/JAX pour modéliser des robots souples. L'outil implémenté trois familles de modèles réduits bases sur la théorie des tiges de Cosserat, articules, a déformation constante par morceaux (Piecewise Constant Strain) et a déformation variable (Variable Strain), via une interface unique compilable JIT qui calcule matrices d'inertie, forces gravitationnelles et élastiques, jacobiennes et leurs dérivées. Selon les auteurs, c'est le premier framework de ce type entièrement différentiable par rapport aux états, entrées et paramètres, et capable de tourner directement sur GPU. Les benchmarks annonces montrent des simulations séquentielles jusqu'a 18,1 fois plus rapides que les meilleures alternatives existantes sur CPU, et un débit multiplie par 234,6 en parallélisation GPU. Ces gains ouvrent plusieurs usages testes dans l'étude: identification de système en équilibre statique avec une erreur de position réduite de 66%, apprentissage de forces résiduelles avec 64% de réduction supplémentaire, suivi de trajectoire par couple calcule avec une erreur environ 500 fois inférieure a un contrôle PD sans modèle, optimisation de gains de contrôle abaissant la perte jusqu'a 62%, et contrôle sous contrainte de sécurité limitant la force de contact a 5 newtons contre 33,5 newtons sans cette contrainte. L'entrainement de politiques par apprentissage par renforcement va jusqu'a 7 fois plus vite qu'une référence CPU basée sur PyElastica. Cette avancée compte parce que la robotique souple accusait un retard d'outillage par rapport a la robotique rigide, ou des frameworks différentiables et parallèles sur GPU ont déjà transforme l'entrainement de contrôleurs. Modeliser un robot souple, dont la déformation est théoriquement a degrés de liberté infinis, restait couteux en calcul et peu compatible avec l'optimisation par gradient ou l'entrainement massif en simulation, ce qui freinait le passage du laboratoire aux applications réelles. En rendant ces simulations rapides et différentiables, SoRoMoX ouvre la voie a des boucles de contrôle temps réel, une identification de paramètres plus précise et des garanties de sécurité formelles, utiles pour des robots destines a manipuler des objets fragiles ou a interagir avec des humains. C'est un signal pour les intégrateurs qui évaluent la robotique souple en manutention délicate ou en préhension adaptative: le logiciel, longtemps le vrai frein, commence a rattraper la théorie. Le papier le précise lui-même: la théorie des modèles réduits bases sur les tiges de Cosserat est déjà bien établie, ce n'est pas elle qui limitait le domaine mais l'absence d'implémentations numériques compatibles avec les workflows de contrôle modernes. La référence de comparaison citée est PyElastica, bibliothèque CPU non différentiable dédiée aux tiges discrètes. SoRoMoX reste a ce stade une publication de recherche accompagnée de son code, sans annonce de produit commercial ni de déploiement industriel: une preuve de performance sur benchmarks internes, pas encore une validation a grande échelle sur matériel physique. Les suites évoquées par les auteurs portent sur l'intégration de cet outil dans des pipelines complets de contrôle et d'apprentissage pour robots souples, avec une validation attendue sur des plateformes réelles.

RecherchePaper
1 source
Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité
3arXiv cs.RO 

Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité

Des chercheurs ont publié sur arXiv (2512.21109v2) une méthode d'optimisation du contrôle prédictif par modèle (MPC) dans MuJoCo, le simulateur physique open source de DeepMind, largement utilisé en robotique. Le coeur de la contribution est l'intégration de WASP (Web of Affine Spaces), une approche de calcul de dérivées, comme remplacement direct de la différentiation finie (FD) dans la bibliothèque MJPC (MuJoCo MPC). Les expériences montrent un gain de vitesse allant jusqu'à 2x par rapport au backend FD lorsque WASP est couplé à des planificateurs basés sur les dérivées, notamment iLQG (iterative Linear-Quadratic-Gaussian). Les tests couvrent plusieurs morphologies de robots avec des systèmes à grand nombre de degrés de liberté (DOF), contexte dans lequel FD devient particulièrement coûteux. L'implémentation est publiée en open source et s'intègre sans modification d'architecture dans MJPC existant. L'enjeu est technique mais concret : la différentiation finie est historiquement le goulot d'étranglement du MPC en temps réel sur des systèmes complexes, car elle nécessite de nombreuses évaluations du simulateur pour estimer les gradients. WASP contourne ce problème en réutilisant les informations de calculs de dérivées précédents, ce qui est particulièrement adapté aux mises à jour itératives et incrémentales du MPC. En pratique, cela signifie qu'un contrôleur MPC peut fonctionner à des fréquences plus élevées ou sur des robots avec davantage de degrés de liberté sans augmenter le budget computationnel, un facteur déterminant pour le déploiement sur matériel réel. Les auteurs rapportent également que WASP surpasse les planificateurs stochastiques par échantillonnage de MJPC sur les tâches d'évaluation, en fiabilité et en efficacité, ce qui renforce l'argument en faveur des méthodes basées sur les gradients lorsque ceux-ci sont calculables de façon robuste. MJPC est l'implémentation de référence du MPC sur MuJoCo, et MuJoCo lui-même est devenu le simulateur standard dans la recherche en locomotion et manipulation depuis son acquisition par DeepMind en 2021 et son passage en open source. La différentiation finie y était utilisée faute de meilleures alternatives efficaces pour des simulateurs de contact. WASP a été introduit récemment comme méthode générique de calcul de dérivées approximées en séquence, et ce papier constitue sa première intégration documentée dans un framework MPC robotique établi. Les concurrents directs sur le terrain du MPC différentiable incluent des approches comme Dojo ou MJX (version JAX de MuJoCo permettant la différentiation automatique), mais WASP se positionne comme solution sans réécriture du simulateur sous-jacent. Les prochaines étapes probables sont l'évaluation sur du matériel réel et l'extension à des scènes de contact plus complexes, qui restent le cas limite critique pour tout simulateur physique.

RecherchePaper
1 source
DR-MPC : commande prédictive rapide et réalisable à dynamique relâchée pour la locomotion des robots à pattes
4arXiv cs.RO 

DR-MPC : commande prédictive rapide et réalisable à dynamique relâchée pour la locomotion des robots à pattes

Des chercheurs ont publié le 18 septembre 2026 sur arXiv (arXiv:2609.20035v1) un article présentant DR-MPC (dynamics-relaxed model prédictive control), une nouvelle formulation de commande prédictive pour la locomotion des robots à pattes, accompagnée d'un solveur de points intérieurs (IPM) conçu sur mesure. La méthode déplace les contraintes d'égalité de dynamique et les contraintes d'entrée affines dans des pénalités quadratiques, ne conservant que les contraintes de type boîte non vides, ce qui garantit la faisabilité de l'optimisation par construction. Le programme quadratique résultant présente une matrice hessienne en forme de bloc-flèche, permettant d'éliminer les directions d'état et de sortie affine via un complément de Schur ; le solveur ne factorise que le système de commande réduit, après élimination des forces de contact aux pattes en appui et un séquencement des mouvements aligné sur les contacts. Sur les implémentations testées avec la même formulation DR-MPC, la méthode affiche une accélération médiane de bout en bout de 16,0 fois par rapport au solveur HPIPM et de 4,4 fois par rapport à OSQP, pour des performances de locomotion comparables en simulation. Le temps de cycle médian embarqué atteint 4,4 millisecondes, validé sur un quadrupède Unitree Go1. Le code doit être publié en open source après parution de l'article. Pour l'industrie des robots à pattes, la vitesse d'exécution de la commande prédictive embarquée reste un goulot d'étranglement direct : un cycle de 4,4 ms permet des fréquences de contrôle plus élevées, des allures plus dynamiques et potentiellement du calcul embarqué moins coûteux. La comparaison n'est pas faite contre une démonstration marketing mais contre deux solveurs déjà largement utilisés dans la communauté robotique, HPIPM et OSQP, ce qui donne à ce gain de vitesse une valeur d'ingénierie concrète plutôt qu'une simple annonce. La validation reste toutefois limitée à la simulation et à un seul quadrupède de recherche, sans généralisation démontrée à des plateformes plus lourdes ni à des humanoïdes. Le travail s'inscrit dans la lignée des recherches en commande prédictive pour la locomotion à pattes, domaine où HPIPM et OSQP servent de références académiques établies depuis plusieurs années. Aucune entreprise n'est associée à cette publication, qui reste un travail de recherche académique sans calendrier de commercialisation annoncé. Le choix du Unitree Go1, plateforme quadrupède abordable très répandue en laboratoire, facilite la reproductibilité mais limite la portée immédiate des résultats à ce segment de robots légers.

RecherchePaper
1 source