Aller au contenu principal
RecherchearXiv cs.RO 

Amortissement de l'optimisation de trajectoire pour la MPC résiduelle via différentiation implicite du contact

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Cette étude publiée sur arXiv (2607.24959v1) s'attaque à un goulot d'étranglement classique de la robotique de contact : l'optimisation de trajectoire dans des simulateurs différentiables. Les chercheurs introduisent une méthode de dérivation implicite assistée par différentiation automatique (AD), appliquée au moteur MuJoCo MJX et fondée sur le théorème des fonctions implicites (IFT). Contrairement aux différences finies, coûteuses et sensibles au choix du pas, ou au déroulement complet de l'AD à travers un solveur de contact itératif, qui fait exploser la trace de calcul stockée en mémoire, leur approche différencie directement le résidu de stationnarité à la solution convergée, sans reconstruire à la main les systèmes KKT propres à chaque solveur. Résultat mesuré : la mémoire temporaire compilée reste quasi constante quel que soit l'effort du solveur, avec moins de 4% de variation entre une et dix itérations, contre une croissance de 10,6 fois pour l'AD déroulée classique. Le gain s'accentue avec la complexité du problème : 20 fois moins de mémoire à 256 contacts actifs, 6 fois moins à 16 contacts et 96 degrés de liberté.

L'équipe va plus loin avec une technique de "distillation d'optimiseur" pour le contrôle prédictif résiduel (residual MPC) : un iLQR complet, calculé en batch sur tout l'horizon temporel, est condensé en une politique qui guide ensuite un iLQR résiduel à horizon court, bien moins coûteux à exécuter en ligne. Sur trois bancs d'essai (Finger, bras Franka, quadrupède Unitree), cette approche améliore le taux de succès à six pas de 28 à 98 points de pourcentage par rapport à un iLQR standard. Pour les équipes qui développent du contrôle robotique riche en contacts, manipulation fine, locomotion sur terrain irrégulier, l'intérêt est double : réduire drastiquement l'empreinte mémoire permet de faire tourner des simulations différentiables à plus grande échelle ou en temps réel embarqué, tandis que la distillation d'optimiseur offre une voie pour transférer la qualité d'une planification hors-ligne coûteuse vers un contrôleur exécutable en boucle rapide sur le robot.

Le travail s'inscrit dans la lignée des efforts récents autour de MuJoCo MJX et de la simulation différentiable pour la robotique, un axe de recherche actif depuis que des laboratoires comme DeepMind ou des groupes académiques cherchent à exploiter les gradients de simulateurs physiques pour accélérer l'apprentissage et la planification, plutôt que de s'appuyer uniquement sur l'apprentissage par renforcement sans modèle. La méthode proposée ici comble un vide méthodologique entre les approches génériques mais gourmandes en mémoire et les dérivations KKT sur mesure, difficiles à maintenir et à généraliser d'un solveur à l'autre. Les auteurs ne précisent pas de calendrier de publication du code ni de partenariat industriel, mais la validation croisée sur des plateformes hétérogènes (doigt robotique, bras manipulateur Franka, quadrupède Unitree) suggère une ambition de généralisation au-delà d'un cas d'usage unique, avec un potentiel d'intégration dans des piles de contrôle MPC pour la manipulation ou la locomotion dynamique.

Dans nos dossiers

À lire aussi

IMPACT : Lagrangien augmenté à ensemble actif implicite pour l'optimisation rapide de trajectoires à contact implicite
1arXiv cs.RO 

IMPACT : Lagrangien augmenté à ensemble actif implicite pour l'optimisation rapide de trajectoires à contact implicite

Des chercheurs ont déposé mi-mai 2026 sur arXiv (arXiv:2605.09127) un préprint décrivant IMPACT, un nouvel algorithme d'optimisation de trajectoires en contact implicite (CITO). La méthode repose sur une formulation augmented-Lagrangian pour résoudre les programmes mathématiques à contraintes de complémentarité (MPCC) qui gouvernent la planification de mouvements impliquant des contacts physiques, sans qu'il soit nécessaire de spécifier à l'avance la séquence des modes de contact. L'implémentation en C++ a été évaluée sur deux benchmarks open-source de référence, CITO et CI-MPC (model predictive control implicite en contact) : sur le premier, IMPACT affiche des accélérations comprises entre 2,9x et 70x par rapport aux solveurs existants les plus compétitifs, avec une moyenne géométrique de 13,8x. Sur les tâches de manipulation dextère en simulation (CI-MPC), la qualité du contrôle progresse également. Une validation sur robot physique a été conduite sur une tâche de poussée d'un objet en T, tâche simple mais représentative du problème de contact. La CITO est une approche unifiée pour planifier et contrôler des robots dans des environnements à contacts multiples, qu'il s'agisse de manipulation d'objets complexes ou de locomotion. Son atout principal est de ne pas imposer de séquence de modes de contact en entrée, éliminant une étape d'ingénierie manuelle coûteuse et peu robuste aux situations imprévues. Le verrou historique était le mauvais conditionnement numérique des MPCC sous-jacents, qui rendait les solveurs génériques instables et prohibitivement lents pour des applications embarquées. Un gain de 13,8x en moyenne géométrique sur des benchmarks standardisés est un signal fort : IMPACT rapproche le CI-MPC d'une viabilité en boucle fermée rapide. Pour les intégrateurs et les équipes de robotique dextère, c'est une avancée concrète vers des manipulateurs capables de gérer des contacts variés sans reprogrammation manuelle à chaque changement de tâche. La CITO mobilise des équipes académiques depuis une décennie, notamment au MIT, à Carnegie Mellon et à ETH Zurich. Les solveurs polyvalents comme IPOPT ou SNOPT montraient des limites sévères sur les MPCC liés au contact ; des travaux récents comme CALIPSO avaient amorcé des améliorations, mais sans garanties de stationnarité systématiques ni gains de vitesse aussi prononcés. IMPACT introduit une identification implicite des branches de modes de contact à la volée pendant les itérations d'optimisation, ce qui constitue sa différence algorithmique principale. Le code est soumis aux benchmarks publics, ce qui permettra à la communauté de reproduire et d'auditer les chiffres annoncés. La suite logique serait l'intégration dans des contrôleurs embarqués sur robots manipulateurs industriels ou humanoïdes, où la planification en contact temps réel reste un problème largement ouvert.

RecherchePaper
1 source
Optimisation globale de trajectoire par échantillonnage pour la manipulation à contact riche via KernelSOS
2arXiv cs.RO 

Optimisation globale de trajectoire par échantillonnage pour la manipulation à contact riche via KernelSOS

Un groupe de chercheurs a publié le 27 avril 2026 sur arXiv (arXiv:2604.27175) une méthode d'optimisation de trajectoires baptisée Global-MPPI, dédiée aux tâches de manipulation dites "contact-rich", des scénarios où le robot entre en contact répété avec son environnement, comme pousser, assembler ou manipuler des objets en main. Le cadre combine deux niveaux : une exploration globale via optimisation kernel sum-of-squares (KernelSOS), suivie d'un raffinement local par la méthode MPPI (Model-Predictive Path Integral). Pour gérer la non-régularité des paysages d'optimisation liée aux dynamiques de contact hybrides, les auteurs introduisent un lissage progressif par log-sum-exp, qui fait évoluer le problème d'un objectif régularisé vers l'objectif non-lisse original. Les tests portent sur deux benchmarks haute dimension à horizon long : la tâche PushT et la manipulation dextère in-hand. Les résultats affichent une convergence plus rapide et des coûts finaux inférieurs aux méthodes de référence, mais uniquement en simulation. Le verrou résolu est structurel : sans mécanisme d'exploration globale, les méthodes par échantillonnage comme MPPI convergent facilement vers de mauvais minima locaux. Pour la manipulation contact-rich, composant critique des bras industriels, des mains robotiques et des humanoïdes, ce phénomène génère des trajectoires sous-optimales dans des environnements géométriquement complexes. L'approche KernelSOS apporte une garantie formelle de couverture de l'espace des solutions là où les variantes purement stochastiques de MPPI restent dépendantes de l'initialisation. La combinaison avec le lissage adaptatif traite directement les discontinuités de contact, qui rendent les méthodes de gradient classiques inapplicables. Le transfert sim-to-real n'est pas évalué dans ce travail, ce qui constitue la principale limite à ce stade. MPPI a été développé à Georgia Tech par Grady Williams et Evangelos Theodorou (2016-2018) et s'est imposé en MPC stochastique temps réel via des implémentations GPU massivement parallèles. L'optimisation sum-of-squares (SOS) est issue des travaux de Parrilo (MIT) et Lasserre (LAAS-CNRS, Toulouse). Global-MPPI constitue le premier cadre à combiner explicitement ces deux familles dans un pipeline de planification de manipulation. Sur le plan concurrentiel, l'approche se positionne face à la Cross-Entropy Method (CEM), aux planificateurs par diffusion comme Pi-0 de Physical Intelligence ou Diffusion Policy, ainsi qu'aux optimiseurs de trajectoires différentiables (Drake, trajopt). Ce preprint n'a pas encore été soumis à une conférence identifiée et aucun code public ni déploiement hardware n'est annoncé à ce stade.

UELes fondements SOS de cette méthode sont issus des travaux de Lasserre au LAAS-CNRS (Toulouse), mais le preprint n'implique aucune institution française ou européenne identifiée et reste sans impact opérationnel direct sur la France/UE à ce stade.

RecherchePaper
1 source
Ajustement précis de trajectoire par apprentissage résiduel DAgger sensible à la force pour l'insertion de précision avec contrôle d'impédance
3arXiv cs.RO 

Ajustement précis de trajectoire par apprentissage résiduel DAgger sensible à la force pour l'insertion de précision avec contrôle d'impédance

Des chercheurs présentent TER-DAgger (Trajectory Editing Residual Dataset Aggregation), une méthode d'apprentissage par imitation conçue pour les tâches d'insertion de précision en robotique, où le contact physique rend l'apprentissage classique instable. Le système combine trois éléments : une édition de trajectoire par optimisation qui fusionne en douceur les trajectoires générées par la politique du robot avec les corrections humaines, un mécanisme d'anticipation des échecs basé sur la force qui ne déclenche une intervention humaine que lorsque la force mesurée à l'effecteur diverge de la force prédite, et une exécution sous contrôle en impédance cartésienne pour garantir un comportement souple et sûr lors des contacts. Dans des expériences en simulation et en conditions réelles sur des tâches d'insertion, TER-DAgger améliore le taux de réussite moyen de plus de 37 % par rapport aux méthodes de référence que sont le clonage comportemental simple, la correction guidée par un humain, le réentraînement complet et le fine-tuning. L'enjeu dépassé ici est le "covariate shift" : un robot entraîné par imitation dérive souvent des trajectoires démontrées dès qu'il rencontre un état légèrement différent, et sa récupération nécessite jusqu'ici la supervision continue d'un opérateur humain, ce qui limite fortement le passage à l'échelle. En ne sollicitant l'humain que lorsque l'écart de force le justifie, TER-DAgger réduit la charge de supervision tout en conservant la robustesse du DAgger classique. Pour les intégrateurs industriels visant l'assemblage fin, le montage de composants électroniques ou toute tâche à tolérance serrée, cela rapproche l'apprentissage par imitation d'un déploiement viable sans ingénieur dédié en permanence sur la boucle de correction. La méthode s'inscrit dans la lignée du DAgger original, qui corrige le décalage de distribution par interrogation active de l'expert, mais que son coût de supervision continue rendait peu pratique. TER-DAgger cible spécifiquement les tâches riches en contact, un terrain où les politiques de type VLA et les approches de clonage comportemental peinent encore à généraliser au-delà des démonstrations. L'article, publié sur arXiv, ne mentionne pas de partenariat industriel ni de déploiement en usine à ce stade ; il s'agit d'un résultat de recherche appelé à être testé sur des plateformes robotiques plus variées.

RecherchePaper
1 source
PISTO : inférence proximale pour l'optimisation stochastique de trajectoires
4arXiv cs.RO 

PISTO : inférence proximale pour l'optimisation stochastique de trajectoires

Des chercheurs ont publié sur arXiv (arXiv:2605.07215) un algorithme de planification de trajectoires robotiques appelé PISTO (Proximal Inference for Stochastic Trajectory Optimization). Leur contribution centrale est de démontrer que STOMP, méthode stochastique classique, minimise implicitement une divergence KL par rapport à une distribution de trajectoires de Boltzmann, révélant une structure d'inférence variationnelle (VI) sous-jacente. PISTO exploite cette observation en ajoutant une régularisation KL entre propositions gaussiennes successives, ce qui stabilise les mises à jour et produit une interprétation de type trust-region. L'algorithme reste entièrement sans dérivées et s'appuie sur un échantillonnage Monte Carlo à pondération d'importance. Sur les benchmarks de planification de bras robotiques, PISTO atteint 89 % de taux de succès contre 63 % pour CHOMP et 68 % pour STOMP, tout en générant des trajectoires plus courtes et plus lisses, à deux fois la vitesse des méthodes stochastiques concurrentes. Des validations complémentaires sur des tâches de locomotion et manipulation contact-rich en simulation MuJoCo montrent des performances supérieures aux baselines CEM et MPPI en termes de récompense cumulée. Pour les intégrateurs et ingénieurs en planification de mouvement, l'absence totale de dérivées est une caractéristique décisive : elle permet de traiter des fonctions de coût non-différentiables ou discontinues, fréquentes dans les environnements industriels réels (détection de collisions, zones interdites, contraintes non paramétriques). Le gain de vitesse d'un facteur deux par rapport aux méthodes stochastiques existantes réduit directement les temps de cycle dans les applications de planification en ligne, point critique pour la robotique collaborative et les systèmes pick-and-place haute cadence. La validation sur MuJoCo avec contacts ouvre des perspectives vers la locomotion humanoïde et la manipulation dextre, bien que ces résultats restent pour l'instant entièrement simulés, sans validation sur matériel physique. PISTO s'inscrit dans la lignée de STOMP (développé chez Willow Garage et présenté à l'ICRA 2011) et de ses concurrents gradient-based tels que CHOMP, ainsi que des méthodes stochastiques modernes MPPI (popularisé par NVIDIA en 2017) et CEM. Soumis comme preprint arXiv sans révision par les pairs à ce stade, l'article n'annonce ni déploiement industriel ni partenariat commercial. Son impact pratique dépendra de la mise à disposition du code source et de validations expérimentales sur robot réel, étapes absentes de la publication actuelle.

RecherchePaper
1 source