Aller au contenu principal
AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal
RecherchearXiv cs.RO 

AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent AdaReP, une méthode qui modifie la façon dont les systèmes de controle predictif (MPC) bases sur des modèles du monde neuronaux décident de recalculer leur plan d'action. Habituellement, ces systèmes replanifient a chaque pas de temps pour limiter l'accumulation d'erreurs de prédiction, ce qui génère une charge de calcul importante. AdaReP est présente comme un wrapper "sans entrainement" (training-free) qui s'ajoute au-dessus d'un modèle du monde et d'un planificateur déjà appris, sans les modifier. Le système ajuste en continu la tolérance de replanification en fonction de l'écart mesure entre la trajectoire actuelle et le plan mis en cache, et d'une estimation locale de la sensibilité de la dynamique. Les auteurs valident l'approche sur trois types de taches : planification dans l'espace image, contrôle dans l'espace latent, et manipulation robotique réelle. Sur une étude physique de 50 essais avec un bras manipulateur, AdaReP réduit de plus de 80% le nombre de requêtes au planificateur tout en maintenant des performances comparables a une replanification systématique. Le papier, référence arXiv:2606.23079v2, est une version mise a jour d'une publication antérieure.

Cette réduction cible un goulot d'étranglement connu des architectures MPC couplées a des modèles du monde neuronaux : chaque appel au planificateur, souvent un réseau lourd, coute cher en temps et en énergie, ce qui limite le déploiement embarque en temps réel sur des robots ou systèmes autonomes. En montrant qu'un plan mis en cache peut être réutilisé la plupart du temps sans dégrader la performance, AdaReP fournit un argument concret contre l'hypothèse selon laquelle replanifier a chaque pas serait nécessaire pour rester robuste aux erreurs de prédiction. Pour les intégrateurs et équipes de recherche, l'intérêt pratique tient au fait que la méthode ne nécessite ni reentrainement du modèle du monde ni modification du planificateur existant, ce qui facilite son adoption sur des piles déjà en production. Le gain mesure sur un robot physique et non uniquement en simulation répond a une critique fréquente du secteur : l'écart entre démonstrations simulées et comportement réel.

Le problème s'inscrit dans la lignée des travaux sur le controle predictif base sur l'apprentissage, ou l'essor des modèles du monde neuronaux pour la robotique rend la replanification systématique de plus en plus couteuse a mesure que ces modèles gagnent en taille. Les auteurs formalisent le compromis entre réutilisation de plan et dérivé de prédiction via un cadre de regret dynamique base sur la perturbation, montrant que la pénalité d'un plan périmé dépend de trois facteurs : la tolérance de réutilisation choisie, l'écart de prédiction accumule depuis la dernière replanification, et la sensibilité locale de la dynamique. Le papier ne cite ni implémentation industrielle ni partenaire commercial, et aucun acteur français ou européen n'est mentionne dans cette publication de recherche méthodologique. Les suites évoquées concernent l'extension a d'autres familles de planificateurs et de modèles du monde, la validation restant pour l'instant limitee aux trois bancs d'essai décrits.

À lire aussi

Mouvement pour manipulateurs mobiles franchissant des portes par commande prédictive de modèle
1arXiv cs.RO 

Mouvement pour manipulateurs mobiles franchissant des portes par commande prédictive de modèle

Ouvrir une porte reste un goulot d'étranglement classique pour les robots mobiles déployés en environnement humain (bureaux, hôpitaux, entrepôts à accès cloisonnés), car la base doit se déplacer tout en maintenant le bras en prise sur la poignée sans désaligner ou lâcher la porte. Voici le texte final : Des chercheurs publient sur arXiv (2608.00206v1) un cadre de planification de mouvement pour manipulateurs mobiles franchissant des portes, coordonnant base roulante et bras robotique pour ouvrir et traverser aussi bien des portes à pousser que des portes à tirer. L'approche modélise le robot et la porte comme un système dynamique couplé, résolu par un contrôle prédictif par modèle (MPC) non linéaire qui génère des trajectoires dynamiquement faisables et sans collision. Plutôt que de modéliser explicitement la cinématique du bras, les auteurs imposent la faisabilité de la manipulation via une simple contrainte de pénalité dans l'optimisation. Le papier ne précise ni la plateforme robotique, ni le nombre de degrés de liberté, ni de temps de cycle chiffré, et la validation se limite à des simulations complétées par une seule expérience matérielle. Ouvrir une porte reste un goulot d'étranglement classique pour les robots mobiles déployés en environnement humain (bureaux, hôpitaux, entrepôts à accès cloisonnés), car la base doit se déplacer tout en maintenant le bras en prise sur la poignée sans désaligner ou lâcher la porte. En évitant une modélisation cinématique explicite du bras, la méthode simplifie l'optimisation et pourrait se transférer plus facilement d'une architecture de bras à une autre. Pour les intégrateurs d'AMR augmentés d'un manipulateur, ce type de travail cible un besoin concret d'autonomie de dernier mètre, le franchissement de porte figurant parmi les tâches les plus souvent citées comme non résolues en déploiement logistique ou de service. Le papier ne fournit toutefois qu'une démonstration matérielle isolée, sans test sur des portes non calibrées, des poignées variées ou des charges réalistes, ce qui laisse ouvert l'écart habituel entre preuve de concept académique et robustesse industrielle. Ce travail s'inscrit dans un champ de recherche actif sur la manipulation mobile, où plusieurs équipes testent le MPC pour coordonner base et bras en temps réel, en alternative aux pipelines classiques planifiant séparément base et manipulateur. L'article ne précise ni affiliation académique ou industrielle, ni comparaison quantitative avec des méthodes concurrentes de franchissement de porte, et aucun acteur français ou européen n'y est cité. La suite logique pour ce type de recherche serait une validation sur davantage de configurations de portes puis un test en flotte sur robot réel, des étapes qui restent à ce stade non annoncées.

RecherchePaper
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
2arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source
CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède
3arXiv cs.RO 

CacheMPC : commande prédictive par modèle certifiée avec cache pour la locomotion quadrupède

Une équipe de recherche propose CacheMPC, un mécanisme de mise en cache certifiée pour le Model Predictive Control (MPC) appliqué à la locomotion de robots quadrupèdes, publié sur arXiv (2606.28300). Le MPC constitue la couche prédictive standard dans les contrôleurs hiérarchiques de quadrupèdes, mais son solveur QP (programmation quadratique) recalculé à chaque cycle constitue un goulot d'étranglement sur processeur embarqué. Certified CacheMPC adresse ce problème via un cache indexé par Locality-Sensitive Hashing (LSH) de trajectoires de forces de contact, partitionné par mode de contact. Chaque entrée récupérée est acceptée uniquement si un certificat a posteriori confirme la faisabilité primale et une borne supérieure sur la sous-optimalité via le dual gap lagrangien. Le contrôleur combine récupération certifiée top-K, solveur QP à deadline bornée, et fallback sur la dernière solution certifiée. Validé sur un Unitree Go2, le système a été évalué sur 2 038 essais MuJoCo en froid contrôleur, dont une campagne de 600 essais à n=50 sur trois cellules à la frontière d'échec, puis déployé physiquement sur le NVIDIA Orin NX embarqué du robot. Le cache sans filtrage atteint un gain médian de 25x en temps de calcul en simulation, et 18,7x sur hardware réel. L'enjeu industriel est direct : MPC haute fréquence sur SoC embarqué standard (Orin NX, environ 10-15W) sans recourir à un ASIC dédié ou à une approximation neuronale. Un facteur 18,7x de réduction du temps de solve ouvre la porte à des boucles de contrôle plus rapides sur des plateformes commerciales comme le Go2, utilisé massivement dans la recherche académique et les pilotes industriels légers. La certification formelle distingue cette approche des méthodes d'apprentissage du MPC (neural MPC, learning-based warm-starting) qui offrent des speedups similaires mais sans garantie exploitable. Nuance importante : la contribution du certificat à la stabilité en boucle fermée n'est pas statistiquement résolvable à la taille d'échantillon actuelle (n=50). Aucune différence significative n'a été détectée entre les variantes avec et sans cache, ce qui est honnête scientifiquement mais laisse la question de sécurité formelle ouverte. Le MPC pour locomotion quadrupède s'est imposé depuis les travaux d'ETH Zurich (ANYmal) et du MIT (Cheetah), avec des implémentations ouvertes comme ACADOS ou OSQP qui restent les références en solve embarqué. CacheMPC s'inscrit dans un courant distinct : plutôt qu'accélérer le solveur ou substituer le MPC par un réseau de neurones, il exploite la répétabilité des gaits locomoteurs pour réutiliser des solutions passées. Les concurrents directs incluent les approches de warm-starting par apprentissage (DeepMPC, L4DC 2024) et les approximateurs explicites de MPC. Le Unitree Go2 est devenu le benchmark de facto à petit budget pour ce type de validation hardware. Les prochaines étapes naturelles seraient une campagne avec n significativement plus grand pour trancher sur la sécurité certifiée, et une extension aux bipèdes ou aux transitions de mode de contact plus complexes.

RecherchePaper
1 source
TRACER : navigation sociale multirobot adaptative par prédiction conjointe et replanification interactive
4arXiv cs.RO 

TRACER : navigation sociale multirobot adaptative par prédiction conjointe et replanification interactive

Un nouveau framework de navigation multi-robot baptisé TRACER a été présenté dans un article publié sur arXiv le 17 septembre 2026 (référence 2609.18776), destiné aux flottes de robots évoluant dans des espaces partagés avec des humains. Le système fonctionne selon un principe d'horizon glissant bidirectionnel : il évalue plusieurs trajectoires candidates pour l'équipe de robots à l'aide d'un modèle probabiliste par entité, qui distingue l'effet propre de chaque robot des interactions par paires non additives avec les personnes à proximité. Une fois le début de la trajectoire choisie exécuté, TRACER met à jour des croyances persistantes, liées à l'identité de chaque entité observée, sur ses modes de réponse latents, à partir des réactions réellement mesurées. Ces croyances actualisées guident ensuite l'évaluation des trajectoires suivantes selon des critères de sécurité probabiliste et de coût sensible aux réponses humaines. Les tests ont été menés sur SocialGym2, un benchmark de référence en navigation sociale multi-robot, sans précision sur le nombre de robots engagés ni sur les temps de calcul. Les auteurs rapportent trois résultats principaux : TRACER capture mieux les effets d'interaction non additifs entre robots qu'un prédicteur additif de capacité équivalente, les croyances persistantes et cohérentes par identité améliorent la prédiction des réponses humaines et le replanning qui en découle, et le framework complet augmente le taux de trajets sans collision par rapport à une base de référence où chaque robot planifie indépendamment. Pour les intégrateurs de flottes de robots mobiles autonomes en entrepôt, hôpital ou espace public, ce travail cible une limite connue : les méthodes existantes traitent séparément la prédiction conditionnée à l'action, la planification multi-robot et l'adaptation en ligne, ce qui empêche de boucler prédiction et exécution en temps réel face à des humains non coopératifs. Cette recherche s'inscrit dans la continuité des travaux sur la navigation sociale robotique qui cherchent à dépasser les modèles de force sociale classiques et les approches de prédiction conditionnée à l'action, en unifiant prédiction et planification dans une seule boucle fermée. Classé comme contribution nouvelle sur arXiv, l'article reste à ce stade une validation purement en simulation via SocialGym2, sans annonce de pilote industriel, de partenaire ou de robot physique associé. Aucun acteur français ou européen comme Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools n'apparaît dans ces travaux. L'étape suivante attendue pour ce type de recherche est le passage à des tests avec des robots réels face à des humains non scénarisés, écart qui reste le plus difficile à combler entre simulation et déploiement opérationnel.

RecherchePaper
1 source