Aller au contenu principal
RecherchearXiv cs.RO 

MPC filtré par sécurité : Koopman distribué pour la commande

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose une architecture de contrôle distribué pour flottes de robots d'entrepôt qui sépare la prédiction de trajectoire et la garantie de sécurité anticollision, deux fonctions habituellement fusionnées dans le contrôle prédictif distribué (DMPC) et donc vulnérables ensemble à la perte de paquets réseau. Dans ce schéma, les trajectoires reçues des robots voisins alimentent un modèle Koopman-MPC pour la prédiction, tandis qu'un programme quadratique (QP) à contraintes strictes, basé uniquement sur la détection locale et la géométrie des étagères, projette la commande finale appliquée au robot. Ce filtre calcule l'accélération constante minimale nécessaire pour garantir une marge de sécurité non négative pendant un intervalle de maintien d'ordre zéro, sans avoir à échanger de décisions de sécurité entre robots. Testée en simulation sur un entrepôt à huit robots avec un modèle Koopman figé, une dynamique non linéaire, des contraintes de vitesse et d'obstacles, une période de contrôle de 120 millisecondes et des pertes de paquets simulées, l'architecture complète évite toute collision sur 20 essais sur 20 et atteint les 160 objectifs assignés aux robots, contre une seule réussite sur 20 pour la version Koopman-MPC prédictive seule, sans le filtre final. L'ensemble des 38 400 tests de faisabilité en ligne passe avec succès, et chaque QP local trouve une solution.

Ce résultat répond à une limite concrète des flottes d'AMR (robots mobiles autonomes) en entrepôt: la coordination distribuée classique s'effondre dès qu'un lien de communication se dégrade, puisque la sécurité dépend alors des mêmes données que la trajectoire. En démontrant qu'un filtre de sécurité local, indépendant du réseau, peut maintenir un taux de collision nul même en cas de perte de paquets, les auteurs offrent une piste directement exploitable par les intégrateurs de flottes logistiques, où la fiabilité prime sur la performance brute. Les tests de montée en charge jusqu'à 16 robots restent sans collision et faisables, la limite apparaissant seulement à 20 robots, ce qui trace une frontière opérationnelle claire pour un déploiement à l'échelle.

Ce travail s'inscrit dans la lignée des recherches sur le contrôle prédictif basé sur l'opérateur de Koopman, une technique qui linéarise des dynamiques non linéaires pour accélérer le calcul en temps réel, appliquée ici à la navigation multi-robots en environnement contraint par des étagères. L'article, publié en prépublication sur arXiv (identifiant 2609.27463), reste à ce stade une validation en simulation; les auteurs mentionnent des tests complémentaires en détection bornée et en robots à entraînement différentiel comme premières étapes vers une robustesse accrue avant un éventuel déploiement réel.

Impact France/UE

Aucun acteur français ou européen n'est implique, mais cette approche de sécurité réseau-indépendante intéressé directement les intégrateurs européens de flottes AMR en entrepôt.

Dans nos dossiers

À lire aussi

Robots quadrupèdes : transport coopératif par NMPC distribué et critique de sécurité basé sur ADMM
1arXiv cs.RO 

Robots quadrupèdes : transport coopératif par NMPC distribué et critique de sécurité basé sur ADMM

Une équipe de recherche publie sur arXiv (2607.17007v1, dépôt du 24 juillet 2026) un framework de commande prédictive non linéaire distribuée (DNMPC) pour le transport coopératif de charges par des équipes de robots quadrupèdes. Le système robotique et la charge partagée sont modélisés comme un réseau dynamiquement couplé par des contraintes holonomes rigides. Le problème d'optimisation centralisé à horizon fini est décomposé en sous-problèmes NMPC locaux résolus en parallèle et coordonnés via ADMM (alternating direction method of multipliers), avec un consensus imposé à la fois sur l'état de la charge et sur les torseurs d'interaction, en intégrant les contraintes de couplage holonome au niveau accélération. La sécurité (évitement d'obstacles pour les robots et pour la charge) est assurée par des fonctions barrières de contrôle d'ordre supérieur (HOCBF). Le framework est validé en simulation avec des équipes de deux, trois et quatre robots dans des environnements encombrés, puis testé en temps réel sur des équipes de deux et trois robots sous incertitude de charge et perturbations externes, avec une réduction jusqu'à 23% du temps de résolution du problème d'optimisation non linéaire par rapport à une NMPC centralisée, pour des performances en boucle fermée comparables. L'intérêt principal est la scalabilité: la commande centralisée devient rapidement le goulot d'étranglement quand le nombre de robots coopérants augmente, ce qui limite le transport collectif de charges à des cas de petite échelle. En distribuant le calcul tout en conservant un consensus explicite sur l'état de la charge, plutôt qu'un consensus limité aux seuls torseurs d'interaction comme dans des travaux antérieurs, les auteurs améliorent le suivi de trajectoire de la charge et la coordination, un point que les études d'ablation confirment. La robustesse démontrée aux délais de communication est également significative pour un déploiement réel, où les liaisons sans fil entre robots ne sont jamais parfaites. Le travail s'inscrit dans la lignée des recherches sur la NMPC distribuée par ADMM et les barrières de contrôle pour la sécurité, déjà explorées pour des robots à roues ou aériens, mais adaptées ici aux contraintes spécifiques des quadrupèdes coopérant sur une charge rigide. Il s'agit d'une contribution académique, sans annonce de pilote industriel ni de partenaire commercial identifié; les suites logiques évoquées par les auteurs concernent le passage à des équipes plus grandes et des environnements moins structurés.

RecherchePaper
1 source
Approximation de la sécurité sans oracle de sécurité via la commande prédictive par modèle
2arXiv cs.RO 

Approximation de la sécurité sans oracle de sécurité via la commande prédictive par modèle

Des chercheurs ont publié sur arXiv (référence 2510.20955v2) un algorithme permettant de vérifier la sécurité des décisions d'un robot mobile sans disposer d'un oracle de sécurité formel. Les approches classiques exigent soit des contraintes explicitement modélisées, soit des données annotées manuellement comme sûres ou dangereuses, deux méthodes coûteuses en ingénierie et sources d'erreurs. L'algorithme proposé contourne ce besoin via un simulateur : avant d'exécuter une action, le système la projette dans le simulateur vers un état futur, puis utilise l'algorithme Model-Predictive Path Integral (MPPI) pour vérifier l'existence d'un chemin de retour vers un état antérieur de la trajectoire. Sous une hypothèse d'invariance positive sur l'espace des états dangereux, si ce chemin de retour existe, l'état courant est mathématiquement garanti hors de la zone à risque. Les expériences montrent que la méthode approche les performances d'un oracle réel, en limitant notamment les faux négatifs, c'est-à-dire les cas où un état dangereux serait classifié à tort comme sûr. L'enjeu pratique est réel pour le déploiement des AMR (Autonomous Mobile Robots) en environnements industriels non structurés. La dépendance aux annotations manuelles de sécurité constitue un goulot d'étranglement majeur : chaque changement de site ou de configuration peut invalider les contraintes précédemment formulées. En exploitant les contraintes implicites déjà encodées dans les simulateurs physiques modernes, cette approche rend les systèmes de contrôle sûr plus généralisables, sans réécriture à chaque nouveau déploiement. Éliminer les faux négatifs est critique : c'est le scénario où un robot exécute une action jugée sûre à tort, avec des conséquences potentiellement irréversibles en conditions réelles. MPPI est un algorithme de planification par échantillonnage stochastique, initialement développé à Georgia Tech dans les travaux de Grady Williams et Evangelos Theodorou, et depuis repris dans de nombreux travaux sur la navigation autonome et les véhicules sans conducteur. Son utilisation ici comme outil de vérification de réversibilité plutôt que de planification directe constitue l'originalité méthodologique centrale de la contribution. Le travail s'inscrit dans un courant de recherche actif sur la sécurité sans supervision dense, aux côtés des Control Barrier Functions (CBF) appris par données et du safe reinforcement learning. L'article reste une contribution académique avec résultats en simulation uniquement, sans partenaire industriel ni déploiement annoncé. La prochaine étape naturelle serait une validation sur hardware réel dans des environnements aux contraintes implicites complexes et une comparaison quantitative avec des méthodes CBF classiques sur des benchmarks standardisés.

RecherchePaper
1 source
Filtres de Koopman robustes pour un apprentissage par renforcement acteur-critique sûr
3arXiv cs.RO 

Filtres de Koopman robustes pour un apprentissage par renforcement acteur-critique sûr

Une équipe a déposé sur arXiv (2605.26452) Robust Koopman-CBF SAC, un framework de RL sûr pour la robotique qui s'affranchit du modèle dynamique pré-établi. La méthode apprend un prédicteur de Koopman à dimension finie depuis des trajectoires d'expérience, construit des Control Barrier Functions (CBF) dans l'espace "levé" où la dynamique non linéaire devient affine, puis les applique via une couche de programme quadratique (QP) qui corrige minimalement les actions de la politique Soft Actor-Critic (SAC). Une marge résiduelle projetée, estimée sur des rollouts de validation distincts de l'entraînement, compense les erreurs d'approximation inhérentes au modèle Koopman fini. Sur le benchmark CartPole (stabilisation et suivi de trajectoire), le système atteint zéro violation de contrainte tout en égalant ou dépassant les performances d'un SAC non contraint. Sur les tâches de locomotion haute dimension de Safety Gymnasium, les violations diminuent dans certains scénarios, mais les barrières de vitesse du premier ordre et les modèles EDMD linéaires révèlent des limites structurelles non résolues. L'enjeu est concret pour les intégrateurs: déployer des robots autonomes en environnement industriel exige que les contraintes dures (zones interdites, limites articulaires, forces maximales) ne soient jamais violées, y compris pendant la phase d'entraînement et pas seulement en déploiement. Les approches existantes imposent soit un modèle dynamique précis, difficile à obtenir pour des robots complexes, soit des certificats de sécurité conçus à la main par des experts contrôle. Ici, la dynamique est inférée depuis les données, et la linéarité de l'espace Koopman rend les CBF algébriquement tractables sans expertise manuelle. Le zéro violation sur CartPole est reproductible (code disponible sur GitHub), pas une démonstration sélectionnée. Les limitations exposées sur Safety Gymnasium délimitent honnêtement le périmètre de validité: systèmes à dynamique quasi-linéaire et contraintes de vitesse simples, ce qui est plus informatif que beaucoup de publications dans ce domaine. L'opérateur de Koopman a été réintroduit en robotique et en contrôle vers 2017-2020 notamment via les travaux de Brunton, Kaiser et Kutz sur l'EDMD (Extended Dynamic Mode Decomposition). Les CBF ont été formalisées par Aaron Ames et ses collaborateurs à Caltech puis au Georgia Tech, avec une influence croissante dans le contrôle certifié depuis 2017. Dans le RL sûr, les méthodes de référence comme CPO (Constrained Policy Optimization) et TRPO-Lagrangien peinent à garantir des contraintes dures pendant l'entraînement. Ce travail se positionne explicitement comme pont entre ces deux communautés. Les extensions annoncées incluent des CBF d'ordre supérieur pour mieux traiter les contraintes de vitesse, et des modèles Koopman non linéaires ou multi-pas pour les locomotions haute dimension.

RecherchePaper
1 source
Vers des filtres de sécurité latents généraux conditionnés par le langage
4arXiv cs.RO 

Vers des filtres de sécurité latents généraux conditionnés par le langage

Des chercheurs proposent une nouvelle approche de filtrage de sécurité pour les robots pilotés par des modèles vision-langage-action (VLA), détaillée dans un article publié le 1er août 2026 sur arXiv (2608.00315v1). Le système, baptisé filtre de sécurité latent conditionné par le langage, combine un acteur et un critique de sécurité fondés sur la théorie de Hamilton-Jacobi, tous deux conditionnés par des contraintes exprimées en langage naturel plutôt que codées en dur. Les auteurs l'ont testé sur trois tâches en environnement simulé et basé sur la vision : le pick-and-place, l'essuyage de table et l'empilement de blocs. Résultat annoncé : le filtre réduit les violations de contraintes de sécurité et parvient à transférer partiellement son comportement vers des instances de contraintes jamais vues pendant l'entraînement, à condition qu'elles appartiennent aux mêmes familles de contraintes déjà couvertes. Cette approche s'attaque à un vrai goulot d'étranglement industriel : jusqu'ici, chaque filtre de sécurité robotique devait être reconçu ou réentraîné dès que les exigences changeaient, par exemple passer d'un entrepôt à un environnement médical ou ajuster une distance de sécurité selon l'utilisateur. Pour les intégrateurs qui déploient des politiques VLA génériques capables d'exécuter des tâches variées à partir d'une simple instruction textuelle, un filtre reconfigurable par le langage éviterait un cycle de développement coûteux à chaque nouveau cas d'usage ou client. C'est un signal que le secteur cherche désormais à généraliser non seulement les capacités des robots, mais aussi les garde-fous qui les encadrent, un chantier resté à la traîne derrière les progrès spectaculaires des modèles de contrôle eux-mêmes. Le travail s'inscrit dans la lignée des filtres de sécurité par réchabilité de Hamilton-Jacobi, une méthode de contrôle formel déjà utilisée pour garantir des marges de sécurité vérifiables sur des systèmes robotiques, mais historiquement limitée à des contraintes fixes et spécifiques à une tâche. En la couplant à du conditionnement linguistique, les auteurs cherchent à suivre la tendance des VLA génériques type RT-2 ou OpenVLA, capables d'exécuter des instructions diverses avec une seule politique. L'étude reste toutefois cantonnée à des tâches de manipulation simulées et à un transfert partiel seulement sur des contraintes proches de celles déjà vues, loin d'une garantie de sécurité générale prête pour un déploiement industriel réel.

RecherchePaper
1 source