Aller au contenu principal
Recherche décentralisée multi-agents sans communication sous contraintes budgétaires : Dec-MARVEL
RecherchearXiv cs.RO 

Recherche décentralisée multi-agents sans communication sous contraintes budgétaires : Dec-MARVEL

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente Dec-MARVEL, un cadre d'exploration décentralisé pour flottes de drones capables de coordonner leurs déplacements sans aucune communication ni partage de cartes, de messages ou d'objectifs entre robots. Chaque appareil s'appuie uniquement sur ses observations fortuites : la trajectoire d'un coéquipier détectée dans son champ de vision directionnel sert de signal de coordination implicite. Un acteur basé sur un mécanisme d'attention par graphe combine la géométrie locale des frontières inexplorées, le mouvement des autres robots et le budget de déplacement restant pour choisir des actions de type point de passage plus cap, tout en garantissant un retour possible à la base. L'entraînement repose sur des critiques conditionnés par phase, un critique privilégié orienté tâche utilisé uniquement en apprentissage, et un curriculum de budget basé sur un mélange de scénarios. Sur 900 essais tenus à l'écart de l'entraînement, couvrant trois tailles d'équipe (2, 4 et 8 robots) et trois budgets de déplacement (720, 800 et 1024 mètres), Dec-MARVEL obtient le meilleur taux d'exploration, ou à égalité, et le plus faible recouvrement de zones balayées face à quatre méthodes concurrentes, sur les neuf configurations testées. Sous la contrainte la plus stricte de 720 mètres, le taux de succès atteint 53 %, 94 % et 100 % pour 2, 4 et 8 robots respectivement, contre 37 %, 83 % et 99 % pour la meilleure référence. Des essais sur robots physiques confirment un transfert sim-to-real réussi.

Ce résultat s'attaque à un verrou concret pour les flottes de drones opérant en environnements dégradés, zones de catastrophe, bâtiments effondrés, milieux militaires brouillés, où la liaison radio entre appareils est peu fiable ou volontairement coupée. La plupart des approches multi-robots existantes supposent un échange d'informations, même partiel, pour éviter les redondances d'exploration ; s'en passer entièrement tout en conservant des performances proches, voire supérieures, aux méthodes communicantes change la donne pour les intégrateurs qui doivent certifier des systèmes robustes aux pannes réseau. La gestion explicite du budget de retour, plutôt qu'une exploration gloutonne sans garde-fou, répond aussi à une contrainte opérationnelle réelle plutôt qu'à un scénario de laboratoire simplifié.

Le travail s'inscrit dans la lignée des recherches en apprentissage multi-agent pour l'exploration robotique, où la coordination décentralisée reste un problème ouvert face aux approches classiques qui centralisent la carte ou diffusent des objectifs partagés. En comparant Dec-MARVEL à quatre méthodes de référence sur une plage large de tailles d'équipe et de contraintes de budget, les auteurs cherchent à démontrer une robustesse à l'échelle, du duo de drones jusqu'à des essaims de huit unités. La validation sur robots physiques, au-delà de la simulation, ouvre la voie à des déploiements dans des missions de recherche et sauvetage ou de reconnaissance où la connectivité ne peut être garantie.

À lire aussi

Exploration multi-robots sous contraintes de communication, avec fenêtres de communication adaptatives
1arXiv cs.RO 

Exploration multi-robots sous contraintes de communication, avec fenêtres de communication adaptatives

Une équipe de recherche présente MACE (Multi-robot Adaptive Communication-window Exploration), un cadre décentralisé destiné à l'exploration multi-robot en environnement où les communications sont intermittentes. Décrit dans un article publié le 12 septembre 2026 sur arXiv (arXiv:2609.12502v1), le système répond à un problème classique de la robotique en essaim : quand plusieurs robots explorent en parallèle une zone inconnue, ils doivent régulièrement partager leurs cartes pour éviter les redondances, mais dévier de leur trajectoire pour établir une liaison radio coûte du temps d'exploration. MACE introduit des fenêtres de communication planifiées, pendant lesquelles chaque robot évalue le coût de rejoindre un point de communication déjà identifié, en formulant cette décision comme une variante du problème d'orientation de véhicule (Vehicle Orienteering Problem). Concrètement, les robots choisissent leur route en pondérant le trajet nécessaire pour communiquer contre le gain d'exploration réalisable en chemin. Testé sur un ensemble d'environnements simulés de tailles et de géométries variées, MACE réduit le temps total d'exploration jusqu'à 23% par rapport aux stratégies existantes de coordination sous contrainte de communication. Pour les concepteurs de flottes robotiques destinées à des missions en zones sans infrastructure réseau fiable, comme l'inspection industrielle, la recherche et sauvetage ou l'exploration minière et souterraine, ce travail cible un compromis rarement traité de façon rigoureuse: la plupart des approches actuelles reposent soit sur une communication purement opportuniste (les robots ne se coordonnent que lorsqu'ils se croisent par hasard, ce qui retarde le partage d'information), soit sur des points de rendez-vous fixes qui imposent des détours inutiles même quand ils n'apportent rien de nouveau. En rendant la décision de communiquer dynamique et fondée sur un calcul de coût-bénéfice, MACE promet une fréquence de communication plus élevée qu'une stratégie opportuniste tout en évitant les trajets superflus des rendez-vous imposés. Le gain de 23% annoncé reste toutefois mesuré uniquement en simulation, sans validation sur robots physiques ni comparaison sur des cartes réelles bruitées, ce qui limite pour l'instant la portée de la conclusion à un résultat algorithmique prometteur plutôt qu'à une solution validée en conditions de terrain. Ce travail s'inscrit dans la lignée de la recherche en exploration multi-robot sous contrainte de communication, un axe actif depuis plusieurs années à mesure que les flottes de robots terrestres et aériens sont déployées dans des contextes où le Wi-Fi ou la 5G ne couvrent pas l'intégralité du terrain, comme les tunnels, les mines ou les zones sinistrées. Les stratégies antérieures se répartissaient jusqu'ici entre l'opportunisme pur et les rendez-vous fixes planifiés à l'avance, deux approches que les auteurs positionnent explicitement comme les points de comparaison de leur étude. Les prochaines étapes attendues pour ce type de recherche incluent généralement des essais sur plateformes robotiques réelles et une extension à des scénarios avec pertes de communication plus complexes, mais l'article ne mentionne pas de calendrier ni de partenaire industriel pour un tel passage à l'échelle.

RecherchePaper
1 source
Agir face à l'invisible : filtrage collaboratif sans communication pour l'allocation décentralisée de tâches multi-robots
2arXiv cs.RO 

Agir face à l'invisible : filtrage collaboratif sans communication pour l'allocation décentralisée de tâches multi-robots

Des chercheurs ont présenté sur arXiv (2605.25584) un cadre théorique et algorithmique baptisé Zero-Knowledge MRTA (ZK-MRTA), conçu pour l'allocation de tâches dans des équipes de robots sans aucune communication inter-agent, sans modèle de tâche préalable et sans coordinateur central. Dans ce régime, chaque robot ne dispose que d'une vue partielle et bruitée du flux public des résultats de ses coéquipiers. L'algorithme proposé, SwarmCF, exploite une structure cachée de faible rang (low-rank) qui gouverne l'adéquation entre chaque robot et chaque type de tâche, en appliquant du filtrage collaboratif en ligne, le même principe mathématique que les systèmes de recommandation Netflix ou Spotify. Les expériences montrent que SwarmCF récupère environ 80 % des performances d'un système centralisé avec communication complète, et maintient cet avantage même sous contention de capacité 1 (chaque tâche assignée à un seul robot à la fois). L'enjeu théorique est substantiel: les auteurs prouvent formellement que tout algorithme sans structure est coincé au plancher d'erreur de la moyenne a priori sur les paires (robot, tâche) jamais tentées, tandis que SwarmCF atteint une complexité d'échantillonnage par robot en Theta(d) au lieu de Theta(n), où d est le rang de la structure latente et n le nombre total de tâches, typiquement d est très inférieur à n. Cette séparation est catégorielle, pas un simple facteur constant. Pour les intégrateurs de flottes robotiques (entrepôts AMR, inspection industrielle, agriculture), cela signifie qu'une flotte hétérogène peut s'auto-organiser sur des tâches inédites sans infrastructure de communication, ce qui réduit la complexité système et améliore la résilience aux pannes réseau. Le scaling est positif: la compétence par robot sur les tâches non vues augmente avec la taille de l'équipe. Le problème d'allocation multi-robots (MRTA) est étudié depuis les années 2000, avec des approches classiques comme les enchères distribuées (CBBA), les méthodes à base de marché ou les algorithmes de consensus qui supposent toutes un canal de communication fiable. ZK-MRTA s'attaque au cas extrême opposé, commun dans les déploiements industriels réels (réseaux dégradés, robots hétérogènes sans protocole commun) mais largement ignoré en théorie. Côté concurrence, des travaux récents sur le multi-armed bandit collaboratif ou le federated reinforcement learning adressent des problèmes voisins mais supposent soit une communication périodique, soit un modèle de récompense partagé. La prochaine étape naturelle serait de valider SwarmCF sur des flottes physiques, notamment dans des contextes entrepôts ou de manipulation, où le sim-to-real gap reste la principale inconnue pour les méthodes fondées sur l'observation passive de coéquipiers.

RecherchePaper
1 source
Allocation décentralisée des tâches multi-robots sous communication dégradée : performance, fiabilité et calcul comparés
3arXiv cs.RO 

Allocation décentralisée des tâches multi-robots sous communication dégradée : performance, fiabilité et calcul comparés

Sur le fond, il s'agit d'un article scientifique de benchmark (pas d'annonce produit), sans acteur FR/EU identifiable dans le texte fourni ; j'ai rédigé le résumé en conséquence. Un benchmark publié sur arXiv (2609.13711) compare six algorithmes décentralisés d'allocation de tâches pour flottes de robots, CBAA, ACBBA, PI, HIPC, DMCHBA et DGA, dans un scénario appelé Collaborative Visit. L'étude principale repose sur 500 instances appariées de dix cibles chacune, testées sur 25 conditions de communication allant d'un canal idéal à des dégradations simulées par pertes de type Bernoulli, pertes Gilbert-Elliott et évanouissement de Rayleigh. Sur les 24 conditions dégradées du cœur de l'étude, DGA et DMCHBA affichent la distance de trajet minimax moyenne la plus faible, 24,49 et 24,78 pas de simulation respectivement, tandis que HIPC devance de justesse DGA sur le critère de distance totale minimisée, 66,95 pas contre 67,22. DMCHBA se distingue par la charge de communication la plus faible, 2,08 messages échangés par pas et par équipe. En pré-allocation sur dix cibles, seuls HIPC et DMCHBA restent stables et exploitables dans toutes les conditions testées, alors qu'ACBBA, PI et DGA perdent en fiabilité à mesure que le réseau se dégrade. Sous communication idéale, le temps de calcul médian du protocole complet va de 4,88 millisecondes pour DMCHBA à 1,346 seconde pour DGA, et des campagnes complémentaires testent la sensibilité à la taille de la grille, à la densité de robots et à une charge allant jusqu'à 50 cibles. Pour les intégrateurs qui doivent choisir un algorithme d'allocation embarqué sur des robots autonomes, flottes logistiques, drones d'inspection ou de recherche et sauvetage, le message central est qu'aucune méthode ne domine sur tous les critères à la fois. DGA produit les trajets les plus courts, mais son temps de calcul, plus de 250 fois supérieur à celui de DMCHBA, peut le disqualifier pour un déploiement embarqué en temps réel sur du matériel à ressources limitées. HIPC et DMCHBA apparaissent en revanche comme les seuls choix robustes quand la communication se dégrade, un scénario courant sur le terrain mais rarement testé dans les publications qui évaluent ces algorithmes en conditions idéales. Le travail contredit ainsi l'hypothèse d'un algorithme universellement supérieur et déplace la décision vers un arbitrage d'ingénierie explicite entre qualité de trajet, robustesse réseau et budget de calcul. Ce benchmark s'inscrit dans la lignée des algorithmes d'enchères par consensus initiés par CBBA il y a plus d'une décennie, dont CBAA et ACBBA sont des dérivés directs, aux côtés d'approches plus récentes comme PI, HIPC, DMCHBA et DGA. Il reste un travail de recherche mené en simulation, sans déploiement industriel annoncé. Les auteurs notent que les classements obtenus en configuration statique divergent de ceux mesurés en calcul intégré à l'exécution à mesure que la charge de tâches augmente, ce qui ouvre la voie à des validations complémentaires sur du matériel robotique réel plutôt que sur des grilles simulées.

RecherchePaper
1 source
Un cadre multi-robot évolutif pour des boucles de perception-action-communication décentralisées et asynchrones
4arXiv cs.RO 

Un cadre multi-robot évolutif pour des boucles de perception-action-communication décentralisées et asynchrones

Une équipe de recherche a mis à jour sur arXiv (référence 2309.10164, version 3) un article décrivant un système décentralisé de perception, action et communication (PAC) destiné à coordonner des flottes de robots évoluant en extérieur à grande échelle. Le cœur du système s'appuie sur un réseau de neurones sur graphe (GNN) qui propage l'information de robot en robot, saut par saut, à travers le réseau de la flotte, ce qui permet une collaboration globale alors que chaque unité ne perçoit et ne communique que localement. L'architecture est entièrement asynchrone : les quatre modules, perception, communication inter-robots, agrégation des messages et action, fonctionnent chacun à leur propre fréquence, les informations circulant entre eux via des mémoires tampons plutôt que via une horloge commune. Le système est implémenté sous forme de nœuds ROS2 hautement extensibles, conçus comme une infrastructure de base réutilisable pour des essaims robotiques déployables sur le terrain. Les auteurs le valident par des essais réels en extérieur avec jusqu'à 20 quadricoptères, et par des simulations construites à partir de données réelles impliquant jusqu'à 100 robots. Ce travail s'attaque à un problème central pour l'industrie robotique : la plupart des démonstrations d'essaims publiées reposent sur une coordination centralisée ou sur des simulations qui ne passent pas à l'échelle une fois confrontées aux contraintes réelles de perception bruitée, de communication intermittente et de latence sur le terrain. En montrant qu'une architecture purement décentralisée et asynchrone, sans horloge globale ni serveur central, conserve scalabilité, résilience et répétabilité jusqu'à plusieurs dizaines d'unités réelles et une centaine en simulation, les auteurs apportent un argument concret en faveur du contrôle multi-robot par apprentissage sur graphe. Pour les intégrateurs qui envisagent des déploiements en essaim de drones ou de robots terrestres (inspection d'infrastructures, agriculture de précision, surveillance de sites étendus), cela ouvre une voie technique crédible pour dépasser les limites classiques des systèmes swarm sans sacrifier la robustesse à l'échelle. Il faut toutefois noter que les essais réels restent limités à 20 robots, la barre des 100 unités n'ayant été franchie qu'en simulation, ce qui laisse ouverte la question du passage à l'échelle en conditions réelles. Cette publication s'inscrit dans la lignée des recherches sur le contrôle multi-agent décentralisé, un domaine qui cherche depuis plusieurs années à faire coopérer de grandes flottes de robots sans dépendre d'une infrastructure de communication centralisée, vulnérable en environnement extérieur ; elle constitue la troisième version d'un article initialement publié en 2023 sous la référence arXiv 2309.10164, intégrant vraisemblablement des résultats étendus par rapport à la version d'origine. Le champ concurrence plusieurs familles d'approches, des méthodes de consensus distribué classiques aux architectures d'apprentissage par renforcement multi-agent, le choix d'un GNN pour diffuser l'information de proche en proche constituant ici la spécificité des auteurs. Aucun partenariat industriel ni calendrier de déploiement commercial n'est mentionné : il s'agit d'une contribution de recherche académique, dont l'infrastructure ROS2 ouverte et extensible pourrait néanmoins servir de brique de base à des acteurs souhaitant construire des systèmes d'essaims opérationnels, pour des drones comme pour d'autres classes de robots mobiles.

RecherchePaper
1 source