Aller au contenu principal
PECMAN : navigation collaborative multi-agents par perception en environnements inconnus
RecherchearXiv cs.RO 

PECMAN : navigation collaborative multi-agents par perception en environnements inconnus

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (réf. 2605.09344) PECMAN, un système de navigation collaborative multi-agents conçu pour des environnements inconnus et dynamiques. L'algorithme s'appuie sur SMART-3D, un planificateur de trajectoires fondé sur la structure RRT* (Rapidly-exploring Random Tree) capable de reconfigurer en temps réel son arbre de planification dès qu'un obstacle ou une nouvelle structure est détecté : plutôt que de reconstruire l'arbre depuis zéro, SMART-3D élague les noeuds et arêtes invalidés, puis répare les sous-arbres déconnectés à des points critiques appelés "hot-nodes". PECMAN étend ce mécanisme à la coopération multi-agents via deux stratégies combinées : une morphologie d'arbre distribuée, où chaque robot replanifie localement, et une perception partagée, par laquelle chaque agent diffuse les structures nouvellement découvertes à ses coéquipiers, leur permettant de replanifier proactivement même dans des zones encore inexplorées. Évalué sur 28 000 simulations couvrant sept scénarios 2D distincts, le système atteint jusqu'à 52 % de réduction du temps de complétion collective avec un taux de succès proche de 100 %. Les expériences ont également été validées sur deux robots autonomes réels dans un environnement de bâtiment.

La contribution architecturale centrale est la perception partagée sans coordinateur central : chaque agent enrichit la carte collective en temps réel, ce qui réduit les replanifications redondantes et la latence de réaction de la flotte entière. Pour les intégrateurs de systèmes AMR (Autonomous Mobile Robots) en logistique ou en inspection industrielle, c'est précisément le verrou qui bloque le passage à l'échelle des flottes dans des environnements semi-structurés. La validation physique, même limitée à deux robots, apporte un début de réponse au problème classique du sim-to-real gap, l'un des obstacles majeurs au déploiement de planificateurs collaboratifs en conditions réelles. La réduction de 52 % du temps de complétion est prometteuse, mais mérite d'être interprétée avec prudence : les simulations 2D ne capturent pas la complexité des environnements 3D, et les scénarios de test ne sont pas détaillés dans l'abstract.

Les approches multi-agents existantes comme CBS (Conflict-Based Search) ou ORCA supposent généralement des cartes connues à l'avance, ce qui les rend difficilement applicables à une exploration progressive. SMART-3D avait résolu ce problème pour un agent unique ; PECMAN en est l'extension coopérative naturelle. Aucun partenaire industriel ni déploiement commercial n'est mentionné dans la publication, qui reste une contribution académique. Les prochaines étapes logiques seraient des tests sur des flottes plus larges et en environnements 3D réels, conditions nécessaires pour envisager un transfert vers des entrepôts multi-niveaux ou des bâtiments industriels complexes, où les systèmes AMR actuels peinent encore à coordonner leur navigation de façon autonome.

À lire aussi

CoRelNav : navigation relationnelle collaborative pour robots multiples en environnement sémantique contraint
1arXiv cs.RO 

CoRelNav : navigation relationnelle collaborative pour robots multiples en environnement sémantique contraint

CoRelNav, décrit dans un article déposé sur arXiv (référence 2609.27720v1), s'attaque à la navigation sémantique sous contrainte spatiale pour des flottes de robots mobiles : trouver un objet cible défini non seulement par sa catégorie sémantique mais aussi par sa relation avec les objets environnants, dans un environnement totalement inconnu. Le système repose sur un couplage entre exploration multi-robot conditionnée par la tâche et vérification collaborative pilotée par les candidats détectés. Un champ spatio-sémantique convertit les contraintes de la tâche, les nœuds de la scène et les caractéristiques des objets en une carte d'utilité d'exploration ; à mesure que des candidats sont repérés, les robots sont réaffectés vers les zones susceptibles d'apporter des preuves complémentaires, sous contrainte de coût de déplacement collectif, tandis que les observations cohérentes d'une même instance sont agrégées à travers les nœuds topologiques de la carte. Les auteurs rapportent des gains constants face à des méthodes de référence en simulation photoréaliste, avec des études d'ablation validant séparément les modules d'exploration et de vérification, et un déploiement du système complet sur deux robots mobiles physiques réels. L'intérêt de ce travail tient à un manque identifié dans la littérature : la navigation relationnelle existante reste essentiellement mono-agent, tandis que les systèmes multi-robots coordonnent rarement leurs observations distribuées pour vérifier une relation spatiale propre à une instance précise d'objet. En reliant explicitement exploration et vérification collaborative, CoRelNav réduit la recherche redondante entre robots et permet de trancher des hypothèses relationnelles à partir de preuves partielles réparties sur plusieurs agents, là où une exploration indépendante ou une vérification à vue unique resteraient ambiguës. Pour les équipes travaillant sur des flottes de robots de service, d'entrepôt ou d'inspection, cela illustre une piste concrète pour faire collaborer plusieurs unités sur des tâches sémantiques complexes plutôt que de les faire opérer en silos. Le travail s'inscrit dans le courant de recherche sur la navigation sémantique et la navigation vision-langage, en élargissant le problème classique de recherche d'objet à la coordination multi-agents. L'article reste une contribution académique validée par simulation et un test limité à deux robots physiques, sans indication de partenaire industriel, de calendrier de déploiement ou de mise à l'échelle au-delà de ce banc d'essai restreint.

RecherchePaper
1 source
MAAP : perception active multi-agents pour la manipulation collaborative
2arXiv cs.RO 

MAAP : perception active multi-agents pour la manipulation collaborative

Des chercheurs présentent MAAP (Multi-Agent Active Perception), un système de manipulation collaborative ou chaque bras joue un double rôle: exécuter des actions et servir, via sa camera de poignet, de point de vue mobile pour l'équipe. Il est couple a RAIL (Role-Aware Imitation Learning), un contrôleur qui prédit le rôle courant de chaque bras et conditionne ses actions sur celui-ci. Sur quatre taches simulées, le taux de réussite moyen passe de 56,5% avec une camera fixe a 62,5% avec un poignet actif, puis 70,0% avec tous les bras actifs, et atteint 79,2% avec MAAP+RAIL. Sur une tache a trois bras nommée Microwave, RAIL fait grimper la réussite de 47% a 82% avec les mêmes entrées. Sur une plateforme réelle a deux bras, MAAP+RAIL réussit 14 essais de placement sur 20, contre 0 sur 20 pour une base a vue fixe utilisant ACT. Publie en preprint sur arXiv (2609.21929), le papier ne précise ni affiliation des auteurs ni calendrier de déploiement industriel. Cette approche renverse l'hypothèse selon laquelle la perception active exige un agent dédié a l'observation, distinct des bras qui manipulent. En montrant que les cameras de poignet déjà présentes sur des cellules multi-bras standard suffisent a améliorer nettement la réussite des taches, sans capteur ni agent supplémentaire, MAAP donne aux intégrateurs une piste pour exploiter le matériel existant plutôt que de multiplier les cameras fixes. L'écart entre 0% et 70% de réussite obtenu sur la plateforme physique face a la base ACT a vue fixe est le chiffre le plus parlant pour un décideur industriel: il suggere que le goulot d'étranglement de nombreux systèmes de manipulation actuels tient autant a la couverture visuelle de la scene qu'a l'algorithme de contrôle lui-même. MAAP s'inscrit dans la lignée des travaux d'apprentissage par imitation en manipulation, ou ACT (Action Chunking Transformer) sert de référence a vue fixe. Teste sur quatre taches simulées puis sur une plateforme physique a deux bras, l'échantillon de 20 essais reste modeste. Le papier, une contribution académique sans partenariat industriel annonce, ne mentionne aucun calendrier de commercialisation; les suites attendues concernent l'extension a davantage de bras et de taches plus complexes.

RecherchePaper
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
3arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

UELe code open-source pourrait être évalué par des équipes R&D françaises (Exotec, intégrateurs logistiques) pour la navigation en espaces non cartographiés, mais il n'y a pas de lien institutionnel direct avec la France ou l'UE.

RecherchePaper
1 source
D-VLC : collaboration vision-langage décentralisée pour systèmes multi-robots incarnés hétérogènes en environnements inconnus
4arXiv cs.RO 

D-VLC : collaboration vision-langage décentralisée pour systèmes multi-robots incarnés hétérogènes en environnements inconnus

Un article de recherche publié sur arXiv (arXiv:2607.29009v1) présente D-VLC (Decentralized Vision-Language Collaboration), un framework destiné aux essaims de robots hétérogènes évoluant dans des environnements inconnus, sans carte préétablie. Contrairement aux approches classiques qui s'appuient sur une prise de décision centralisée et synchronisée, D-VLC combine un raisonnement décentralisé et asynchrone, un partage d'informations léger entre robots, une collaboration tenant compte des capacités spécifiques de chaque plateforme, et une interface d'action unifiée. Le système permet à des modèles vision-langage (VLM) généralistes de générer des actions adaptées à chaque robot, exécutées ensuite par des modules experts sans apprentissage ni entraînement spécifique à la tâche ou au robot. Testé sur plusieurs scénarios et plusieurs VLM différents, le framework atteint des taux de réussite supérieurs à 70%, avec un temps d'exécution réduit jusqu'à 55,8% par rapport à une méthode de référence gloutonne géométrique. Ce travail s'attaque à une limite bien identifiée des systèmes multi-robots pilotés par LLM ou VLM: leur dépendance à des cartes connues et à une coordination centralisée, qui freine leur généralisation à des flottes hétérogènes et à des tâches inédites. En s'affranchissant de ces contraintes, D-VLC apporte un argument concret au débat sur la capacité des VLM à raisonner et coordonner sans entraînement dédié, un enjeu central pour la logistique, l'entreposage automatisé et les essaims industriels mêlant robots à roues, bras manipulateurs et drones. Le gain de temps de complétion suggère un passage à l'échelle plus réaliste que les démonstrations centralisées habituelles, même si les résultats restent issus d'expériences en environnement contrôlé et non d'un déploiement industriel. D-VLC s'inscrit dans la vague récente de recherches combinant grands modèles de langage et perception visuelle pour la robotique collaborative, après plusieurs générations d'approches à base de règles jugées trop rigides pour des instructions sémantiques complexes. Aucun acteur industriel n'est associé à cette publication à ce stade: il s'agit d'un travail académique, dont la prochaine étape logique serait une validation sur des flottes physiques réelles, hétérogènes, au delà des scénarios expérimentaux actuels.

RecherchePaper
1 source