Aller au contenu principal
RecherchearXiv cs.RO 

MAAP : perception active multi-agents pour la manipulation collaborative

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MAAP (Multi-Agent Active Perception), un système de manipulation collaborative ou chaque bras joue un double rôle: exécuter des actions et servir, via sa camera de poignet, de point de vue mobile pour l'équipe. Il est couple a RAIL (Role-Aware Imitation Learning), un contrôleur qui prédit le rôle courant de chaque bras et conditionne ses actions sur celui-ci. Sur quatre taches simulées, le taux de réussite moyen passe de 56,5% avec une camera fixe a 62,5% avec un poignet actif, puis 70,0% avec tous les bras actifs, et atteint 79,2% avec MAAP+RAIL. Sur une tache a trois bras nommée Microwave, RAIL fait grimper la réussite de 47% a 82% avec les mêmes entrées. Sur une plateforme réelle a deux bras, MAAP+RAIL réussit 14 essais de placement sur 20, contre 0 sur 20 pour une base a vue fixe utilisant ACT. Publie en preprint sur arXiv (2609.21929), le papier ne précise ni affiliation des auteurs ni calendrier de déploiement industriel.

Cette approche renverse l'hypothèse selon laquelle la perception active exige un agent dédié a l'observation, distinct des bras qui manipulent. En montrant que les cameras de poignet déjà présentes sur des cellules multi-bras standard suffisent a améliorer nettement la réussite des taches, sans capteur ni agent supplémentaire, MAAP donne aux intégrateurs une piste pour exploiter le matériel existant plutôt que de multiplier les cameras fixes. L'écart entre 0% et 70% de réussite obtenu sur la plateforme physique face a la base ACT a vue fixe est le chiffre le plus parlant pour un décideur industriel: il suggere que le goulot d'étranglement de nombreux systèmes de manipulation actuels tient autant a la couverture visuelle de la scene qu'a l'algorithme de contrôle lui-même.

MAAP s'inscrit dans la lignée des travaux d'apprentissage par imitation en manipulation, ou ACT (Action Chunking Transformer) sert de référence a vue fixe. Teste sur quatre taches simulées puis sur une plateforme physique a deux bras, l'échantillon de 20 essais reste modeste. Le papier, une contribution académique sans partenariat industriel annonce, ne mentionne aucun calendrier de commercialisation; les suites attendues concernent l'extension a davantage de bras et de taches plus complexes.

Dans nos dossiers

À lire aussi

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon
1arXiv cs.RO 

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon

Une équipe de recherche a publié une version révisée (v2) sur arXiv (2503.22122) présentant REMAC, un framework de planification multi-robots pour des tâches de manipulation longues et complexes, piloté par des modèles vision-langage. Le système combine deux modules: une auto-réflexion qui vérifie les conditions avant et après chaque action pour détecter les erreurs de plan, et une auto-évolution qui adapte la stratégie selon le contexte réel de la scène, sans prompt spécifique à la tâche. Les auteurs ont bâti un environnement de test basé sur RoboCasa, avec 4 catégories de tâches, 27 variantes et plus de 50 objets, puis évalué REMAC avec quatre modèles de raisonnement comme moteurs de décision: DeepSeek-R1, o3-mini, QwQ et Grok3. Résultat revendiqué: +40% de taux de réussite moyen et +52,7% d'efficacité d'exécution face à une baseline à robot unique. L'enjeu visé est concret pour les intégrateurs: les approches actuelles reposent souvent sur une connaissance préalable de l'environnement ou des prompts taillés sur mesure, ce qui les rend fragiles dès qu'un imprévu survient, par exemple un robot chargé de poser une carotte dans un micro-ondes qui découvre que la porte est fermée. En permettant à un robot d'en solliciter un autre pour paralléliser les tâches après plusieurs cycles de réflexion, REMAC pointe vers une robotique multi-agents plus tolérante aux aléas de scène, un axe clé pour dépasser les démonstrations scénarisées et réduire le travail d'ingénierie de prompt lors du déploiement de flottes sur des tâches longues. Le travail s'inscrit dans la recherche sur la planification robotique assistée par grands modèles, aux côtés d'approches comme Pi-0 ou GR00T N2, mais REMAC mise sur un raisonnement multi-agents itératif plutôt que sur un modèle action de bout en bout, en s'appuyant sur des modèles de raisonnement généralistes existants plutôt qu'un modèle propriétaire dédié. Il s'agit pour l'instant d'un travail académique validé en simulation, sans déploiement matériel réel ni partenariat industriel annoncé; la publication de cette seconde version suggère une itération continue sur la méthode, sans calendrier communiqué pour un transfert vers des robots physiques.

RecherchePaper
1 source
PECMAN : navigation collaborative multi-agents par perception en environnements inconnus
2arXiv cs.RO 

PECMAN : navigation collaborative multi-agents par perception en environnements inconnus

Des chercheurs ont publié sur arXiv (réf. 2605.09344) PECMAN, un système de navigation collaborative multi-agents conçu pour des environnements inconnus et dynamiques. L'algorithme s'appuie sur SMART-3D, un planificateur de trajectoires fondé sur la structure RRT* (Rapidly-exploring Random Tree) capable de reconfigurer en temps réel son arbre de planification dès qu'un obstacle ou une nouvelle structure est détecté : plutôt que de reconstruire l'arbre depuis zéro, SMART-3D élague les noeuds et arêtes invalidés, puis répare les sous-arbres déconnectés à des points critiques appelés "hot-nodes". PECMAN étend ce mécanisme à la coopération multi-agents via deux stratégies combinées : une morphologie d'arbre distribuée, où chaque robot replanifie localement, et une perception partagée, par laquelle chaque agent diffuse les structures nouvellement découvertes à ses coéquipiers, leur permettant de replanifier proactivement même dans des zones encore inexplorées. Évalué sur 28 000 simulations couvrant sept scénarios 2D distincts, le système atteint jusqu'à 52 % de réduction du temps de complétion collective avec un taux de succès proche de 100 %. Les expériences ont également été validées sur deux robots autonomes réels dans un environnement de bâtiment. La contribution architecturale centrale est la perception partagée sans coordinateur central : chaque agent enrichit la carte collective en temps réel, ce qui réduit les replanifications redondantes et la latence de réaction de la flotte entière. Pour les intégrateurs de systèmes AMR (Autonomous Mobile Robots) en logistique ou en inspection industrielle, c'est précisément le verrou qui bloque le passage à l'échelle des flottes dans des environnements semi-structurés. La validation physique, même limitée à deux robots, apporte un début de réponse au problème classique du sim-to-real gap, l'un des obstacles majeurs au déploiement de planificateurs collaboratifs en conditions réelles. La réduction de 52 % du temps de complétion est prometteuse, mais mérite d'être interprétée avec prudence : les simulations 2D ne capturent pas la complexité des environnements 3D, et les scénarios de test ne sont pas détaillés dans l'abstract. Les approches multi-agents existantes comme CBS (Conflict-Based Search) ou ORCA supposent généralement des cartes connues à l'avance, ce qui les rend difficilement applicables à une exploration progressive. SMART-3D avait résolu ce problème pour un agent unique ; PECMAN en est l'extension coopérative naturelle. Aucun partenaire industriel ni déploiement commercial n'est mentionné dans la publication, qui reste une contribution académique. Les prochaines étapes logiques seraient des tests sur des flottes plus larges et en environnements 3D réels, conditions nécessaires pour envisager un transfert vers des entrepôts multi-niveaux ou des bâtiments industriels complexes, où les systèmes AMR actuels peinent encore à coordonner leur navigation de façon autonome.

RecherchePaper
1 source
PEAfowl : action vision-langage multi-vue à perception renforcée pour manipulation bimanuelle
3arXiv cs.RO 

PEAfowl : action vision-langage multi-vue à perception renforcée pour manipulation bimanuelle

Une équipe de recherche a publié sur arXiv, en version 2, un article décrivant PEAfowl, une architecture vision-langage-action (VLA) pour la manipulation bimanuelle en environnement encombré. Le modèle prédit des distributions de profondeur par token, effectue un relèvement 3D différentiable et fusionne les vues caméra par agrégation locale de voisins, au lieu de la simple concaténation de tokens des approches existantes. Pour l'ancrage des instructions, il remplace le conditionnement global du langage par une lecture de type Perceiver appliquée aux features CLIP gelées, avec accumulation itérative des indices visuels pertinents. Une distillation de profondeur, réalisée uniquement à l'entraînement via un modèle enseignant préexistant, affine les priors géométriques sans coût supplémentaire à l'inférence, ce qui compense le bruit et les trous typiques des capteurs RGB-D grand public. Sur le benchmark RoboTwin 2.0, en configuration à randomisation de domaine, PEAfowl améliore le taux de réussite de 23 points de pourcentage par rapport à la meilleure référence testée, un gain que les auteurs disent confirmé par des essais complémentaires sur robot physique. Ce travail cible deux limites connues des modèles VLA actuels: une fusion multi-vue trop grossière, qui fragilise la perception sous occlusion ou changement de point de vue, et un ancrage du langage jugé imprécis quand l'instruction sert de simple conditionnement global. Pour les intégrateurs qui évaluent des politiques VLA face à des références comme Pi-0, GR00T N2 ou Helix, ce résultat montre que la robustesse spatiale et la précision de l'ancrage linguistique restent des axes actifs de progrès plutôt que des problèmes déjà résolus. Il faut toutefois noter que le gain de 23 points est mesuré en simulation randomisée; les résultats sur robot réel, évoqués sans détail chiffré précis, relèvent à ce stade d'une validation qualitative plutôt que d'une preuve de déploiement à l'échelle. PEAfowl s'inscrit dans les travaux cherchant à réduire l'écart entre démonstrations en simulation et exécution fiable en conditions réelles pour la manipulation bimanuelle, un axe également exploré par des laboratoires industriels avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. L'article, classé en catégorie "replace-cross" sur arXiv, ne précise ni affiliation institutionnelle ni partenaire industriel. Un site dédié au projet est en ligne, mais aucun calendrier de publication de code ni de pilote industriel n'est annoncé pour l'instant.

RechercheActu
1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
4arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source