Aller au contenu principal
RecherchearXiv cs.RO 

Contrôler des collectifs d'agents IA dans l'espace du raisonnement avec des transformeurs spatiaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les grands modèles de langage promettent une nouvelle approche pour la planification et la navigation en robotique, mais leurs performances s'effondrent dès que la taille des équipes de robots augmente, même sur des tâches multi-robots simples. Des chercheurs proposent COMPASS, une architecture décentralisée et scalable pour piloter de larges collectifs de robots agentiques via un contrôle par feedback dans un espace de raisonnement. Le feedback est généré localement sur chaque robot par un transformer spatial qui agrège des messages multi-sauts circulant à travers la flotte en un token de feedback appris. Les expériences montrent que ces collectifs de modèles de langage tirent parti d'une diversité structurée dans la commande d'entrée, ce qui permet d'annuler certains biais, un avantage qui se maintient quelle que soit l'échelle. Le système a été testé jusqu'à 1024 robots commandés en langage naturel, alors qu'il n'a été entraîné qu'à une échelle 16 fois plus petite, et généralise en zero-shot à des instructions ambiguës jamais vues à l'entraînement. Le papier a été publié sur arXiv sous la référence 2609.28247v1.

Comparé à une politique centralisée s'appuyant sur un LLM frontier et à une variante n'utilisant que la communication en langage naturel, le design couplé de COMPASS produit des formations de vol en essaim nettement plus cohésives et fidèles à l'intention commandée. Point notable pour les équipes qui travaillent sur le contrôle multi-agents: le feedback fonctionne mieux lorsqu'il est composé avec un token compact appris plutôt qu'avec un état brut inséré directement dans le canal de langage, une approche artisanale qui détruit la cohésion du groupe selon les auteurs. Ce résultat va à l'encontre de l'hypothèse répandue selon laquelle il suffirait d'enrichir les prompts avec plus d'informations d'état pour améliorer la coordination d'essaim par LLM. Pour les intégrateurs travaillant sur des flottes de drones ou de robots mobiles, ce papier suggère une voie pour dépasser les limites actuelles des architectures centralisées à base de LLM, qui ne passent pas à l'échelle au-delà de quelques agents.

Le travail s'inscrit dans la lignée des recherches cherchant à combiner LLM et contrôle robotique multi-agents, un domaine où la plupart des démonstrations publiques restent cantonnées à de petites équipes de quelques robots. Les auteurs positionnent explicitement COMPASS contre deux références directes, une politique LLM centralisée de type frontier model et une architecture de communication purement textuelle, pour isoler la contribution spécifique du transformer spatial et du token de feedback appris. L'abstract ne précise ni le laboratoire ni les auteurs, ni de calendrier de suite, mais la démonstration à 1024 robots simulés marque une étape dans la recherche sur le passage à l'échelle du contrôle d'essaims piloté par le langage.

Dans nos dossiers

À lire aussi

ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot
1arXiv cs.RO 

ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot

Une équipe de recherche publie sur arXiv (arXiv:2607.04162v1) ACE, pour Agentic Control for Embodied Manipulation, un cadre de raisonnement en zero-shot destiné à la manipulation d'objets sur table à partir d'instructions en langage naturel. Plutôt que de faire correspondre directement le langage à des actions motrices bas niveau, comme le font la plupart des politiques VLA de bout en bout, ACE orchestre un raisonnement de type workflow agentique couplé à deux compétences robotiques réutilisables : une interface de repérage visuel et une primitive générique de saisie-dépose. Le sous-objectif actif est traduit en un masque visuel qui désigne à la fois l'objet cible et sa destination, masque qui est suivi dans le temps, exposé à la vérification humaine, puis transmis à une politique d'exécution indépendante de la tâche. Le système fonctionne en boucle fermée grâce à une mémoire multi-échelle temporelle qui vérifie après chaque action si le sous-objectif a réussi, avant de décider de poursuivre, réessayer, corriger ou replanifier. Sur des tâches longues et logiquement complexes, comme la formation d'équations avec des cubes numérotés ou la récupération d'objets sous contrainte, ACE atteint 50% de réussite pour la formation d'équations et 70% pour la récupération sous contrainte, quand les approches de bout en bout classiques échouent largement sur ces mêmes tâches. Ce résultat cible un point de friction précis du secteur : la capacité d'un système à généraliser à des scènes et contraintes sémantiques inédites sans réentraînement spécifique à la tâche, ce qui reste l'un des principaux écarts entre les démonstrations en laboratoire et un déploiement robuste en environnement réel. En montrant qu'un raisonnement explicite par étapes, combiné à un contrôle médié par masque, surpasse des politiques end-to-end sur des tâches à horizon long, ACE apporte un argument concret pour les intégrateurs et équipes de R&D qui cherchent des architectures de manipulation capables de gérer l'échec d'exécution et la correction humaine en cours de tâche, plutôt que de miser uniquement sur l'échelle des données d'entraînement. ACE s'inscrit dans la lignée des travaux récents sur les architectures agentiques pour la robotique, qui cherchent à combiner les capacités de raisonnement des grands modèles de langage avec des compétences robotiques modulaires et vérifiables, en alternative aux politiques VLA monolithiques comme Pi-0 ou GR00T. Les auteurs positionnent explicitement leur approche contre des baselines de bout en bout sur les mêmes bancs d'essai, mais l'évaluation reste limitée à des scénarios de manipulation tabletop en conditions contrôlées, sans indication de déploiement industriel ni de partenariat annoncé à ce stade.

RecherchePaper
1 source
IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique
2arXiv cs.RO 

IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique

Des chercheurs ont publié IndustryNav, premier benchmark de navigation industrielle dynamique conçu pour évaluer le raisonnement spatial des agents visuels et langagiers (VLLM) en conditions actives. Le dispositif s'appuie sur douze scénarios d'entrepôt haute fidélité créés sous Unity, intégrant objets mobiles et déplacements humains simulés. Les auteurs proposent un pipeline de navigation PointGoal en zero-shot, combinant vision égocentrique et odométrie globale pour tester la planification à la fois locale et globale. Deux métriques originales, le taux de collision et le taux d'alerte, mesurent spécifiquement les comportements orientés sécurité. Quatorze modèles de pointe ont été testés, dont GPT-5.2, Claude-4.6 et Gemini-3, sur cet ensemble de tâches de navigation dynamique. Les résultats montrent que les modèles propriétaires conservent un avantage constant sur les modèles ouverts, mais qu'aucun agent, quel qu'il soit, ne maîtrise réellement l'évitement d'obstacles, la planification de trajectoire robuste ou l'exploration active. C'est un signal important pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par VLLM dans des entrepôts ou des lignes de production: la performance impressionnante de ces modèles sur des benchmarks domestiques statiques ne se transfère pas automatiquement à des environnements industriels dynamiques et peuplés d'humains. Le papier vient ainsi nuancer le discours ambiant sur la maturité des agents incarnés génériques, en montrant que la perception passive ne suffit pas là où la sécurité active est requise. Cette étude comble un vide identifié dans la littérature existante: la quasi-totalité des benchmarks d'agents incarnés se limite à des environnements domestiques passifs et statiques, et évalue des capacités isolées plutôt qu'une performance holistique. IndustryNav se positionne comme le premier effort ciblant spécifiquement le domaine industriel avec complexité dynamique. Publié sur arXiv (version révisée du texte initial), le travail appelle la recherche en robotique incarnée à dépasser la simple perception pour développer des comportements stables, exploratoires et sûrs en environnement réel mouvant, une orientation qui concerne directement les futurs déploiements d'AMR et de robots mobiles en logistique.

RecherchePaper
1 source
TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux
3arXiv cs.RO 

TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux

Des chercheurs ont publié sur arXiv (réf. 2603.23117) une attaque baptisée TRAP (Targeted Reasoning Adversarial Patch), démontrant pour la première fois qu'un patch adversarial physique peut détourner le comportement d'un robot manipulateur piloté par un modèle Vision-Language-Action (VLA) à raisonnement Chain-of-Thought (CoT). Dans les expériences présentées, un patch imprimé sur papier et déposé sur la surface de travail, tel qu'une nappe aux motifs spécifiques, suffit à faire en sorte que le robot remette un couteau à l'opérateur au lieu d'une pomme, sans qu'aucune modification de l'instruction utilisateur ne soit nécessaire. L'attaque a été validée sur trois VLA représentatifs intégrant des mécanismes CoT distincts, et mise en oeuvre en conditions réelles avec un simple imprimé papier. Ce résultat pointe une vulnérabilité structurelle dans les VLA à raisonnement intermédiaire, famille de modèles qui inclut notamment π0 de Physical Intelligence, OpenVLA-OFT ou les variantes de GR00T (NVIDIA) basées sur des CoT explicites. Les auteurs montrent empiriquement que le raisonnement CoT gouverne la génération d'actions de façon prépondérante, même lorsqu'il est sémantiquement incohérent avec l'instruction initiale : le modèle suit la chaîne de pensée corrompue plutôt que l'intention de l'utilisateur. Pour les intégrateurs déployant des bras robotisés en environnement ouvert, entrepôts, blocs opératoires ou assistance à domicile, cela signifie qu'un adversaire pourrait modifier le comportement du robot par simple altération visuelle de l'environnement, sans accès au modèle ni au flux de commandes, ce qui rend l'attaque particulièrement préoccupante en contexte de sécurité physique. Les VLA à raisonnement CoT ont émergé comme réponse aux limites des modèles action-réflexe classiques : le CoT améliore la généralisation et offre une trace d'interprétabilité utile pour la certification. TRAP montre que cette avancée introduit simultanément une surface d'attaque inédite. La recherche en sécurité des systèmes robotiques autonomes reste largement sous-investie par rapport à la sécurité des LLM textuels, et ce travail rejoint un corpus naissant incluant des attaques sur les politiques de diffusion et les modèles de perception. Aucun correctif ni benchmark défensif n'est proposé dans cette version ; les auteurs appellent à une sécurisation urgente des pipelines CoT dans les VLA avant tout déploiement à grande échelle dans des environnements critiques.

UELes intégrateurs européens déployant des VLA sur des bras robotisés en environnement industriel, médical ou d'assistance doivent suspendre tout déploiement à grande échelle dans des environnements critiques et auditer leurs pipelines CoT, en l'absence totale de correctifs défensifs disponibles.

RechercheOpinion
1 source
Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions
4arXiv cs.RO 

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions

Des chercheurs publient sur arXiv (2607.15733v1) un nouveau contrôleur à horizon glissant dans l'espace des tâches pour l'évitement de collision en temps réel sur bras manipulateurs robotiques. La méthode combine un rollout court et "contact-consistant", basé sur un solveur dynamique itératif appliqué à des géométries convexes gonflées du robot et des obstacles, pour générer une référence cinématique terminale respectant les contraintes de non-pénétration internes. Seule la première commande d'une transition lisse à accélération minimale vers cette référence est ensuite calculée à chaque cycle, en partant d'une loi de régulation par cinématique inverse en boucle fermée. Les auteurs démontrent une régulation exponentielle locale dans l'espace des tâches lorsque les contacts sont inactifs, et bornent l'effet des obstacles mobiles sur les ensembles de fonctionnement réguliers lorsque des contacts s'activent pendant le rollout. Les tests incluent des simulations sur un système multi-chaînes à 40 degrés de liberté (DOF) et des expériences matérielles sur une plateforme à 6 DOF. L'enjeu pratique est le compromis classique entre anticipation et réactivité en robotique industrielle: le contrôle prédictif complet (MPC) offre une vision à long terme mais son coût de calcul explose avec l'horizon, la fidélité du modèle et le nombre de contraintes géométriques actives, tandis que les méthodes réactives sans horizon restent rapides mais peu clairvoyantes en environnement encombré et dynamique. Les résultats montrent que des horizons intermédiaires équilibrent ces deux exigences, avec des taux de succès supérieurs à des baselines MPC et à des "dynamic optimization fabrics" en clutter dynamique, tout en gardant des temps de résolution compatibles avec l'exécution temps réel testée. Point notable pour les intégrateurs: le comportement reste cohérent entre simulation et réel sans estimation précise des paramètres inertiels, ce qui limite l'effort de calibration habituellement nécessaire au transfert sim-to-real. Ce travail s'inscrit dans la lignée des recherches en contrôle prédictif appliqué à la manipulation en environnement dynamique, un axe où les laboratoires universitaires cherchent à réduire le fossé entre démonstrations en simulation et déploiements réels sur bras industriels ou collaboratifs. La comparaison directe avec des baselines MPC et fabrics d'optimisation dynamique positionne la méthode comme une alternative moins coûteuse en calcul pour l'évitement d'obstacles mobiles, un enjeu croissant pour les cellules robotiques partagées avec des opérateurs humains ou d'autres machines mobiles (AMR). Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial à ce stade.

RecherchePaper
1 source