Contrôler des collectifs d'agents IA dans l'espace du raisonnement avec des transformeurs spatiaux
Les grands modèles de langage promettent une nouvelle approche pour la planification et la navigation en robotique, mais leurs performances s'effondrent dès que la taille des équipes de robots augmente, même sur des tâches multi-robots simples. Des chercheurs proposent COMPASS, une architecture décentralisée et scalable pour piloter de larges collectifs de robots agentiques via un contrôle par feedback dans un espace de raisonnement. Le feedback est généré localement sur chaque robot par un transformer spatial qui agrège des messages multi-sauts circulant à travers la flotte en un token de feedback appris. Les expériences montrent que ces collectifs de modèles de langage tirent parti d'une diversité structurée dans la commande d'entrée, ce qui permet d'annuler certains biais, un avantage qui se maintient quelle que soit l'échelle. Le système a été testé jusqu'à 1024 robots commandés en langage naturel, alors qu'il n'a été entraîné qu'à une échelle 16 fois plus petite, et généralise en zero-shot à des instructions ambiguës jamais vues à l'entraînement. Le papier a été publié sur arXiv sous la référence 2609.28247v1.
Comparé à une politique centralisée s'appuyant sur un LLM frontier et à une variante n'utilisant que la communication en langage naturel, le design couplé de COMPASS produit des formations de vol en essaim nettement plus cohésives et fidèles à l'intention commandée. Point notable pour les équipes qui travaillent sur le contrôle multi-agents: le feedback fonctionne mieux lorsqu'il est composé avec un token compact appris plutôt qu'avec un état brut inséré directement dans le canal de langage, une approche artisanale qui détruit la cohésion du groupe selon les auteurs. Ce résultat va à l'encontre de l'hypothèse répandue selon laquelle il suffirait d'enrichir les prompts avec plus d'informations d'état pour améliorer la coordination d'essaim par LLM. Pour les intégrateurs travaillant sur des flottes de drones ou de robots mobiles, ce papier suggère une voie pour dépasser les limites actuelles des architectures centralisées à base de LLM, qui ne passent pas à l'échelle au-delà de quelques agents.
Le travail s'inscrit dans la lignée des recherches cherchant à combiner LLM et contrôle robotique multi-agents, un domaine où la plupart des démonstrations publiques restent cantonnées à de petites équipes de quelques robots. Les auteurs positionnent explicitement COMPASS contre deux références directes, une politique LLM centralisée de type frontier model et une architecture de communication purement textuelle, pour isoler la contribution spécifique du transformer spatial et du token de feedback appris. L'abstract ne précise ni le laboratoire ni les auteurs, ni de calendrier de suite, mais la démonstration à 1024 robots simulés marque une étape dans la recherche sur le passage à l'échelle du contrôle d'essaims piloté par le langage.
Dans nos dossiers




