Aller au contenu principal
Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots
RecherchearXiv cs.RO 

Algorithme d'enchères consensuelles à stratégie d'enchère apprise pour systèmes multi-robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv (ref. 2605.21932) une approche hybride pour l'allocation décentralisée de tâches en flotte robotique : remplacer le mécanisme d'enchères déterministe du CBBA (Consensus-Based Bundle Algorithm) par une politique d'enchères neuronale entraînée par apprentissage par renforcement. Le CBBA, algorithme de référence en coordination multi-robots, garantit une convergence prouvable mais repose sur des fonctions de score heuristiques codées à la main, souvent sous-optimales face à des scénarios complexes. Les auteurs entraînent leur politique avec PPO (Proximal Policy Optimization), en calibrant les récompenses sur la proximité aux solutions globalement optimales obtenues par programmation linéaire en nombres entiers mixtes (MILP). Trois architectures neuronales sont comparées : un Neural Additive Model (NAM), un LSTM et un Set Transformer. Les expériences couvrent plusieurs tailles de flotte et confirment que les politiques apprises améliorent systématiquement la qualité d'allocation par rapport au CBBA classique, tout en conservant une exécution entièrement décentralisée.

Le résultat structurellement important est que ce cadre CTDE (Centralized Training, Decentralized Execution) permet aux robots d'enchérir sur des tâches à partir d'observations locales partielles, sans communication globale à l'exécution. Pour les intégrateurs déployant des flottes en entrepôt ou en logistique industrielle, c'est un signal concret : les heuristiques codées manuellement, longtemps standard de fait, peuvent être surpassées par des politiques apprises sans sacrifier les garanties de coordination décentralisée. La capacité à tenir à l'échelle sur différentes tailles de flotte est particulièrement notable, les approches MARL pures souffrant souvent d'une instabilité d'entraînement croissante avec le nombre d'agents.

Le CBBA est issu des travaux de Choi et al. (2009) et reste une référence dans les systèmes multi-robots décentralisés, notamment pour les drones et les AMR industriels. L'hybridation RL et algorithmes de coordination classiques s'inscrit dans un axe de recherche actif, face à deux alternatives concurrentes : les approches MARL pures (scalabilité difficile) et les méthodes d'optimisation combinatoire centralisée (inadaptées au temps réel). Cette publication reste une contribution académique sans déploiement annoncé ni partenaire industriel identifié, mais elle pose une base méthodologique pour des flottes hétérogènes plus larges. Les suites naturelles seraient la validation sur robots physiques et l'extension à des contraintes temporelles explicites, comme des tâches avec fenêtres de temps ou des dépendances séquentielles.

Dans nos dossiers

À lire aussi

Algorithme d'enchères-consensus par groupes pour l'allocation décentralisée de tâches en systèmes multi-robots
1arXiv cs.RO 

Algorithme d'enchères-consensus par groupes pour l'allocation décentralisée de tâches en systèmes multi-robots

Des chercheurs présentent l'algorithme GACA (Grouping Auction-Consensus Algorithm), une nouvelle méthode décentralisée pour l'allocation de tâches entre robots (MRTA, multi-robot task allocation), détaillée dans un article publié sur arXiv le 18 août 2026. GACA reprend l'architecture en deux phases enchère-consensus du CBBA (Consensus-Based Bundle Algorithm), la référence décentralisée la plus utilisée dans le domaine, mais en refond entièrement le mécanisme d'enchère : plutôt que de faire miser les robots tâche par tâche, l'algorithme regroupe d'abord les tâches spatialement proches via un prétraitement par plus proche voisin, puis les agents négocient des actions au niveau du groupe entier, partiel, ou contesté. Les auteurs comparent GACA à CBBA sur la classe de problèmes MT-SR-IA, avec un programme linéaire en nombres entiers mixtes comme référence d'optimalité absolue. Sur quatre tailles d'essaim et 4 000 mondes de test, GACA atteint une optimalité médiane d'environ 97 %, contre 81 à 84 % pour CBBA, tout en convergeant en un nombre égal ou inférieur d'itérations. Un test de passage à l'échelle supplémentaire, portant sur 3 280 instances avec des essaims de 5 à 20 agents et des lots de 10 à 50 tâches, confirme que ces gains se maintiennent. L'enjeu dépasse la seule performance chiffrée : CBBA souffre d'un défaut structurel bien identifié dans la littérature, son critère d'enchère individuel est mal aligné avec l'objectif min-somme de minimiser la distance totale parcourue par l'équipe, ce qui produit des allocations sous-optimales dès que les tâches sont dispersées dans l'espace. En reformulant la mise aux enchères au niveau de groupes de tâches plutôt que de tâches isolées, GACA cible directement ce défaut sans sacrifier la décentralisation ni la robustesse aux pannes, des propriétés critiques pour les flottes d'AMR en entrepôt, les essaims de drones ou les opérations de recherche et sauvetage où aucune coordination centrale n'est disponible. Pour les intégrateurs et équipes robotique travaillant sur la coordination de flottes, ce résultat suggère qu'un gain d'optimalité substantiel est atteignable sans complexifier l'infrastructure de communication ni renoncer au temps de convergence. Le travail s'inscrit dans la lignée directe des algorithmes d'enchères consensuelles initiés par CBBA, largement adopté depuis plus d'une décennie comme base de référence pour l'allocation décentralisée de tâches. L'article ne mentionne pas de déploiement matériel réel ni de partenaire industriel : il s'agit d'une contribution algorithmique validée en simulation à grande échelle, avec un MILP comme borne d'optimalité, plutôt que d'un produit ou pilote commercial. Les auteurs ne précisent pas de calendrier de mise en œuvre sur robots physiques ni d'intégration dans une plateforme existante, ce qui positionne GACA comme une avancée de recherche à surveiller pour une future adoption dans des systèmes multi-robots réels plutôt qu'une solution prête à déployer.

RecherchePaper
1 source
Exploration coopérative des risques dans des systèmes multi-robots hétérogènes par altruisme algorithmique
2arXiv cs.RO 

Exploration coopérative des risques dans des systèmes multi-robots hétérogènes par altruisme algorithmique

Publié fin août 2026 sur arXiv (référence 2608.28409), un article propose un cadre de théorie des jeux pour l'exploration coopérative de zones dangereuses par des équipes hétérogènes de robots : chaque agent planifie, sur un horizon fini, une trajectoire qui maximise le gain d'information tout en pénalisant la redondance et l'exposition au danger. Des paramètres de valeur propres à chaque robot et des poids de « parenté » inspirés de la règle de Hamilton définissent un équilibre social qui pousse les robots de moindre valeur à accepter plus de risque au bénéfice des robots plus critiques pour l'équipe. En simulation, cette planification altruiste réduit l'exploration redondante, améliore la séparation entre robots et réalloue le risque sans perte notable de couverture, un résultat confirmé sur du matériel réel avec des robots à roues guidés par des contrôleurs à simple intégrateur et des certificats de barrière. Le travail s'attaque à une question peu formalisée dans les systèmes multi-robots : répartir le risque, et pas seulement les tâches, entre agents de valeur inégale, alors que la plupart des algorithmes d'exploration de flotte optimisent la couverture sans distinguer les robots entre eux. Formaliser l'altruisme comme une fonction d'utilité calculable ouvre une piste pour des flottes hétérogènes en environnements dangereux (recherche et sauvetage, inspection de sites contaminés, exploration minière), où sacrifier délibérément une unité bon marché pour protéger un robot plus coûteux a un sens opérationnel direct. La validation reste toutefois limitée à la simulation et à une démonstration matérielle restreinte à des robots à roues, sans exposition à un danger réel ni test de passage à l'échelle. Ce travail s'inscrit dans un champ où l'exploration multi-robots traite généralement chaque robot comme interchangeable dans une fonction de coût de couverture homogène. En important des concepts issus de la biologie évolutive (sélection de parentèle, altruisme réciproque) et de la théorie des jeux coopératifs, les auteurs proposent une alternative structurée à la pondération manuelle des priorités entre robots. Il s'agit pour l'instant d'un preprint arXiv non encore relu par les pairs, sans calendrier de déploiement annoncé, et les prochaines étapes attendues porteraient sur l'extension à des flottes aériennes ou à pattes et sur des scénarios de danger plus réalistes qu'en laboratoire.

RecherchePaper
1 source
Titre curvature-contraint et à vitesse constante pour l'arrivée simultanée distribuée dans les systèmes multi-robots
3arXiv cs.RO 

Titre curvature-contraint et à vitesse constante pour l'arrivée simultanée distribuée dans les systèmes multi-robots

Une équipe de recherche propose, dans un article publié le 17 juillet 2026 sur arXiv (2607.14781v1), une méthode de contrôle distribué permettant à plusieurs robots mobiles d'atteindre un point cible exactement au même instant, tout en respectant deux contraintes fortes : une courbure de trajectoire limitée et une vitesse constante (potentiellement différente d'un robot à l'autre). Ce type de contrainte correspond typiquement aux drones à voilure fixe, qui ne peuvent ni s'arrêter ni tourner sur place. L'approche s'appuie sur le protocole de consensus maximum et sur les propriétés géométriques des chemins de Dubins, une famille de trajectoires courbes à rayon minimal largement utilisée en planification de mouvement. Les auteurs introduisent une variable de temps virtuel et conçoivent une loi de contrôle hybride, combinant commande optimale et commande proportionnelle saturée, qui pousse chaque robot à converger vers le temps virtuel maximal observé parmi ses voisins. Le dispositif a été validé par simulations et expérimentations, avec une preuve théorique d'optimalité du temps d'arrivée dans certains cas. L'enjeu dépasse l'exercice académique : la synchronisation d'arrivée est une brique fondamentale pour l'encerclement coopératif, les opérations de secours après catastrophe ou la surveillance environnementale par flotte de drones ou d'AMR. Un point souvent négligé dans les démonstrations de coordination multi-robots est justement la contrainte de courbure et de vitesse constante, qui rapproche le problème des conditions réelles de vol plutôt que d'un cadre idéalisé où les robots peuvent accélérer, freiner ou pivoter librement. Le caractère distribué et le faible besoin en communication rendent la méthode potentiellement adaptable à des essaims de taille variable sans coordinateur central, un critère clé pour les intégrateurs qui cherchent à déployer des flottes robustes aux pertes de liaison. Le problème de l'arrivée simultanée s'inscrit dans la lignée des travaux sur les chemins de Dubins et le contrôle formation de drones à voilure fixe, un champ de recherche actif depuis plusieurs années en robotique aérienne militaire et civile. Contrairement aux approches centralisées classiques, qui exigent un calcul global des trajectoires, la méthode proposée ici mise sur la scalabilité et le temps réel. L'article ne mentionne pas de partenariat industriel ni de calendrier de transfert technologique ; il s'agit à ce stade d'une contribution théorique et expérimentale en laboratoire, dont l'application à des essaims commerciaux ou militaires reste à démontrer à plus grande échelle.

RecherchePaper
1 source
Champ vectoriel coopératif sécurisé et distribué pour systèmes multi-robots à contrainte de courbure de trajectoire
4arXiv cs.RO 

Champ vectoriel coopératif sécurisé et distribué pour systèmes multi-robots à contrainte de courbure de trajectoire

Une équipe de recherche publie sur arXiv (2609.15266v1) une nouvelle méthode de guidage collectif pour flottes de robots mobiles contraints par leur rayon de braquage. L'article, intitulé "Distributed Safe Cooperative Vector Field for Trajectory Curvature Constrained Multi-Robot Systems", propose une approche combinant deux champs vectoriels : un champ coopératif qui coordonne le suivi de trajectoire entre robots voisins, et un champ d'évitement de collision à frontière réactive, ajustable dynamiquement selon la courbure cinématique propre à chaque robot. Chaque unité n'a besoin d'échanger qu'une seule variable virtuelle avec ses voisines pour synchroniser son mouvement, éviter les obstacles et prévenir les collisions inter-robots. Les auteurs valident la méthode à la fois en simulation et sur une plateforme réelle multi-robots, sans préciser dans le résumé le nombre d'unités, le modèle de robot ou le matériel employé. L'enjeu vise une limite souvent négligée dans la littérature sur les champs vectoriels de navigation : la plupart des méthodes existantes supposent des robots capables de tourner instantanément, une hypothèse irréaliste pour les plateformes à entraînement différentiel ou de type voiture, dont le rayon de braquage est physiquement borné. Ignorer cette contrainte peut faire diverger la trajectoire réelle du chemin planifié, un problème concret pour les flottes d'AMR en entrepôt, les robots agricoles ou les véhicules autonomes opérant en essaim. En rendant la frontière d'évitement adaptable à la courbure, l'approche cherche à garantir que chaque manœuvre d'évitement reste physiquement exécutable, et pas seulement géométriquement valide sur le papier. Ne requérir qu'une seule variable partagée par voisin limite aussi la charge de communication, un facteur clé pour la scalabilité des systèmes distribués à mesure que le nombre de robots augmente. Le champ vectoriel de guidage est une technique établie en contrôle coopératif multi-robot, utilisée depuis plusieurs années pour le suivi de chemin et la formation de flottes, mais son adaptation explicite aux contraintes de courbure reste un axe de recherche actif face à des approches concurrentes fondées sur la planification en temps réel ou l'optimisation sous contraintes de type commande prédictive. Publié comme preprint arXiv sans mention d'affiliation industrielle, d'évaluation par les pairs ni de partenaire de déploiement, ce travail relève de la recherche académique en contrôle plutôt que d'une annonce produit. Aucune suite commerciale ni calendrier de déploiement n'est évoqué ; la validation expérimentale reste circonscrite à un banc d'essai de laboratoire, et la robustesse de la méthode pour des flottes de grande échelle reste à démontrer au-delà des résultats présentés dans l'article.

RecherchePaper
1 source