Aller au contenu principal
Interceptor une cible agile avec des drones porteurs de filet par apprentissage par renforcement multi-agent compétitif
RecherchearXiv cs.RO 

Interceptor une cible agile avec des drones porteurs de filet par apprentissage par renforcement multi-agent compétitif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a développé une méthode pour intercepter un drone agile évasif à l'aide de plusieurs drones poursuivants équipés de filets de capture, en formulant le problème comme une tâche d'apprentissage par renforcement multi-agents compétitif (MARL). Les chercheurs entraînent simultanément les poursuivants et le drone évadé grâce à l'algorithme MAPPO (Multi-Agent Proximal Policy Optimization) combiné à une technique de "self-play fictif priorisé" (PFSP), conçue pour éviter que les agents ne s'adaptent excessivement à une seule stratégie adverse et n'oublient les tactiques précédentes. L'entraînement se déroule dans un simulateur haute fidélité utilisant des commandes de contrôle bas niveau, poussée collective et vitesses angulaires du corps (CTBR), permettant des vols agiles réalistes pour tous les drones impliqués. Les politiques obtenues sont comparées à des stratégies heuristiques de référence sur trois critères: taux de capture, temps nécessaire pour intercepter la cible, et taux de collision, avec des résultats supérieurs aux méthodes classiques.

Ce travail illustre un progrès notable pour les systèmes de défense anti-drone et les applications de sécurité aérienne, où intercepter physiquement un engin volant agile sans arme létale reste un défi technique majeur. Les études d'ablation menées par les auteurs montrent que le PFSP produit des politiques plus robustes, capables de s'adapter à des stratégies d'évasion variées, et que l'usage de commandes bas niveau (plutôt que des commandes de haut niveau simplifiées) est déterminant pour obtenir des comportements de vol réellement performants. Fait notable, l'analyse qualitative des comportements appris révèle l'émergence spontanée de tactiques coopératives entre les drones poursuivants, sans que cette coordination ait été explicitement programmée.

Cette recherche s'inscrit dans la lignée des travaux sur les jeux de poursuite-évasion multi-agents et le self-play compétitif, technique popularisée par des systèmes comme AlphaStar ou OpenAI Five pour contourner l'instabilité de l'entraînement face à un adversaire en constante évolution. Elle ouvre la voie à des essais en conditions réelles pour valider le transfert simulation-vers-réel de ces stratégies de capture collaborative.

À lire aussi

Une approche hors ligne d'apprentissage par renforcement guidé par fNIRS pour le comportement des robots
1arXiv cs.RO 

Une approche hors ligne d'apprentissage par renforcement guidé par fNIRS pour le comportement des robots

Une nouvelle étude, publiée sur arXiv (2607.14393v1) mi-juillet 2026, explore la possibilité de piloter l'apprentissage par renforcement de robots à l'aide de signaux cérébraux captés par spectroscopie proche infrarouge fonctionnelle (fNIRS), une technique d'imagerie optique non invasive. Les chercheurs testent leur approche en simulation, en comparant des agents entraînés sur des tâches d'interaction passive (l'humain observe) et active (l'humain démontre l'action). Plusieurs méthodes d'intégration du signal neural dans l'algorithme de RL sont évaluées, avec un choix de conception clé : le signal cérébral vient augmenter les paramètres existants plutôt que les remplacer. L'équipe étudie aussi l'impact de la granularité du modèle et du bruit sur la qualité de l'apprentissage. Résultat principal, le signal fNIRS améliore les performances lorsqu'il sert à pondérer les priorités de trajectoire et les valeurs Q état-action, et le système fonctionne aussi à partir de données hors ligne, sans capture en temps réel. Ce dernier point est le plus significatif pour le secteur. L'apprentissage par renforcement avec humain dans la boucle est déjà largement utilisé pour aligner le comportement des robots sur les préférences des utilisateurs, généralement via des démonstrations, des retours explicites ou des comparaisons de trajectoires. Un signal cérébral direct promettrait un canal de préférence plus rapide et moins intrusif que les méthodes actuelles. Mais les interfaces cerveau-machine en temps réel restent lourdes à déployer hors laboratoire. En montrant que le cadre fonctionne aussi avec des données fNIRS collectées hors ligne, l'étude ouvre une voie plus réaliste pour intégrer ce type de signal sans exiger un dispositif BCI branché en continu, un obstacle pratique majeur pour toute application au-delà de la recherche. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par renforcement guidé par préférences humaines, déjà central dans l'entraînement des agents conversationnels et de plus en plus exploré pour la robotique physique. Il reste toutefois à un stade précoce : validation uniquement en simulation, pas de test sur robot réel, et l'abstract ne précise ni le nombre de participants ni l'institution porteuse. Les prochaines étapes attendues concernent vraisemblablement le passage à des environnements physiques et l'élargissement du panel de sujets testés.

RecherchePaper
1 source
AgilePE : poursuite-évasion de drones autonomes par apprentissage par renforcement en auto-jeu
2arXiv cs.RO 

AgilePE : poursuite-évasion de drones autonomes par apprentissage par renforcement en auto-jeu

Un preprint publié en août 2026 sur arXiv (2608.14135) présente AgilePE, un système complet de poursuite-évasion autonome entre drones fondé sur l'apprentissage par renforcement en auto-jeu. La politique convertit directement les observations d'état embarquées en commandes de poussée collective et de vitesses angulaires du corps (CTBR), sans planificateur de trajectoire intermédiaire ni contrôleur de points de passage. L'entraînement combine auto-jeu compétitif via Prioritized Fictitious Self-Play (PFSP) et un pool d'adversaires diversifié pour stabiliser l'apprentissage face aux versions historiques de la politique. Le transfert vers le réel repose sur un pipeline de simulation modélisant la dynamique des actionneurs, la latence de communication et une randomisation de domaine, permettant un transfert zero-shot sur de vrais quadricoptères sans réglage spécifique ; les essais réels reproduisent esquives rapides et manoeuvres de flanquement observées en simulation, jusqu'à une démonstration interactive à deux agents en temps réel. Ce résultat s'attaque à une limite connue des approches classiques, règles fixes ou théorie des jeux différentiels, qui peinent face à des interactions aériennes complexes et rapides. AgilePE montre que l'auto-jeu compétitif peut faire émerger des stratégies tactiques sans les coder à la main, et que le transfert simulation-vers-réel peut réussir en zero-shot pour des manoeuvres très dynamiques dès lors que le matériel réel, actionneurs et latence compris, est fidèlement modélisé en amont. Pour les intégrateurs de robotique aérienne, c'est un argument en faveur des politiques de contrôle bout-en-bout face aux piles classiques de planification puis suivi de trajectoire, et un cas d'usage pertinent pour la détection et la neutralisation de drones, où la poursuite-évasion est un scénario directement opérationnel. La poursuite-évasion aérienne prolonge une tradition de recherche en théorie des jeux différentiels remontant à Rufus Isaacs, longtemps limitée à des dynamiques simplifiées et de faible dimension. AgilePE reprend des techniques d'auto-jeu popularisées par les systèmes de jeu de stratégie, dont PFSP, déjà utilisé dans d'autres environnements multi-agents compétitifs, et les applique au contrôle de vol agile en boucle fermée. Le résumé ne cite aucune institution ni entreprise, et le travail reste au stade de la recherche : les démonstrations portent sur des quadricoptères réels en conditions de laboratoire, pas sur un produit ou un déploiement commercial. Aucun calendrier de suite n'est précisé, mais l'approche s'inscrit dans une tendance plus large vers des contrôles de vol agile appris de bout en bout, en concurrence avec les méthodes de planification classique utilisées pour le vol de course ou l'évitement d'obstacles.

RecherchePaper
1 source
Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents
3arXiv cs.RO 

Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.09610v1) une approche par apprentissage par renforcement multi-agents (MARL) pour résoudre un problème concret de robotique collaborative : positionner automatiquement un groupe de robots mobiles sous un objet afin de le transporter de façon stable. La méthode décompose la tâche en trois sous-problèmes couplés, contrôle de formation, navigation coopérative et évitement de collisions, et produit des politiques permettant à la flotte de s'aligner sous l'objet, d'équilibrer son poids malgré une distribution de masse non uniforme, et de naviguer dans des environnements encombrés. Les expériences portent sur des configurations variées (nombre de robots variable, géométries d'objets complexes, scènes avec obstacles) sans que les auteurs précisent le nombre exact de robots testés ni les temps de cycle obtenus. Le principal apport industriel de ces travaux est la généralisation à des objets de forme arbitraire et à masse mal distribuée, ce qui représente la réalité de la plupart des charges en logistique ou en services. Les approches classiques supposent des objets symétriques ou des points de contact prédéfinis manuellement ; ici, la politique apprise s'adapte au vol à la géométrie de la charge. Pour un intégrateur ou un COO industriel, cela signifie potentiellement moins de paramétrage manuel par référence produit. Le paper démontre également une robustesse en environnement encombré, ce qui est un prérequis pour un déploiement en entrepôt réel. Il faut toutefois noter que les résultats présentés restent en simulation : aucune validation hardware n'est rapportée, et le fossé sim-to-real reste l'obstacle non résolu habituel de ce type de travaux. Ce preprint s'inscrit dans un courant actif de recherche MARL appliqué aux systèmes multi-robots physiques, en compétition avec des approches centralisées (planification MPC couplée) ou décentralisées par consensus. Côté industrie, des acteurs comme 6 River Systems, Locus Robotics ou les plateformes AMR d'OTTO Motors adressent des problèmes adjacents mais avec des charges standardisées sur des robots dédiés. Aucun partenariat industriel ni timeline de transfert vers le réel n'est mentionné dans cet article ; il s'agit d'une contribution académique ouvrant la voie à des validations expérimentales futures.

RecherchePaper
1 source
Transport sécurisé et évolutif de charges par multi-drones via apprentissage par renforcement à base de CBF, avec transfert simulation-réel sans réentraînement
4arXiv cs.RO 

Transport sécurisé et évolutif de charges par multi-drones via apprentissage par renforcement à base de CBF, avec transfert simulation-réel sans réentraînement

Une équipe de recherche propose un cadre d'apprentissage pour le transport coopératif de charges par essaims de drones, détaillé dans un article arXiv (2607.20665v1) publié le 24 juillet 2026. Le système s'appuie sur une abstraction 2D simplifiée qui conserve le couplage physique essentiel entre drones, câbles et charge, tout en restant assez légère pour un entraînement à grande échelle. Les chercheurs utilisent une randomisation de domaine portant à la fois sur la taille de l'équipe de drones et sur les paramètres physiques du système, puis entraînent une politique entièrement distribuée via une méthode nommée DGPPO (Discrete Graph Control Barrier Function Proximal Policy Optimization), combinant apprentissage par renforcement et fonctions de barrière de contrôle pour garantir la sécurité. Le transfert vers le réel se fait en zero-shot, c'est-à-dire sans aucun réglage fin post-simulation, et des essais matériels en conditions réelles confirment qu'une seule politique généralise à des tailles d'équipe et des scénarios de tâches variés, y compris avec plusieurs groupes de drones évoluant simultanément comme obstacles mobiles les uns pour les autres. Ce résultat s'attaque à deux limites bien connues du transport de charges par drones en essaim : la sécurité et le passage à l'échelle dans des environnements dynamiques et non structurés, deux points qui freinaient jusqu'ici l'adoption en logistique, en construction ou en réponse aux catastrophes. Le fait qu'une politique unique, entraînée en simulation légère, se transfère sans réajustement au réel et reste stable face à des essaims tiers non coordonnés constitue une validation concrète du sim-to-real pour des tâches multi-agents à dynamique couplée, un domaine où l'écart simulation-réalité reste souvent un point de blocage majeur. Le travail s'inscrit dans la lignée des recherches sur le contrôle multi-drones sous contrainte de sécurité formelle, où les fonctions de barrière de contrôle (CBF) sont de plus en plus combinées à l'apprentissage par renforcement pour garantir des garanties de sécurité vérifiables plutôt que purement statistiques. Les auteurs ne précisent pas encore de calendrier de transfert industriel ni de partenaire de déploiement ; il s'agit pour l'instant d'une démonstration académique, dont la suite logique serait l'extension à des charges 3D plus réalistes et à des essaims de taille supérieure.

RecherchePaper
1 source