AgilePE : poursuite-évasion de drones autonomes par apprentissage par renforcement en auto-jeu
Un preprint publié en août 2026 sur arXiv (2608.14135) présente AgilePE, un système complet de poursuite-évasion autonome entre drones fondé sur l'apprentissage par renforcement en auto-jeu. La politique convertit directement les observations d'état embarquées en commandes de poussée collective et de vitesses angulaires du corps (CTBR), sans planificateur de trajectoire intermédiaire ni contrôleur de points de passage. L'entraînement combine auto-jeu compétitif via Prioritized Fictitious Self-Play (PFSP) et un pool d'adversaires diversifié pour stabiliser l'apprentissage face aux versions historiques de la politique. Le transfert vers le réel repose sur un pipeline de simulation modélisant la dynamique des actionneurs, la latence de communication et une randomisation de domaine, permettant un transfert zero-shot sur de vrais quadricoptères sans réglage spécifique ; les essais réels reproduisent esquives rapides et manoeuvres de flanquement observées en simulation, jusqu'à une démonstration interactive à deux agents en temps réel.
Ce résultat s'attaque à une limite connue des approches classiques, règles fixes ou théorie des jeux différentiels, qui peinent face à des interactions aériennes complexes et rapides. AgilePE montre que l'auto-jeu compétitif peut faire émerger des stratégies tactiques sans les coder à la main, et que le transfert simulation-vers-réel peut réussir en zero-shot pour des manoeuvres très dynamiques dès lors que le matériel réel, actionneurs et latence compris, est fidèlement modélisé en amont. Pour les intégrateurs de robotique aérienne, c'est un argument en faveur des politiques de contrôle bout-en-bout face aux piles classiques de planification puis suivi de trajectoire, et un cas d'usage pertinent pour la détection et la neutralisation de drones, où la poursuite-évasion est un scénario directement opérationnel.
La poursuite-évasion aérienne prolonge une tradition de recherche en théorie des jeux différentiels remontant à Rufus Isaacs, longtemps limitée à des dynamiques simplifiées et de faible dimension. AgilePE reprend des techniques d'auto-jeu popularisées par les systèmes de jeu de stratégie, dont PFSP, déjà utilisé dans d'autres environnements multi-agents compétitifs, et les applique au contrôle de vol agile en boucle fermée. Le résumé ne cite aucune institution ni entreprise, et le travail reste au stade de la recherche : les démonstrations portent sur des quadricoptères réels en conditions de laboratoire, pas sur un produit ou un déploiement commercial. Aucun calendrier de suite n'est précisé, mais l'approche s'inscrit dans une tendance plus large vers des contrôles de vol agile appris de bout en bout, en concurrence avec les méthodes de planification classique utilisées pour le vol de course ou l'évitement d'obstacles.
Dans nos dossiers




