Aller au contenu principal
RecherchearXiv cs.RO 

WAND : apprentissage d'une navigation robuste pour quadrirotors face aux perturbations complexes du vent et aux obstacles denses

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent WAND (Wind-Aware Navigation with Disturbance Estimation), un cadre d'apprentissage par renforcement destiné à la navigation de quadrirotors dans des champs d'obstacles denses soumis à des rafales variables. Le système estime l'accélération perturbatrice induite par le vent à partir de l'historique des états proprioceptifs (sans capteur de vent dédié), au moyen d'un réseau convolutif temporel (TCN). Cette estimation sert deux fois: elle est injectée dans la politique de navigation via un module résiduel initialisé à zéro, baptisé WindAdapter, et elle alimente une compensation en boucle ouverte (feedforward) au niveau du contrôle bas niveau. Sur 12 configurations de simulation avec vent, WAND améliore le taux de succès observé de 8,3 points de pourcentage en moyenne par rapport à la seule compensation feedforward. Des essais en vents croisés opposés montrent une adaptation de trajectoire dépendante de la direction du vent. En vol réel en intérieur, avec des ventilateurs, le système réussit 18 essais sur 20, soit 90 %, avec un calcul embarqué en temps réel.

L'intérêt tient à la manière dont le problème est posé. Les politiques de navigation apprises s'appuient en général sur la perception des obstacles et la proprioception, et doivent deviner implicitement l'effet de perturbations qui varient dans le temps, ce qui fragilise la robustesse quand l'observation est partielle. En rendant la perturbation explicite et en l'utilisant à la fois pour décider et pour rejeter l'effet du vent, WAND traite le vent comme une variable d'état à part entière plutôt que comme du bruit. Pour les intégrateurs de drones d'inspection, de logistique ou d'intervention en milieu encombré (entrepôts ouverts, sites industriels, forêts, canyons urbains), c'est une piste crédible pour gagner en fiabilité sans ajouter de capteurs. Il faut toutefois relativiser: un gain moyen de 8,3 points est modeste et mesuré face à un baseline déjà compensé. L'échantillon réel de 20 essais est petit, et les ventilateurs d'intérieur produisent un flux bien plus régulier que les rafales turbulentes en extérieur. Aucune comparaison à d'autres méthodes de pointe n'est mentionnée dans le résumé.

Ce travail s'inscrit dans la lignée des méthodes de navigation par apprentissage pour drones, qui ont démontré leur efficacité en vol rapide parmi des obstacles, mais ont longtemps traité les perturbations aérodynamiques par du contrôle robuste classique ou de l'adaptation implicite. Il s'agit d'une publication académique sur arXiv (préprint, non évalué par les pairs), sans produit, sans partenaire industriel ni calendrier de déploiement annoncés. Les prochaines étapes naturelles sont la validation en extérieur avec un vent réel et turbulent, des tests sur des vitesses et des densités d'obstacles plus élevées, et des comparaisons directes avec les politiques d'adaptation implicite et les contrôleurs robustes existants. L'étape décisive restera le passage du laboratoire à des environnements non contrôlés.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

WESPR : perception et planification sûres et économes en énergie, adaptées au vent, pour vol robuste des quadrirotors
1arXiv cs.RO 

WESPR : perception et planification sûres et économes en énergie, adaptées au vent, pour vol robuste des quadrirotors

Des chercheurs présentent WESPR (Wind-adaptive Energy-efficient Safe Perception and Planning for Robust flight), un framework logiciel destine aux drones quadrirotors évoluant dans des environnements ou le vent est perturbe par des obstacles proches. Publie sur arXiv sous l'identifiant 2603.09194 (version 2, remplaçant une preprint antérieure), le système combine perception géométrique de l'environnement et données météo locales pour estimer en quasi temps réel les champs de vent générés par des bâtiments, murs ou obstacles, puis calculer une trajectoire économe en énergie et adapter la stratégie de contrôle, le tout en moins de 10 secondes. L'équipe a valide l'approche sur un drone Crazyflie, quadrirotor miniature courant en recherche, navigant dans un parcours d'obstacles générant de la turbulence. Compare a un contrôleur adaptatif classique ignorant la géométrie environnante, WESPR réduit de 35,6% en moyenne l'écart maximal par rapport a la trajectoire prévue et améliore la stabilité de vol de 24,6%. L'enjeu dépasse l'exercice académique: le vent local, notamment les rafales et cisaillements créés par des obstacles urbains ou industriels, reste l'un des principaux facteurs limitant la fiabilité des drones en extérieur, que ce soit pour l'inspection d'infrastructures, la livraison ou la surveillance en zone dense. Les méthodes existantes modélisant l'interaction vent-environnement s'appuient généralement sur des simulations de mécanique des fluides, trop couteuses en calcul pour tourner en temps réel embarque. En démontrant qu'un pipeline léger peut anticiper l'effet du vent avant de le subir, plutôt que de simplement le compenser après coup, WESPR ouvre la voie a une planification de vol proactive exploitable sur du matériel aux ressources limitées, un enjeu concret pour les intégrateurs de flottes opérant près de bâtiments, de canyons urbains ou d'infrastructures industrielles exposées au vent. Ce travail s'inscrit dans la lignée des recherches sur les contrôleurs adaptatifs au vent pour drones, dont il prend le meilleur représentant comme point de comparaison plutôt que de repartir de zero. Il ne s'agit pas d'un produit commercial ni d'un déploiement opérationnel: WESPR reste, a ce stade, une preprint arXiv testée en laboratoire sur un seul modèle de micro-drone open source, sans partenariat industriel ni date de disponibilité annonces. La publication en version 2 suggère une révision de l'article initial, probablement après relecture. Les auteurs ne donnent pas de calendrier pour des essais en conditions réelles hors laboratoire ni pour une extension a d'autres plateformes, laissant ouverte la question du passage a l'échelle au-delà du cadre expérimental contrôle présente ici.

RecherchePaper
1 source
DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution
2arXiv cs.RO 

DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution

Les robots serpents mous, capables de se faufiler et de se plier dans des environnements complexes grâce à leur structure flexible, restent difficiles à piloter car leur dynamique est fortement non linéaire et échappe aux modèles simplifiés utilisés par les contrôleurs classiques ou bio-inspirés. Une équipe de recherche propose DiSA-IQL (Distribution-Shift-Aware Implicit Q-Learning), une extension de l'algorithme d'apprentissage par renforcement hors ligne IQL, décrite dans une version révisée d'un article publié sur arXiv (identifiant 2510.00358v2). La méthode ajoute une pénalité sur les paires état-action jugées peu fiables afin de limiter la dégradation de performance causée par le décalage de distribution, un problème classique de l'apprentissage hors ligne où l'agent doit généraliser à partir d'un jeu de données figé sans pouvoir interagir en temps réel avec l'environnement. Les auteurs testent DiSA-IQL sur des tâches d'atteinte d'objectif, en distribution et hors distribution, uniquement en simulation, et rapportent des taux de réussite supérieurs, des trajectoires plus lisses et une robustesse accrue par rapport à trois références : le clonage comportemental (BC), Conservative Q-Learning (CQL) et l'IQL standard. L'enjeu dépasse le seul cas des robots serpents. L'apprentissage en ligne sur du matériel réel est coûteux et risqué pour des structures souples fragiles, ce qui pousse la recherche vers des méthodes hors ligne capables d'exploiter des jeux de données pré-collectés sans dégrader leurs performances face à des situations inédites. Si les résultats se confirment au-delà de la simulation, ils renforceraient la viabilité de pipelines d'apprentissage hors ligne pour des classes de robots à dynamique difficile à modéliser, un enjeu direct pour les intégrateurs qui cherchent à déployer des systèmes souples sans multiplier les essais physiques coûteux. Le travail s'inscrit dans la lignée directe d'IQL et de CQL, deux méthodes de référence en RL hors ligne conservateur, que les auteurs utilisent comme bases de comparaison plutôt que comme simples antécédents théoriques. Il reste à ce stade purement académique et simulé : aucune validation sur robot physique n'est rapportée, et l'article ne mentionne ni partenaire industriel ni calendrier de transfert vers du matériel réel.

RecherchePaper
1 source
Apprentissage d'un contrôle de bout en bout pour le vol omnidirectionnel de quadrirotors à rotors inclinables suractionnés
3arXiv cs.RO 

Apprentissage d'un contrôle de bout en bout pour le vol omnidirectionnel de quadrirotors à rotors inclinables suractionnés

La communauté robotique aérienne franchit une étape avec un article publié sur arXiv (référence 2602.21583, version 2), qui propose un cadre d'apprentissage par renforcement (RL) de bout en bout pour le contrôle omnidirectionnel de quadrirotors surdimensionnés à rotors orientables. Ces plateformes combinent une actionnement hybride, rotors sans balais et articulations rotatives, ce qui leur confère plus de degrés de liberté qu'un quadrirotor classique mais complique fortement le transfert simulation-réel. Le système associe une simulation au niveau actionneur à une architecture acteur-critique asymétrique pour atteindre des poses cibles en 6D, en transformant directement une pose visée en commandes de rotors et d'articulations. Pour fiabiliser le passage du simulateur au matériel réel, les chercheurs combinent identification du système et randomisation de domaine limitée mais physiquement ancrée. La politique entraînée est déployée en zero-shot sur un drone physique et testée en vol stationnaire par points de passage, sous perturbations externes, avec charge utile variable et en suivi de trajectoire, complétée par des essais simulés de configurations singulières d'allocation. Comparée à une base de référence NMPC (commande prédictive non linéaire), état de l'art pour ce type d'actionnement couplé, la politique RL n'égale pas sa précision de position en régime stationnaire, mais affiche une erreur d'orientation plus homogène, des transitions de pose plus rapides et une charge de calcul embarquée réduite. Pour les intégrateurs et ingénieurs du secteur, ce résultat répond à une question ouverte: le RL au niveau actionneur, déjà validé sur des quadrirotors conventionnels pour un vol agile et robuste, peut aussi fonctionner sur des architectures à rotors orientables plus complexes, réputées plus difficiles à transférer du simulateur au réel. Le compromis observé, moins de précision statique contre moins de calcul embarqué et plus de réactivité, ouvre des pistes concrètes pour des drones à bas coût de calcul destinés à l'inspection ou à la manipulation aérienne. Le travail s'inscrit dans la continuité des succès du RL sur les quadrirotors standards, où cette approche a déjà démontré sa robustesse face aux méthodes classiques de contrôle. La question du RL sur les rotors orientables restait ouverte en raison du couplage hybride rotors-articulations, jugé plus délicat à modéliser fidèlement en simulation. Cette version 2 de l'article, republiée après une première soumission, suggère un travail de consolidation méthodologique. Les auteurs positionnent explicitement leur approche face au NMPC plutôt que de la présenter comme son remplacement, et les essais de configurations singulières restant cantonnés à la simulation laissent entrevoir une validation matérielle future comme prochaine étape logique.

RecherchePaper
1 source
Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage
4arXiv cs.RO 

Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage

Des chercheurs présentent VOP-Nav, un système de navigation pour robots quadrupèdes conçu pour évoluer dans des environnements denses et dynamiques, où l'occlusion des capteurs et l'imprévisibilité des déplacements humains posent des défis majeurs. Le cœur du système est un réseau baptisé VOP-Net, qui traite des données LiDAR multi-frames captées en local pour encoder implicitement les contraintes dynamiques de l'environnement et prédire une zone de vitesse sûre, dérivée de la théorie des Velocity Obstacles (VO). Fait notable, cette prédiction VO sert un double rôle : elle alimente la politique de navigation en inférence, et sert de signal de récompense pendant l'entraînement pour favoriser des trajectoires sûres. Le système a été évalué dans le simulateur Isaac Gym, puis déployé en conditions réelles sur un robot quadrupède Unitree Go2, en intérieur comme en extérieur, sans pipeline explicite de détection et de suivi d'obstacles. L'enjeu dépassé ici est un compromis classique en robotique mobile : les méthodes à base de modèle comme les Velocity Obstacles garantissent la sécurité en théorie, mais s'effondrent en environnement dense car elles dépendent d'estimations précises du mouvement des obstacles, difficiles à obtenir dans une foule. À l'inverse, les approches d'apprentissage de bout en bout sont plus robustes mais manquent de capacité de prédiction, ce qui produit soit des collisions, soit des comportements trop prudents. En hybridant les deux, VOP-Nav vise directement le goulot d'étranglement qui freine le déploiement de quadrupèdes et, plus largement, de plateformes mobiles autonomes dans des espaces partagés avec des humains, entrepôts, hôpitaux, bureaux, un enjeu suivi de près par les intégrateurs travaillant avec des plateformes comme Go2 ou Spot. Le papier s'inscrit dans la lignée des travaux sur la navigation sociale et l'évitement d'obstacles dynamiques, où les méthodes géométriques classiques (VO, ORCA) et l'apprentissage par renforcement coexistent sans avoir jusqu'ici bien fusionné. Publié comme preprint arXiv (2607.15036), le travail n'a pas encore fait l'objet de revue par les pairs ; les auteurs revendiquent des taux de réussite supérieurs à leurs bases de comparaison en simulation, sans toutefois préciser de chiffres exacts ni le protocole complet d'évaluation, un point à surveiller avant toute extrapolation vers un déploiement industriel à grande échelle.

RecherchePaper
1 source