Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage d'un contrôle de bout en bout pour le vol omnidirectionnel de quadrirotors à rotors inclinables suractionnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La communauté robotique aérienne franchit une étape avec un article publié sur arXiv (référence 2602.21583, version 2), qui propose un cadre d'apprentissage par renforcement (RL) de bout en bout pour le contrôle omnidirectionnel de quadrirotors surdimensionnés à rotors orientables. Ces plateformes combinent une actionnement hybride, rotors sans balais et articulations rotatives, ce qui leur confère plus de degrés de liberté qu'un quadrirotor classique mais complique fortement le transfert simulation-réel. Le système associe une simulation au niveau actionneur à une architecture acteur-critique asymétrique pour atteindre des poses cibles en 6D, en transformant directement une pose visée en commandes de rotors et d'articulations. Pour fiabiliser le passage du simulateur au matériel réel, les chercheurs combinent identification du système et randomisation de domaine limitée mais physiquement ancrée. La politique entraînée est déployée en zero-shot sur un drone physique et testée en vol stationnaire par points de passage, sous perturbations externes, avec charge utile variable et en suivi de trajectoire, complétée par des essais simulés de configurations singulières d'allocation.

Comparée à une base de référence NMPC (commande prédictive non linéaire), état de l'art pour ce type d'actionnement couplé, la politique RL n'égale pas sa précision de position en régime stationnaire, mais affiche une erreur d'orientation plus homogène, des transitions de pose plus rapides et une charge de calcul embarquée réduite. Pour les intégrateurs et ingénieurs du secteur, ce résultat répond à une question ouverte: le RL au niveau actionneur, déjà validé sur des quadrirotors conventionnels pour un vol agile et robuste, peut aussi fonctionner sur des architectures à rotors orientables plus complexes, réputées plus difficiles à transférer du simulateur au réel. Le compromis observé, moins de précision statique contre moins de calcul embarqué et plus de réactivité, ouvre des pistes concrètes pour des drones à bas coût de calcul destinés à l'inspection ou à la manipulation aérienne.

Le travail s'inscrit dans la continuité des succès du RL sur les quadrirotors standards, où cette approche a déjà démontré sa robustesse face aux méthodes classiques de contrôle. La question du RL sur les rotors orientables restait ouverte en raison du couplage hybride rotors-articulations, jugé plus délicat à modéliser fidèlement en simulation. Cette version 2 de l'article, republiée après une première soumission, suggère un travail de consolidation méthodologique. Les auteurs positionnent explicitement leur approche face au NMPC plutôt que de la présenter comme son remplacement, et les essais de configurations singulières restant cantonnés à la simulation laissent entrevoir une validation matérielle future comme prochaine étape logique.

Dans nos dossiers

À lire aussi

OmniRisk : apprentissage omnidirectionnel du risque de trajectoire pour l'évitement dynamique agile de quadrirotors
1arXiv cs.RO 

OmniRisk : apprentissage omnidirectionnel du risque de trajectoire pour l'évitement dynamique agile de quadrirotors

Une équipe de recherche présente OmniRisk, un système de planification omnidirectionnelle permettant à des drones quadrirotors agiles d'éviter des obstacles rapides en mouvement, décrit dans un article publié sur arXiv (référence 2609.18191v1) en septembre 2026, avec code source mis à disposition sur GitHub sous le compte VANdexj. Le système combine dans un même tenseur de dimension fixe des panoramas de portée LiDAR, des masques de détection de mouvement et des vitesses de surface en coordonnées cartésiennes, afin de représenter simultanément la géométrie de l'environnement et la dynamique des obstacles. Il s'appuie sur un champ de risque asymétrique aligné sur le vecteur vitesse de chaque obstacle, qui accentue le danger lors d'une approche et l'atténue lors d'un éloignement. Un réseau à convolution circulaire à deux branches prédit en un seul passage les états limites terminaux et les niveaux de risque dynamique pour un ensemble de trajectoires candidates réparties sur une grille d'ancrage à 360 degrés, avant sélection et reconstruction analytique de la trajectoire retenue. Des essais en vol réel ont démontré des manœuvres d'évitement consécutives à des vitesses de rencontre relative allant jusqu'à 15 m/s, sans réglage fin additionnel du modèle. L'intérêt principal tient au déplacement du calcul de risque vers une phase d'apprentissage hors ligne : l'inférence embarquée devient indépendante du nombre d'obstacles, ce qui règle un point de blocage classique des planificateurs de trajectoire en ligne, soit trop coûteux face à des scènes denses, soit fiables uniquement au prix d'une charge de calcul croissante avec le nombre d'obstacles. Pour les intégrateurs de drones autonomes, cela ouvre la voie à un évitement dynamique temps réel et léger en calcul, sans dépendre de capteurs de profondeur denses. La validation en conditions réelles, à haute vitesse et sans fine-tuning, va aussi à l'encontre d'un écart fréquent entre performances simulées et transfert au monde réel dans ce type d'approche par apprentissage. Ce travail s'inscrit dans la lignée des recherches en navigation réactive pour drones agiles, un champ jusqu'ici partagé entre optimisation de trajectoire en ligne à base de modèles et méthodes d'apprentissage exploitant des capteurs de profondeur ou LiDAR. OmniRisk se distingue par sa couverture omnidirectionnelle plutôt que frontale et par la prise en compte explicite du sens de déplacement relatif des obstacles. Le code étant publié en accès libre, la reproductibilité et l'adoption par d'autres équipes de recherche en robotique aérienne constituent la suite logique attendue.

RecherchePaper
1 source
Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes
2arXiv cs.RO 

Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes

Une équipe de chercheurs a publié sur arXiv (référence 2507.16481, troisième version) une méthode d'apprentissage par renforcement guidé destinée à permettre aux robots quadrupèdes d'effectuer des sauts omnidirectionnels en trois dimensions. L'approche combine des courbes de Bézier, classiquement utilisées pour la planification de trajectoires lissées, avec un modèle de mouvement rectiligne uniformément accéléré (UARM), qui encode une intuition physique du saut directement dans la boucle d'entraînement. Les résultats sont validés en simulation et sur robot réel, mais le résumé ne précise ni la plateforme matérielle utilisée ni les métriques chiffrées de performance, ce qui limite l'évaluation indépendante de la contribution. L'intérêt principal de ce travail réside dans l'adresse simultanée de deux limitations majeures des approches existantes. Les méthodes d'optimisation classiques (MPC, trajectory optimization) produisent des sauts contrôlables mais exigent une connaissance fine des paramètres du robot et du terrain, ce qui fragilise leur robustesse en conditions réelles. À l'inverse, l'apprentissage par renforcement bout-en-bout souffre d'une complexité d'échantillonnage élevée, de millions de simulations nécessaires, et d'une imprévisibilité des trajectoires qui complique la certification de sécurité, un prérequis non négociable pour les déploiements industriels. En injectant une structure physique dans la boucle d'entraînement, les auteurs visent à réduire le coût d'apprentissage tout en produisant des mouvements explicables, dont la logique peut être auditée et certifiée. Le saut dynamique pour robots quadrupèdes est un problème ouvert depuis plusieurs années, car il concentre les défis du transfert sim-to-réel : contacts impulsionnels, rigidité des actionneurs, imprécision des estimations d'état. Le Robotics Systems Lab d'ETH Zurich (ANYmal) et les équipes de l'UC Berkeley ont déjà démontré des sauts via RL pur, tandis que Boston Dynamics et Unitree intègrent ces capacités dans leurs plateformes commerciales. Ce papier s'inscrit dans la tendance des approches hybrides modèle-apprentissage, qui cherchent à concilier la robustesse du RL avec la prévisibilité des méthodes analytiques, une direction que poursuivent également des équipes européennes comme le LAAS-CNRS ou l'INRIA.

UEDes équipes européennes comme le LAAS-CNRS et l'INRIA travaillent sur des approches hybrides modèle-apprentissage similaires pour la locomotion quadrupède, ce travail s'inscrit dans un domaine de recherche où l'Europe est présente mais sans impact direct immédiat.

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
3arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes
4arXiv cs.RO 

Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes

Une équipe de recherche a publié le 28 août 2026 sur arXiv (2608.28090) une étude sur la locomotion omnidirectionnelle d'un robot humanoïde assis sur une chaise mobile passive à roulettes. Contrairement aux humanoïdes debout, dont les actionneurs quasi-direct-drive génèrent en continu du couple articulaire, la position assise délègue le maintien du poids à la chaise. La politique de contrôle, entraînée par apprentissage par renforcement sans récompense d'imitation de mouvement, ne reçoit que la proprioception du robot et les commandes de vitesse, sans capteur de contact ni information sur l'état de la chaise. Lors d'essais à commandes aléatoires, elle a suivi les trajectoires demandées pendant la quasi-totalité de séquences de 20 secondes, dépassant même une politique de référence en position debout sur la précision de suivi. Une analyse factorielle menée sur quatre graines d'entraînement montre qu'une régularisation du glissement du pied réduit le coût de transport mais peut figer le robot dans un optimum stationnaire, un défaut corrigé en la combinant à une régularisation de symétrie ou à un curriculum de commandes. Le coût de transport se classe, du plus bas au plus élevé, marche arrière, déplacement latéral, puis marche avant. Transférée sans réentraînement sur un robot réel Unitree G1, la politique a produit une locomotion assise omnidirectionnelle. Ce travail s'attaque à un angle mort de la course aux humanoïdes, focalisée jusqu'ici sur la marche et la manipulation en position debout pour des tâches d'usine ou de logistique. Une grande partie du travail de bureau ou d'établi se fait pourtant assis, et maintenir un humanoïde debout en continu sollicite inutilement ses actionneurs et son énergie. En montrant qu'une politique entraînée uniquement par récompense de suivi de vitesse, sans imitation de mouvement ni capteurs de contact, transfère en zero-shot vers un robot réel, l'étude conforte l'idée que l'apprentissage par renforcement en simulation franchit l'écart sim-to-real sur des tâches de locomotion toujours plus spécialisées. L'étude reste un travail de recherche académique en prépublication, sans partenaire industriel ni calendrier de commercialisation annoncé, qui étend l'environnement standard de suivi de vitesse en position debout déjà utilisé dans la communauté robotique, avec un modèle de chaise passive et des récompenses propres à l'état assis. Le choix du Unitree G1, plateforme largement diffusée dans la recherche en contrôle moteur, en fait une base accessible plutôt qu'une vitrine commerciale, à la différence des plateformes propriétaires comme Figure ou Optimus. Les auteurs présentent ce résultat comme une première étape vers une locomanipulation assise complète, avant l'ajout probable de tâches de manipulation des bras pendant le déplacement sur la chaise.

RecherchePaper
1 source