Aller au contenu principal
RecherchearXiv cs.RO 

Maîtriser une politique de conduite autonome de bout en bout pour la navigation urbaine de robots quadrupèdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Go2-DrivoR, une adaptation conditionnée par un objectif de DrivoR, un cadre de planification de trajectoire de conduite autonome de bout en bout, pour la navigation urbaine de robots quadrupèdes. Le sigle Go2 renvoie vraisemblablement au chien robot Unitree Go2, sans que le résumé le précise. La méthode injecte un sous-objectif exprimé dans le repère local du robot via un « goal token », un jeton d'entrée dédié. Elle modifie aussi la formulation du score, pensée au départ pour un véhicule. La conformité à la zone praticable est redéfinie pour une navigation orientée trottoir. Le terme de progression de l'ego est reformulé en progression conditionnée par l'objectif. Les décodeurs centraux de DrivoR ne sont pas redessinés. Le modèle est entraîné uniquement sur les données de simulation TartanGround. Il améliore la planification conditionnée par des points de passage dans des environnements simulés inédits, et se transfère en zero-shot à la prédiction de trajectoire en boucle ouverte dans le monde réel.

L'intérêt tient à la réutilisation d'une politique issue de la conduite autonome sur une plateforme à pattes. Les piétons, les bordures, les traversées et les obstacles dynamiques demandent déjà des compétences proches de celles des voitures, et la plupart des robots quadrupèdes n'ont pas de planificateur de ce type. Le résultat renforce l'idée qu'un transfert sim-to-real est possible avec des données purement synthétiques, sans collecte terrain coûteuse. Les limites sont nettes. L'évaluation réelle se fait en boucle ouverte : le modèle prédit des trajectoires comparées à des données enregistrées, mais ne pilote pas le robot. Aucun taux de réussite de navigation en boucle fermée, aucune distance parcourue, aucune latence d'inférence et aucun déploiement réel n'est fourni dans le résumé. Il s'agit d'une preuve de concept académique, pas d'un produit. Pour les intégrateurs de robots de livraison ou d'inspection urbaine, le signal est encourageant mais prématuré.

DrivoR vient de la recherche en conduite autonome de bout en bout, qui a fait converger perception, prédiction et planification dans un seul réseau, avec un scoring des trajectoires candidates. TartanGround est un jeu de données de simulation associé à la robotique terrestre. Les approches concurrentes pour la locomotion urbaine reposent plutôt sur des modèles de navigation généralistes entraînés sur des vidéos ou des données multi-plateformes, ou sur des piles modulaires classiques de cartographie et de planification. Le travail est publié sur arXiv (2610.08812v1), sans code, benchmark chiffré ni calendrier annoncés dans le résumé. La suite logique est une validation en boucle fermée sur robot réel, avec des mesures de sécurité et de robustesse en conditions urbaines variées.

Dans nos dossiers

À lire aussi

MulDP : politique de diffusion multimodale pour la navigation parkour autonome d'un quadrupède en terrains complexes
1arXiv cs.RO 

MulDP : politique de diffusion multimodale pour la navigation parkour autonome d'un quadrupède en terrains complexes

Des chercheurs ont présenté MulDP (Multimodal Diffusion Policy), décrit dans un article publié en septembre 2026 sur arXiv (arXiv:2609.03984), pour rendre autonome la navigation parkour des robots quadrupèdes. Jusqu'ici, la plupart des systèmes de ce type, même capables de franchir des obstacles complexes, dépendent encore d'un opérateur humain pour la planification de haut niveau. MulDP fusionne perception visuelle, proprioception et information d'objectif pour générer des commandes de vitesse cohérentes et anticipatrices, couplant étroitement perception et contrôle. Les auteurs ont aussi constitué le premier jeu de données dédié à cette tâche, le Quadruped Parkour Navigation Dataset (QPND), couvrant des comportements de navigation variés sur des terrains complexes, et démontrent en simulation comme sur robot réel une navigation autonome robuste sur de longs horizons. Ce résultat vise un goulot d'étranglement connu du secteur : les démonstrations spectaculaires de parkour quadrupède restent souvent scriptées ou pilotées à distance pour la décision de trajectoire, même quand la locomotion bas niveau est déjà autonome. En confiant cette décision à un modèle de diffusion multimodal plutôt qu'à un contrôleur réactif classique, les auteurs cherchent à combler l'écart entre agilité motrice et autonomie cognitive, un enjeu concret pour les intégrateurs voulant déployer des quadrupèdes en inspection ou intervention sur sites accidentés sans supervision humaine constante. La publication du dataset QPND compte potentiellement autant que le modèle lui-même : faute de données standardisées, chaque équipe devait jusqu'ici constituer ses propres scénarios de test, ce qui limitait la comparabilité des résultats entre laboratoires. Le travail s'inscrit dans une lignée de recherches portée par des plateformes comme Spot de Boston Dynamics, ANYmal d'ANYbotics ou les séries Go2 et B2 de Unitree, qui ont démontré des capacités de franchissement d'obstacles impressionnantes mais rarement autonomes de bout en bout. MulDP se positionne face aux approches de contrôle par apprentissage par renforcement pur, en misant sur les modèles de diffusion déjà popularisés en manipulation robotique par des politiques comme Diffusion Policy ou des architectures vision-langage-action telles que Pi-0 et GR00T N2. À ce stade, il s'agit d'une contribution de recherche validée en simulation et sur banc d'essai réel, sans déploiement industriel ni partenariat commercial annoncé, mais QPND ouvre la voie à des comparaisons futures pour d'autres équipes académiques ou industrielles travaillant sur l'autonomie des robots à pattes.

RecherchePaper
1 source
Apprentissage de politique par phases pour la conduite de skateboard par des robots quadrupèdes via modulation linéaire par caractéristiques
2arXiv cs.RO 

Apprentissage de politique par phases pour la conduite de skateboard par des robots quadrupèdes via modulation linéaire par caractéristiques

Des chercheurs ont publié sur arXiv (2602.09370v2) un cadre d'apprentissage par renforcement baptisé PAPL (Phase-Aware Policy Learning), conçu pour permettre à des robots quadrupèdes de se déplacer sur une planche de skateboard. Le défi central est la nature cyclique et multi-phasée de l'activité : pousser, glisser et freiner mobilisent des objectifs de contrôle distincts et des interactions fortement dépendantes de la perception. Pour y répondre, PAPL intègre des couches FiLM (Feature-wise Linear Modulation) conditionnées par phase dans les réseaux acteur et critique de l'agent, permettant à une politique unifiée de capturer les comportements propres à chaque phase tout en partageant la connaissance générale du robot entre elles. Les évaluations en simulation valident la précision du suivi de commande, des études d'ablation quantifient la contribution de chaque composant, et les auteurs comparent l'efficacité locomotrice à des baselines pattes seules et pattes-roues. Un transfert sim-to-real est également démontré sur plateforme physique, bien que l'abstract ne précise pas le modèle de robot utilisé ni les métriques de performance obtenues. L'intérêt principal de cette approche tient à sa capacité à gérer des comportements multi-modaux au sein d'une politique unique, sans multiplier les modules spécialisés par phase. Utiliser un skateboard comme vecteur de locomotion est économique en énergie et compact, ce qui ouvre des perspectives concrètes dans des environnements industriels ou logistiques où les robots doivent couvrir de longues distances sans recharger. La démonstration du transfert simulation-réel est l'élément le plus scruté par la communauté robotique : le sim-to-real gap reste l'obstacle central à la généralisation des politiques apprises par renforcement, et chaque validation hardware crédibilise un cadre. À noter toutefois que l'abstract ne fournit aucune métrique chiffrée précise (vitesse, taux de succès, distance), ce qui limite l'évaluation indépendante des performances avant lecture du papier complet. PAPL s'inscrit dans un courant de recherche plus large visant à doter les robots à pattes de modes de mobilité hybrides ou étendus. Les couches FiLM, initialement développées pour le raisonnement visuel conditionné en apprentissage automatique, trouvent ici une application originale dans le contrôle moteur cyclique. Sur le plan concurrentiel, les plateformes pattes-roues comme l'ANYmal WE d'ANYbotics ou les variantes hybrides de Unitree explorent une voie différente : l'intégration des roues y est mécanique, non comportementale. L'approche PAPL est donc structurellement distincte et potentiellement complémentaire à ces architectures. Ce travail reste à ce stade un preprint arXiv sans déploiement commercial annoncé ; les suites logiques seraient une validation sur plateforme standardisée et une soumission en conférence majeure comme ICRA ou IROS 2026.

RecherchePaper
1 source
LEAP : la perception active émergente pour la navigation des robots quadrupèdes
3arXiv cs.RO 

LEAP : la perception active émergente pour la navigation des robots quadrupèdes

Une équipe de recherche publie sur arXiv (2609.17628, mi-septembre 2026) une méthode baptisée LEAP, qui entraîne des politiques de navigation à choisir elles-mêmes où diriger leur regard plutôt que de subir passivement le flux de caméra imposé. Testée sur une tâche de navigation vers des objectifs visuellement cachés en terrain accidenté, la méthode fait émerger ce contrôle du regard uniquement sous la pression de la tâche, sans bonus artificiel de couverture ou de curiosité, grâce à une représentation invariante au point de vue qui fusionne des images de profondeur dans des cartes de croyance égocentriques. Sur des scénarios inédits, LEAP atteint 92,7% de réussite, contre 74,2% pour une perception scriptée et 34,5% pour une perception passive, à 4,6 points d'un oracle privilégié; les mêmes politiques pilotent aussi, sans modification, la locomotion de robots quadrupèdes en simulation physique. Le résultat s'attaque à un problème connu: les objectifs de substitution conçus à la main pour inciter un agent à bouger sa caméra entrent souvent en conflit avec la tâche réelle et dégradent les performances. LEAP montre qu'un contrôle du regard utile peut émerger d'un entraînement centré uniquement sur la réussite de la tâche, un point qui intéresse les concepteurs de politiques de navigation pour quadrupèdes et robots mobiles amenés à opérer en environnements non structurés, chantiers ou zones dangereuses. L'écart de 40 points entre perception scriptée et passive illustre le coût d'une caméra fixe face à un système qui choisit où regarder, mais ces chiffres restent issus de scénarios de simulation choisis par les auteurs, sans validation sur robot physique. La perception active, soit le choix du point de vue plutôt que sa réception passive, est un axe ancien de recherche en robotique et en apprentissage par renforcement, généralement traité par des récompenses de curiosité ou des objectifs de couverture ajoutés artificiellement; LEAP cherche à s'affranchir de ces heuristiques externes. L'article, nouvelle soumission arXiv non encore relue par les pairs, ne mentionne aucune affiliation industrielle ni partenaire matériel. Face à des acteurs de la navigation quadrupède comme Boston Dynamics, Unitree ou ANYbotics, LEAP reste à ce stade un résultat de recherche en simulation, sans calendrier de portage réel ni pilote annoncé.

RecherchePaper
1 source
SmoothTurn : apprendre à tourner en douceur pour une navigation agile avec des robots quadrupèdes
4arXiv cs.RO 

SmoothTurn : apprendre à tourner en douceur pour une navigation agile avec des robots quadrupèdes

Traduction et résumé de l'article ci-dessous. L'équipe de recherche à l'origine de SmoothTurn s'attaque à un angle mort des politiques de navigation locale pour robots quadrupèdes : la capacité à enchaîner des virages fluides tout en courant à haute vitesse. Les approches existantes entraînent typiquement une politique à atteindre un seul objectif à la fois, en récompensant le robot pour rester immobile une fois la cible atteinte. Résultat, lorsqu'on enchaîne plusieurs objectifs nécessitant des changements de direction, le robot ne peut ni anticiper la manœuvre suivante ni conserver son élan lors du passage d'un objectif à l'autre, ce qui brise sa dynamique de course. SmoothTurn reformule le problème comme une tâche de navigation locale séquentielle et introduit trois éléments techniques : une récompense conçue pour l'atteinte séquentielle d'objectifs, un espace d'observation élargi incluant une fenêtre d'anticipation ("lookahead") sur les objectifs futurs, et un curriculum d'apprentissage automatique qui augmente progressivement la difficulté des séquences d'objectifs en fonction des performances du robot. La politique entraînée a été déployée directement sur des robots quadrupèdes réels, avec capteurs et calcul embarqués, sans étape d'adaptation supplémentaire. Cette avancée cible un écart concret entre démonstration et réalité opérationnelle pour les cas d'usage à forte valeur comme l'intervention en incendie ou l'inspection industrielle, où la vitesse ET la manœuvrabilité comptent autant l'une que l'autre. Une politique qui sait maintenir son élan en pivotant, au lieu de ralentir puis réaccélérer à chaque changement de cap, se rapproche davantage de ce qu'exige un déploiement terrain réel plutôt qu'un simple parcours de démonstration en ligne droite. Pour les intégrateurs et décideurs qui évaluent des plateformes quadrupèdes pour des missions agiles, ce type de résultat conforte l'idée que l'apprentissage par renforcement peut produire des comportements moteurs sophistiqués et transférables du simulateur au monde réel (sim-to-real), sans nécessiter de re-conception matérielle. Les auteurs rapportent des résultats empiriques en simulation et sur robot réel montrant des comportements émergents non explicitement programmés : contrôle de l'élan lors du changement d'objectif, orientation anticipée vers la prochaine cible, et planification de trajectoires efficaces. SmoothTurn s'inscrit dans la lignée des travaux antérieurs sur la navigation locale conditionnée par un objectif unique, qu'il étend au cas séquentiel. Le papier, initialement soumis sous l'identifiant arXiv:2603.12842 puis republié en version corrigée, ne précise pas quel modèle de robot quadrupède a servi aux essais réels ni le nom du laboratoire ou de l'université porteurs du projet. Ce travail se positionne dans un champ de recherche actif sur la locomotion agile par apprentissage, aux côtés d'efforts similaires chez des acteurs académiques et industriels travaillant sur des quadrupèdes comme ceux de Boston Dynamics ou Unitree. Les prochaines étapes attendues porteraient sur l'extension à des terrains plus complexes ou irréguliers et sur des tests d'endurance en conditions réelles prolongées, non détaillés dans le résumé disponible.

RecherchePaper
1 source