Aller au contenu principal
RecherchearXiv cs.RO 

LEAP : la perception active émergente pour la navigation des robots quadrupèdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.17628, mi-septembre 2026) une méthode baptisée LEAP, qui entraîne des politiques de navigation à choisir elles-mêmes où diriger leur regard plutôt que de subir passivement le flux de caméra imposé. Testée sur une tâche de navigation vers des objectifs visuellement cachés en terrain accidenté, la méthode fait émerger ce contrôle du regard uniquement sous la pression de la tâche, sans bonus artificiel de couverture ou de curiosité, grâce à une représentation invariante au point de vue qui fusionne des images de profondeur dans des cartes de croyance égocentriques. Sur des scénarios inédits, LEAP atteint 92,7% de réussite, contre 74,2% pour une perception scriptée et 34,5% pour une perception passive, à 4,6 points d'un oracle privilégié; les mêmes politiques pilotent aussi, sans modification, la locomotion de robots quadrupèdes en simulation physique.

Le résultat s'attaque à un problème connu: les objectifs de substitution conçus à la main pour inciter un agent à bouger sa caméra entrent souvent en conflit avec la tâche réelle et dégradent les performances. LEAP montre qu'un contrôle du regard utile peut émerger d'un entraînement centré uniquement sur la réussite de la tâche, un point qui intéresse les concepteurs de politiques de navigation pour quadrupèdes et robots mobiles amenés à opérer en environnements non structurés, chantiers ou zones dangereuses. L'écart de 40 points entre perception scriptée et passive illustre le coût d'une caméra fixe face à un système qui choisit où regarder, mais ces chiffres restent issus de scénarios de simulation choisis par les auteurs, sans validation sur robot physique.

La perception active, soit le choix du point de vue plutôt que sa réception passive, est un axe ancien de recherche en robotique et en apprentissage par renforcement, généralement traité par des récompenses de curiosité ou des objectifs de couverture ajoutés artificiellement; LEAP cherche à s'affranchir de ces heuristiques externes. L'article, nouvelle soumission arXiv non encore relue par les pairs, ne mentionne aucune affiliation industrielle ni partenaire matériel. Face à des acteurs de la navigation quadrupède comme Boston Dynamics, Unitree ou ANYbotics, LEAP reste à ce stade un résultat de recherche en simulation, sans calendrier de portage réel ni pilote annoncé.

À lire aussi

Robot quadrupède : navigation par imagination latente prédictive
1arXiv cs.RO 

Robot quadrupède : navigation par imagination latente prédictive

Des chercheurs ont publié sur arXiv (arXiv:2607.17574, dépôt de juillet 2026) une nouvelle méthode d'entraînement pour la navigation de robots quadrupèdes en environnement dynamique. Le système part d'une architecture réactive classique, un backbone LSTM-SRU qui choisit ses actions à partir des observations courantes et d'une mémoire à court terme, et lui ajoute pendant l'entraînement un prédicteur auxiliaire de type JEPA couplé à une régularisation SIGReg. Ce module apprend à l'état caché du réseau à anticiper son propre état futur, donc la dynamique probable des obstacles mobiles à court horizon, avant d'être entièrement supprimé au moment de l'inférence : le contrôleur final reste aussi léger que la version purement réactive, sans paramètre ni coût de calcul supplémentaire. Les auteurs valident l'approche en simulation puis sur un robot réel, un Unitree Go2, déployé en environnements intérieurs encombrés et en extérieur avec obstacles dynamiques, avec transfert sim-to-réel en zero-shot, c'est-à-dire sans aucun réglage fin sur le robot physique. L'intérêt de ce travail est de s'attaquer à un problème concret des politiques de navigation par apprentissage par renforcement : leur tendance à réagir trop tard face à des obstacles mobiles, parce que le risque de collision dépend de la structure de la scène à court horizon et non de la seule position instantanée des obstacles. En injectant une supervision prédictive uniquement pendant l'entraînement, la méthode évite le compromis habituel entre capacité d'anticipation et complexité embarquée à l'inférence, un enjeu central pour les intégrateurs qui doivent faire tourner ces contrôleurs sur du matériel embarqué à ressources limitées. Le transfert zero-shot vers un Go2 sans fine-tuning est aussi un point notable : il illustre que l'écart sim-to-réel, souvent cité comme le principal obstacle à la robotique mobile apprise, peut être réduit sans données réelles supplémentaires pour ce type de tâche de navigation. À noter toutefois que l'abstract ne fournit pas de chiffres précis de taux de réussite ou de réduction de collisions, seulement une amélioration qualifiée de substantielle. Ce travail s'inscrit dans la lignée des méthodes d'apprentissage prédictif du monde (world models, architectures JEPA popularisées notamment par les travaux de Yann LeCun chez Meta) appliquées cette fois à la robotique locomotrice plutôt qu'à la vision ou au langage. Il rejoint une tendance plus large de la recherche en navigation robotique visant à doter les politiques réactives de capacités anticipatives sans alourdir l'inférence, un axe suivi par plusieurs laboratoires travaillant sur les quadrupèdes de type Unitree Go2 ou Boston Dynamics Spot. Les prochaines étapes attendues incluent l'extension à des flottes de robots ou à des environnements encore plus denses en obstacles humains, ainsi que la comparaison directe avec d'autres approches prédictives publiées sur les mêmes benchmarks.

RecherchePaper
1 source
Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles
2arXiv cs.RO 

Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles

Des chercheurs présentent APT-RL (Action Pretrained Transformer-based Reinforcement Learning), un framework unifié permettant à un robot quadrupède de franchir des terrains complexes en n'utilisant que ses capteurs et son calcul embarqués, sans dépendre d'une infrastructure externe. La méthode génère d'abord des jeux de données de mouvement 2D à grande échelle via optimisation de trajectoires sur une dynamique simplifiée, ce qui permet d'entraîner des compétences de locomotion variées et réutilisables. Ces compétences servent ensuite de base solide pour apprendre des tâches plus complexes en 3D, avec transition autonome entre différentes allures. Lors des tests en conditions réelles, le robot a exécuté des manœuvres agiles à travers des obstacles intérieurs et extérieurs, y compris des sauts en descente dynamiques atteignant une vitesse de pointe instantanée de 6 mètres par seconde. Une seule politique embarquée lui a permis de franchir escaliers, haies, pierres de gué, trous et branches tombées au sol, sans changer de modèle selon le type d'obstacle. L'intérêt de ce travail réside dans sa capacité à combiner plusieurs compétences motrices en un seul système embarqué et autonome, un point de friction connu dans la robotique quadrupède où la plupart des démonstrations reposent encore sur des politiques spécialisées par terrain ou sur une assistance en calcul déporté. En s'appuyant uniquement sur la perception et le calcul embarqués, APT-RL s'attaque directement à l'écart classique entre simulation et réalité, tout en montrant que des priors de mouvement générés à moindre coût en 2D peuvent se généraliser efficacement à des environnements 3D non structurés. Pour les intégrateurs travaillant sur l'inspection industrielle, la robotique de terrain ou les interventions en environnement accidenté, cela représente une piste concrète vers des robots capables de gérer la diversité des obstacles réels sans reconfiguration manuelle entre chaque scénario. Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion des robots à pattes, un domaine où des plateformes comme Unitree Go2, Boston Dynamics Spot ou ANYbotics ANYmal servent de référence pour les capacités tout-terrain. Publié comme preprint sur arXiv, l'article ne précise ni laboratoire porteur ni calendrier de déploiement commercial : il s'agit à ce stade d'une contribution de recherche, sans indication de produit shippé ni de pilote industriel annoncé.

RecherchePaper
1 source
Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes
3arXiv cs.RO 

Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2606.25179) une étude portant sur la conception de contrôleurs de locomotion universels pour robots quadrupèdes, capables de s'adapter à plusieurs morphologies de robots différents tout en intégrant de la perception en temps réel. Les auteurs s'appuient sur le cadre MorAL (Morphology-Aware Locomotion), qu'ils étendent en comparant trois architectures : un contrôleur aveugle (baseline sans perception), MorAL+ (perception intégrée uniquement dans le critique du réseau, pas dans l'acteur), et PPAL (acteur-critique entièrement perceptif). Les politiques ont été évaluées en simulation sur terrains plats et accidentés, puis déployées sur du matériel réel via le robot ANYmal d'ANYbotics. Résultat principal : MorAL+ surpasse les deux autres configurations en robustesse et en cohérence de suivi de trajectoire, notamment parce qu'un acteur entièrement perceptif se révèle sensible au bruit de capteur, tandis qu'un acteur aveugle manque de conscience du terrain. Ce résultat va à contre-courant d'une intuition répandue dans la communauté robotique : intégrer plus de perception n'est pas toujours meilleur. Le fait que la perception placée uniquement dans le critique (et non dans l'acteur) améliore la robustesse sans fragiliser la politique face au bruit de capteur est une contribution architecturale concrète. Pour les intégrateurs industriels qui déploient des quadrupèdes en environnements non structurés (entrepôts, sites industriels, inspection d'infrastructures), cette distinction a des implications directes sur la conception des pipelines de contrôle. Elle indique aussi que le problème du sim-to-real pour la locomotion quadrupède n'est pas uniquement une question de quantité de données perceptives, mais de leur positionnement dans l'architecture d'apprentissage par renforcement. ANYmal, développé par ANYbotics (spin-off de l'ETH Zurich), est l'un des robots quadrupèdes les plus utilisés en recherche académique et en déploiements industriels pilotes, aux côtés de Spot de Boston Dynamics et des modèles Unitree (Go2, B2) qui dominent le segment prix bas. Le cadre MorAL, sur lequel s'appuie ce travail, visait déjà à entraîner des politiques transférables entre morphologies de robots différents, un problème ouvert dans la course à la généralisation inter-robots (cross-embodiment). Ce papier reste pour l'instant un preprint académique sans déploiement industriel annoncé ; les suites naturelles seraient une validation sur un ensemble plus large de morphologies quadrupèdes et des tests en conditions réelles prolongées, en dehors du cadre contrôlé d'un labo.

UEANYbotics étant un spin-off suisse de l'ETH Zurich, les conclusions architecturales sur MorAL+ intéressent directement les intégrateurs européens qui déploient des quadrupèdes en inspection industrielle ou en environnements non structurés.

RecherchePaper
1 source
Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage
4arXiv cs.RO 

Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage

Des chercheurs présentent VOP-Nav, un système de navigation pour robots quadrupèdes conçu pour évoluer dans des environnements denses et dynamiques, où l'occlusion des capteurs et l'imprévisibilité des déplacements humains posent des défis majeurs. Le cœur du système est un réseau baptisé VOP-Net, qui traite des données LiDAR multi-frames captées en local pour encoder implicitement les contraintes dynamiques de l'environnement et prédire une zone de vitesse sûre, dérivée de la théorie des Velocity Obstacles (VO). Fait notable, cette prédiction VO sert un double rôle : elle alimente la politique de navigation en inférence, et sert de signal de récompense pendant l'entraînement pour favoriser des trajectoires sûres. Le système a été évalué dans le simulateur Isaac Gym, puis déployé en conditions réelles sur un robot quadrupède Unitree Go2, en intérieur comme en extérieur, sans pipeline explicite de détection et de suivi d'obstacles. L'enjeu dépassé ici est un compromis classique en robotique mobile : les méthodes à base de modèle comme les Velocity Obstacles garantissent la sécurité en théorie, mais s'effondrent en environnement dense car elles dépendent d'estimations précises du mouvement des obstacles, difficiles à obtenir dans une foule. À l'inverse, les approches d'apprentissage de bout en bout sont plus robustes mais manquent de capacité de prédiction, ce qui produit soit des collisions, soit des comportements trop prudents. En hybridant les deux, VOP-Nav vise directement le goulot d'étranglement qui freine le déploiement de quadrupèdes et, plus largement, de plateformes mobiles autonomes dans des espaces partagés avec des humains, entrepôts, hôpitaux, bureaux, un enjeu suivi de près par les intégrateurs travaillant avec des plateformes comme Go2 ou Spot. Le papier s'inscrit dans la lignée des travaux sur la navigation sociale et l'évitement d'obstacles dynamiques, où les méthodes géométriques classiques (VO, ORCA) et l'apprentissage par renforcement coexistent sans avoir jusqu'ici bien fusionné. Publié comme preprint arXiv (2607.15036), le travail n'a pas encore fait l'objet de revue par les pairs ; les auteurs revendiquent des taux de réussite supérieurs à leurs bases de comparaison en simulation, sans toutefois préciser de chiffres exacts ni le protocole complet d'évaluation, un point à surveiller avant toute extrapolation vers un déploiement industriel à grande échelle.

RecherchePaper
1 source