Aller au contenu principal
RecherchearXiv cs.RO 

DAWN : parkour robuste au bruit pour quadrupède via des modèles du monde débruiteurs de profondeur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté DAWN (Denoising and Alignment in World models for Noise-robustness), un cadre de perception robuste au bruit pour la locomotion des robots à pattes, décrit dans un article publié sur arXiv (2609.29092v1). Testé sur un quadrupède Unitree Go1, le système exécute du parkour en zero-shot, sans réentraînement ni calibration manuelle de filtre au déploiement : franchissement d'escaliers jusqu'à 18 cm, de trous jusqu'à 70 cm et montée de marches jusqu'à 45 cm, à partir de données de profondeur brutes et bruitées. La méthode combine deux mécanismes intégrés au world model : l'encodeur reçoit une image de profondeur bruitée tout en étant entraîné à reconstruire la version propre correspondante, ce qui le force à débruiter implicitement, tandis qu'un apprentissage contrastif aligne les représentations latentes des versions bruitées et propres d'une même scène. DAWN n'est lié à aucun modèle de bruit particulier et n'ajoute aucun coût de calcul par rapport aux méthodes existantes à world model. Des ablations montrent que le débruitage, au niveau de la reconstruction, et l'alignement contrastif, au niveau de la représentation, apportent des gains complémentaires et cumulatifs.

Cette approche cible un point faible connu des pipelines de locomotion par vision : entraînés sur des données de profondeur propres, ils dépendent ensuite de filtres de post-traitement réglés à la main dont les paramètres sont rarement publiés, ce qui nuit à la reproductibilité et dégrade les performances quand le bruit n'est pas traité. En supprimant cette calibration manuelle, DAWN réduit la charge d'ingénierie pour les intégrateurs déployant des capteurs de profondeur bon marché ou bruyants sur des terrains réels, et remet en question l'idée qu'un modèle de perception entraîné en simulation nécessite un réglage fin spécifique au capteur pour combler l'écart entre simulation et monde réel. Les résultats restent toutefois démontrés sur une seule plateforme, le Go1, en conditions expérimentales, et non lors d'un déploiement industriel à grande échelle.

DAWN prolonge les travaux sur la locomotion par world models et étend à la perception visuelle une robustesse au bruit déjà explorée pour les capteurs proprioceptifs, un axe resté largement inexploité pour la profondeur. Il s'inscrit dans la vague de démonstrations de parkour quadrupède portées ces dernières années par des plateformes comme celles de Unitree et par des laboratoires académiques travaillant sur la locomotion en terrain extrême. Le code et les vidéos ont été publiés sur dawn-parkour.github.io, une démarche de transparence qui tranche avec l'opacité des filtres propriétaires que l'article dénonce. Il s'agit à ce stade d'une contribution de recherche en preprint, sans partenariat industriel ni calendrier de déploiement commercial annoncé.

À lire aussi

PUMA : un modèle de terrain à base de perception pour l'agilité augmentée du parkour quadrupède
1arXiv cs.RO 

PUMA : un modèle de terrain à base de perception pour l'agilité augmentée du parkour quadrupède

Le PUMA (Perception-driven Unified Foothold Prior for Mobility Augmented Parkour) est un nouveau cadre d'apprentissage de bout en bout destine aux robots quadrupèdes pratiquant le parkour, décrit dans une version révisée d'un article arXiv (2601.15995v2). Contrairement aux approches classiques qui séparent perception et contrôle via des contrôleurs hiérarchiques suivant des appuis precalcules, PUMA fusionne perception visuelle et estimation des appuis au sein d'un seul processus d'entrainement. Le système exploite les caractéristiques du terrain pour estimer des "priors" de pose du pied en coordonnées polaires égocentriques, c'est a dire la distance relative et le cap par rapport a l'obstacle, ce qui guide en temps réel l'adaptation posturale du robot. Les auteurs rapportent des expériences menées a la fois en simulation et sur robot réel, sur une variété de terrains discrets et complexes (marches, gaps, obstacles disperses), avec des résultats d'agilité et de robustesse supérieurs aux méthodes de référence dans ces scenarios difficiles. L'enjeu pour l'industrie robotique tient a la limite structurelle des pipelines hiérarchiques encore dominants sur les quadrupèdes commerciaux: un module de perception estime la carte du terrain, un planificateur choisit des points d'appui, puis un contrôleur bas niveau exécuté la trajectoire. Cette chaine rigidifie la réactivité du robot face a des changements de terrain imprévus et brise le lien direct entre ce que le robot voit et ce qu'il fait, ce qui restreint aussi la capacité de l'apprentissage par renforcement a explorer des stratégies motrices originales. En fusionnant perception et priors d'appui dans un entrainement unique, PUMA s'inscrit dans une tendance plus large vers des politiques visuomotrices intégrées, déjà explorées pour la manipulation avec les architectures VLA, et applique cette logique a la locomotion agile. Si les résultats se confirment hors du cadre de publication, cela renforcerait l'hypothèse que l'apprentissage end-to-end peut remplacer des pipelines modulaires plus lourds a maintenir pour les intégrateurs. Le parkour quadrupède s'est impose ces dernières années comme un benchmark standard pour évaluer l'agilité des robots a pattes, dans la lignée de travaux comme Extreme Parkour ou les démonstrations sur plateformes de type ANYmal et Unitree Go. PUMA se positionne dans cette compétition académique en ciblant spécifiquement le problème du foothold sélection, souvent traite séparément de la politique de locomotion. L'article reste a ce stade une contribution de recherche publiée sur arXiv, sans plateforme matérielle commerciale nommée ni annonce de déploiement industriel; les prochaines étapes attendues seraient une validation sur des quadrupèdes du commerce et une comparaison plus directe avec les pipelines hiérarchiques encore utilises en production.

RecherchePaper
1 source
DeViGrasp : préhension mobile visuelle robuste pour manipulateurs quadrupèdes en cas de perception dégradée
2arXiv cs.RO 

DeViGrasp : préhension mobile visuelle robuste pour manipulateurs quadrupèdes en cas de perception dégradée

Un article publié sur arXiv (2609.22278v1) présente DeViGrasp-Bench et DeViGrasp-Net, un banc d'essai et une méthode pour la préhension mobile des manipulateurs quadrupèdes en cas de perception visuelle dégradée. Le benchmark applique des dégradations contrôlées, occlusions, décrochage du masque de segmentation, bruit de profondeur, instabilité de localisation de la cible, sur des objets connus et inconnus, plusieurs niveaux de difficulté et des terrains complexes. DeViGrasp-Net combine un enseignant privilégié, qui raisonne hors ligne sur des candidats de préhension conditionnés par l'état de l'objet, du robot et de la tâche, et un élève déployable qui fusionne une perception de profondeur segmentée en double vue avec des hypothèses de cible actuelles, mémorisées et de secours, via deux modules nommés Target Hold Memory et Temporal Memory Attention. En configuration Difficult, le taux de réussite atteint 62,3%, soit 16,1 points de plus que VBC et 4,3 de plus qu'une version adaptée de DQ-Net, écart qui grimpe à 10,5 points face à DQ-Net en configuration Hard. Le travail cible un angle mort de la manipulation mobile : les politiques de contrôle corps entier sont généralement validées sous perception quasi idéale, alors que les déploiements réels exposent caméras et capteurs de profondeur embarqués à des occlusions et du bruit. En formalisant ces dégradations dans un benchmark reproductible plutôt qu'en anecdotes, les auteurs objectivent l'écart entre démonstrations contrôlées et robustesse opérationnelle, un point sensible pour les intégrateurs évaluant des quadrupèdes à bras pour la logistique ou l'inspection industrielle. Le gain provient moins d'une perception brute améliorée que d'une gestion de la mémoire temporelle et de la fiabilité des estimations de cible, ce qui suggère que la robustesse peut s'obtenir par architecture logicielle plutôt que par des capteurs plus coûteux. L'approche s'inscrit dans la recherche sur les manipulateurs quadrupèdes, robots à pattes équipés d'un bras combinant mobilité tout-terrain et dextérité de préhension, et se positionne explicitement contre deux méthodes de référence, VBC et une adaptation de DQ-Net, qu'elle surpasse sur tous les niveaux de dégradation testés. Il s'agit pour l'instant d'une publication de recherche accompagnée d'un benchmark ouvert, non d'un produit commercialisé : aucun partenaire industriel ni déploiement sur robot physique au-delà de la simulation n'est mentionné, les gains étant confirmés par des études d'ablation. Le benchmark ouvre la voie à des comparaisons futures, alors que les quadrupèdes à bras commencent tout juste à sortir des laboratoires pour des essais pilotes en conditions réelles.

RecherchePaper
1 source
Modèle du monde conditionné par la morphologie pour la locomotion quadrupède multi-morphologie
3arXiv cs.RO 

Modèle du monde conditionné par la morphologie pour la locomotion quadrupède multi-morphologie

Une équipe de chercheurs présente le Quadrupedal World Model (QWM) dans une version révisée d'un article disponible sur arXiv (2604.08780v2). Le travail cible un verrou connu des modèles du monde en robotique légée : un modèle de dynamique entraîné sur un quadrupède ANYmal-D, conçu par l'entreprise suisse ANYbotics, échoue une fois transféré sur un Unitree Go1, car il surapprend la morphologie précise du robot d'origine plutôt que la dynamique de locomotion partagée entre plateformes. Le moindre changement d'actionneur ou de longueur de membre oblige alors à tout réentraîner. QWM contourne ce problème en formalisant les traits physiques de chaque robot dans une spécification de morphologie invariante à l'échelle, injectée dans un modèle génératif unique via un encodeur de morphologie, un normaliseur de récompense adaptatif et un conditionnement de morphologie dans la dynamique latente, les politiques de contrôle étant entraînées entièrement en imagination. À information de morphologie égale, une politique sans modèle obtient des résultats comparables à QWM sur les robots vus à l'entraînement, mais se dégrade sur des morphologies inédites, alors que QWM transfère en zero-shot, sans réglage fin ni adaptation. Pour les intégrateurs de robotique légée, cela suggère qu'un seul modèle du monde pourrait à terme piloter toute une famille de robots de gabarits différents sans réentraînement coûteux par machine, un frein connu au déploiement de flottes hétérogènes. Les auteurs revendiquent la première démonstration d'un transfert zero-shot cross-embodiment par modèle du monde au sein de la famille des quadrupèdes, un résultat encore limité à ce type de morphologie. Ce travail s'inscrit dans la lignée des modèles du monde, un paradigme visant à faire apprendre à un agent la physique de son environnement une seule fois pour en dériver des comportements efficacement, plutôt que de multiplier les interactions par tâche. Les deux plateformes testées, l'ANYmal-D suisse et le Go1 chinois de Unitree, comptent parmi les références les plus utilisées en recherche académique sur la locomotion quadrupède. La mention "replace" sur arXiv signale une version révisée sans détail public sur les changements apportés. À ce stade, QWM reste un résultat de recherche en preprint, sans annonce de déploiement industriel ni de partenariat constructeur ; une extension à d'autres familles de robots ou une validation sur matériel réel n'est pas précisée dans cet article.

RecherchePaper
1 source
Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique
4arXiv cs.RO 

Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique

Une équipe de chercheurs a publié le framework IFM (Imitating and Finetuning Model Predictive Control), une approche hybride pour le contrôle de robots quadrupèdes sur des terrains difficiles. La méthode, disponible sur arXiv sous la référence 2311.02304v3, s'articule en trois phases séquentielles : d'abord, un contrôleur MPC classique est construit à partir de la Programmation Dynamique Différentielle (DDP) couplée à l'heuristique de Raibert pour définir une politique experte ; ensuite, ce contrôleur est cloné par apprentissage par imitation afin de le rendre adaptable par gradient ; enfin, un deep reinforcement learning (RL) à exploration volontairement limitée affine la politique sur des terrains exigeants, notamment surfaces rugueuses, revêtements glissants et tapis roulants. Des expériences menées en simulation puis sur matériel réel valident les performances du framework dans ces trois configurations. Le principal apport d'IFM est de combiner la robustesse formelle du contrôle model-based et la flexibilité de l'apprentissage profond, sans les défauts propres à chaque approche prise isolément. En pratique, IFM produit des allures (gaits) significativement plus symétriques, périodiques et économes en énergie que le RL classique dit "Vanilla RL", tout en réduisant considérablement le travail de reward shaping, c'est-à-dire la conception laborieuse de fonctions de récompense qui constitue l'un des principaux freins industriels au RL pour la locomotion. L'exploration limitée en phase RL est une décision architecturale notable : elle contraint le réseau à rester proche de la politique MPC apprise, ce qui stabilise l'apprentissage sur des terrains hors distribution sans divergence comportementale, un résultat difficile à obtenir avec du RL pur. Le contrôle de la locomotion quadrupède est un champ de recherche dense depuis les travaux fondateurs de Marc Raibert au MIT Leg Lab dans les années 1980, dont l'heuristique de placement de pied est encore employée ici comme référence. Les approches récentes se partagent entre contrôle model-based pur (ETH Zurich avec ANYmal et le groupe RSL), RL pur (UC Berkeley, Carnegie Mellon) et hybrides croissants. IFM s'inscrit dans cette troisième catégorie, en compétition directe avec des pipelines teacher-student d'ETH Zurich ou des frameworks comme DribbleBot. La publication ne mentionne aucun déploiement industriel ni partenariat commercial : il s'agit d'une contribution académique, dont la valeur pratique dépendra de sa transferabilité à des robots commerciaux comme l'Unitree Go2 ou le Boston Dynamics Spot, plateformes sur lesquelles plusieurs groupes appliquent déjà des méthodologies similaires.

RecherchePaper
1 source