
MulDP : politique de diffusion multimodale pour la navigation parkour autonome d'un quadrupède en terrains complexes
Des chercheurs ont présenté MulDP (Multimodal Diffusion Policy), décrit dans un article publié en septembre 2026 sur arXiv (arXiv:2609.03984), pour rendre autonome la navigation parkour des robots quadrupèdes. Jusqu'ici, la plupart des systèmes de ce type, même capables de franchir des obstacles complexes, dépendent encore d'un opérateur humain pour la planification de haut niveau. MulDP fusionne perception visuelle, proprioception et information d'objectif pour générer des commandes de vitesse cohérentes et anticipatrices, couplant étroitement perception et contrôle. Les auteurs ont aussi constitué le premier jeu de données dédié à cette tâche, le Quadruped Parkour Navigation Dataset (QPND), couvrant des comportements de navigation variés sur des terrains complexes, et démontrent en simulation comme sur robot réel une navigation autonome robuste sur de longs horizons.
Ce résultat vise un goulot d'étranglement connu du secteur : les démonstrations spectaculaires de parkour quadrupède restent souvent scriptées ou pilotées à distance pour la décision de trajectoire, même quand la locomotion bas niveau est déjà autonome. En confiant cette décision à un modèle de diffusion multimodal plutôt qu'à un contrôleur réactif classique, les auteurs cherchent à combler l'écart entre agilité motrice et autonomie cognitive, un enjeu concret pour les intégrateurs voulant déployer des quadrupèdes en inspection ou intervention sur sites accidentés sans supervision humaine constante. La publication du dataset QPND compte potentiellement autant que le modèle lui-même : faute de données standardisées, chaque équipe devait jusqu'ici constituer ses propres scénarios de test, ce qui limitait la comparabilité des résultats entre laboratoires.
Le travail s'inscrit dans une lignée de recherches portée par des plateformes comme Spot de Boston Dynamics, ANYmal d'ANYbotics ou les séries Go2 et B2 de Unitree, qui ont démontré des capacités de franchissement d'obstacles impressionnantes mais rarement autonomes de bout en bout. MulDP se positionne face aux approches de contrôle par apprentissage par renforcement pur, en misant sur les modèles de diffusion déjà popularisés en manipulation robotique par des politiques comme Diffusion Policy ou des architectures vision-langage-action telles que Pi-0 et GR00T N2. À ce stade, il s'agit d'une contribution de recherche validée en simulation et sur banc d'essai réel, sans déploiement industriel ni partenariat commercial annoncé, mais QPND ouvre la voie à des comparaisons futures pour d'autres équipes académiques ou industrielles travaillant sur l'autonomie des robots à pattes.
Dans nos dossiers




