Aller au contenu principal
RecherchearXiv cs.RO 

L'écho des pas : apprendre le parkour humanoïde perceptif grâce à une mémoire à portes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent dans un article publié sur arXiv (identifiant 2609.28960v1), intitulé "Echo in the Steps: Learning Perceptive Humanoid Parkour with Gated Memory", un système permettant à un robot humanoïde de franchir des terrains hautement discontinus, comme des points d'appui rares ou des surfaces de contact étroites, en s'appuyant uniquement sur des observations de profondeur embarquées, sans capteur externe. Le cœur du système est un module de perception temporelle guidé par la saillance, qui combine un a priori de saillance visuelle avec une mémoire à portes (gated memory) conservant les informations de profondeur pertinentes d'une image à l'autre, même lorsque l'observation instantanée est partielle ou occluse. Les auteurs ajoutent une fonction de perte d'alternance, une régularisation de symétrie qui force le contrôleur à produire un schéma de marche en alternance des appuis, jugée essentielle lors de transitions rapides entre appuis espacés. Le papier rapporte des gains significatifs de taux de réussite et de précision de placement du pied sur des terrains difficiles, validés en simulation et sur un robot réel, sans toutefois préciser de chiffres exacts de performance, de gabarit du robot ou de temps de cycle dans le résumé disponible.

Ce résultat cible un verrou précis de la locomotion humanoïde perceptive: si le franchissement de terrains structurés, escaliers, pentes, obstacles réguliers, est déjà largement maîtrisé par les commandes apprises par renforcement, le parkour sur appuis épars reste un problème ouvert, car il exige une sélection anticipée des points de contact à partir de la vision plutôt qu'une simple robustesse proprioceptive. Le travail illustre une tendance de fond en robotique humanoïde: le passage d'une locomotion "aveugle" reposant sur le seul retour proprioceptif vers des architectures exploitant activement une mémoire visuelle pour compenser l'observabilité partielle des capteurs embarqués. Pour les intégrateurs et décideurs industriels, l'enjeu est concret: la capacité à traverser des sols irréguliers, chantiers ou gravats, plutôt que les seuls sols plats d'entrepôt, conditionne l'élargissement des cas d'usage réels des humanoïdes au-delà des démonstrations contrôlées. Il s'agit néanmoins d'un résultat académique publié en preprint, non d'un produit commercialisé ni d'un déploiement en flotte, et l'ampleur exacte des essais réels n'est pas détaillée dans le résumé.

Ce travail s'inscrit dans la lignée des avancées récentes en locomotion perceptive pour humanoïdes, un domaine où laboratoires académiques et industriels de la robotique bipède cherchent à combiner apprentissage par renforcement et perception visuelle pour sortir du seul sol plat. Le résumé de l'article ne mentionne aucun partenariat industriel ni acteur français ou européen impliqué dans ces travaux. Les suites attendues pour ce type de recherche restent celles du cycle académique classique: publication détaillée avec code et données, extension des essais réels à davantage de types de terrain et, à terme, un éventuel transfert vers des plateformes humanoïdes commerciales cherchant à renforcer leur robustesse en environnement non structuré.

Dans nos dossiers

À lire aussi

Apprentissage de la traversée agile de structures 3D éparses par des humanoïdes grâce à la perception
1arXiv cs.RO 

Apprentissage de la traversée agile de structures 3D éparses par des humanoïdes grâce à la perception

Les chercheurs à l'origine de la publication arXiv 2608.29769, mise en ligne fin août 2026, présentent un système de contrôle perceptif pour robot humanoïde capable de traverser des structures 3D éparses de type barres de singe (monkey bars). Le robot doit sauter pour agripper la structure, se déplacer de barre en barre par brachiation, puis atterrir en sécurité. La politique de contrôle, entraînée par apprentissage par renforcement, exploite directement les données brutes d'un lidar solid-state monté sur la tête, traitées par un encodeur à mécanisme d'attention couplé à une mémoire récurrente pour extraire la géométrie utile de retours lidar clairsemés. L'entraînement suit un pipeline enseignant-élève séquencé par phases, combinant des experts privilégiés spécialisés pour le saut initial, la brachiation et l'atterrissage. Le transfert vers le matériel réel intègre la modélisation du bruit lidar, de la chute de tension de la batterie et des limites thermiques des actionneurs, le robot étant équipé de crochets passifs en guise d'effecteurs pour une prise fiable sur les barres. Sur le matériel, la politique complète la séquence saut-brachiation-atterrissage dans 14 essais sur 15, sur trois configurations de barres différentes, avec des vitesses de brachiation atteignant 0,5 m/s. Le même socle de perception permet aussi d'entraîner séparément une politique capable de se baisser sous des obstacles suspendus fins, avec des sections de seulement 2 cm. Ce travail illustre un déplacement du curseur dans la recherche en robotique humanoïde: au-delà de la marche sur sol plat, l'enjeu devient la traversée de terrains épars et suspendus, difficiles à percevoir avec un lidar dont les retours sont peu denses sur des géométries fines. Le taux de réussite de 14/15, bien que sur seulement trois configurations testées et non en environnement réel diversifié, constitue une preuve tangible que le transfert simulation-vers-réel peut fonctionner pour du contrôle dynamique du corps entier conditionné par la perception, y compris en tenant compte de contraintes matérielles concrètes comme la dérive de tension batterie ou l'échauffement des actionneurs. Pour les intégrateurs et décideurs du secteur, ce résultat reste un signal de recherche plutôt qu'une brique produit: il valide une approche technique (RL perceptif basé lidar avec encodeur attentionnel) mais ne dit rien des coûts, de la robustesse en conditions non contrôlées, ni d'un calendrier de commercialisation. Le papier s'inscrit dans une dynamique plus large de la recherche en locomotion agile pour humanoïdes, où les capacités testées glissent progressivement de la marche et de la course vers des compétences proches du parkour: sauts précis, franchissement d'obstacles suspendus, préhension dynamique. Le résumé ne précise pas l'affiliation des auteurs ni de partenariat industriel, et aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes attendues pour ce type de travaux incluent l'élargissement à des configurations de barres plus variées et des tests en environnements moins contrôlés, avant d'envisager une application à des scénarios concrets comme l'inspection ou la navigation en environnement encombré.

RecherchePaper
1 source
LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif
2arXiv cs.RO 

LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif

Des chercheurs ont publié le 5 juin 2026 sur arXiv (preprint 2606.05873) un système baptisé LadderMan, conçu pour permettre à des robots humanoïdes de grimper des échelles de géométries variées et d'effectuer des tâches de manipulation en position perchée. L'architecture repose sur un pipeline d'apprentissage en deux étapes : une phase de suivi de mouvement hybride extrait plusieurs politiques d'escalade expertes à partir d'une seule motion de référence, puis une phase de distillation fusionne ces experts en une politique visuomotrice unifiée, pilotée par caméra de profondeur, via une combinaison d'imitation et de renforcement. Pour combler l'écart simulation-réel sur la perception de profondeur, l'équipe exploite des modèles de vision fondationnels. La manipulation en hauteur est gérée par une formulation dite "dual-agent" : un agent dédié à la stabilité sur l'échelle, un autre à la manipulation, avec télé-opération comme signal superviseur. Les expériences rapportent un transfert zéro-shot vers le hardware réel, sans fine-tuning supplémentaire. L'escalade d'échelle constitue l'un des tests les plus discriminants pour les humanoïdes : les points d'appui sont rares et fixes, la coordination corps entier est critique, et la moindre erreur de perception ou de contrôle peut provoquer une chute. Le transfert zéro-shot réussi de la simulation au réel est ici le résultat le plus significatif : il suggère que les modèles de vision fondationnels permettent d'atténuer suffisamment le sim-to-real gap sur des tâches perceptivo-motrices contraintes, une hypothèse longtemps débattue dans la communauté. La capacité à manipuler des objets depuis une position instable ouvre des perspectives concrètes pour l'inspection industrielle, la maintenance en hauteur et les chantiers de construction. Il convient cependant de souligner qu'il s'agit d'un preprint de recherche, non d'un produit commercialisé, et que les vidéos publiées sur ladderman-robot.github.io restent sélectionnées par les auteurs. Ce travail s'inscrit dans une vague active de recherche poussant les humanoïdes vers des environnements contraints et à risque élevé. Aucune entreprise commerciale n'est identifiée dans le preprint, ce qui suggère une origine académique. Sur le plan concurrentiel, aucun constructeur humanoïde majeur, ni Boston Dynamics (Atlas), ni Figure (Figure 03), ni Tesla (Optimus Gen 3), ni Agility Robotics (Digit), n'a à ce jour publié de démonstration d'escalade d'échelle à ce niveau de robustesse et de transfert zéro-shot. Les prochaines étapes logiques seraient un test sur une gamme plus large de robots humanoïdes commerciaux et une intégration de la manipulation autonome, sans télé-opération.

RecherchePaper
1 source
Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit
3arXiv cs.RO 

Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit

Des chercheurs ont publié le 18 septembre 2026 sur arXiv (référence 2609.19272) une méthode de navigation autonome pour robots humanoïdes baptisée RoM-Nav, testée sur un Unitree G1. Le problème de départ est concret: un pipeline d'apprentissage par renforcement (RL) classique à un seul étage échoue à monter en échelle sur des terrains multi-niveaux et multi-étages, freiné par la difficulté des interactions pied-terrain complexes comme les escaliers. La solution proposée décompose la navigation en deux étapes. D'abord, une politique entraînée sur une dynamique d'ordre réduit (reduced order model) mais alimentée par des observations LiDAR 3D complètes apprend à se repérer dans un terrain complexe à plusieurs étages. Cette connaissance sert ensuite à amorcer une seconde politique opérant sur la dynamique complète du robot, avec une politique de locomotion déjà entraînée et figée intégrée dans la boucle. Un filtre de sécurité dit de Poisson est ajouté en sortie de la politique de navigation pour garantir la sécurité face à des obstacles inédits, sans dégrader le taux de réussite. Sur le G1, les essais ont couvert une navigation sans carte préalable (mapless) avec plus de 10 mètres de dénivelé vertical cumulé et plus de 100 mètres de trajet parcouru. L'intérêt pour le secteur tient à ce que ce travail s'attaque directement à un angle mort connu de la robotique humanoïde: la locomotion pure a beaucoup progressé, mais l'autonomie de navigation en environnement bâti réel, avec escaliers et changements d'étage, reste un goulot d'étranglement pour tout déploiement industriel ou logistique. En montrant qu'une décomposition hiérarchique (modèle réduit puis politique complète) permet de dépasser les limites du RL monolithique, et qu'un filtre de sécurité formel peut être ajouté sans sacrifier la performance, l'étude apporte un argument concret dans le débat sur la fiabilité des humanoïdes hors des démonstrations scénarisées. Ce résultat s'inscrit dans une recherche académique en cours plutôt que dans un produit commercial: il s'agit d'un preprint arXiv, non encore validé par relecture par les pairs, mais démontré sur du matériel réel plutôt qu'en simulation seule. Le choix du Unitree G1, plateforme largement utilisée par les laboratoires universitaires pour son accessibilité, souligne aussi que ce type d'expérimentation reste pour l'instant du ressort de la recherche plutôt que du déploiement en flotte. Les auteurs mettent à disposition une page projet avec vidéos (wdc3iii.github.io/rom-nav) mais n'annoncent pas de calendrier de transfert vers l'industrie.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde
4arXiv cs.RO 

Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde

Un preprint arXiv (2609.18732v1) publié mi-septembre 2026 présente PASSAGE, un système de planification et de suivi de mouvement conditionné par la perception, pour des robots humanoïdes traversant des environnements encombrés en enjambant, contournant ou se baissant devant les obstacles. Entraîné sur 100 heures de mouvements humains captés en réalité virtuelle et par capture inertielle sur 1500 scènes, un planificateur par flow-matching génère des trajectoires courtes exécutées à 50 Hz par un contrôleur corps entier avec retour géométrique, puis affiné par apprentissage par renforcement, contrôleur figé. Passer de 6 à 100 heures de données porte le taux de succès sans contact de 48,1% à 68,9% sur des scènes inédites, jusqu'à 70,3% avec augmentation de scène validée. Le système fonctionne entièrement en embarqué sur un Jetson AGX Orin, avec LiDAR 3D, cartographie en ligne, planification à 6,25 Hz et contrôle à 50 Hz, testé sur 50 configurations physiques inédites sans carte préconstruite ni calcul déporté. Le résultat s'attaque à un verrou du déploiement humanoïde hors laboratoire : choisir et enchaîner, depuis la seule perception embarquée, le bon comportement de franchissement selon la géométrie rencontrée, sans bibliothèque de mouvements ni récompense spécifique à chaque obstacle. Une seule paire planificateur-contrôleur généralise ici à des géométries jamais vues, ce qui va dans le sens d'un passage à l'échelle des données de démonstration plutôt que de l'ingénierie tâche par tâche, comme le montrent déjà les modèles vision-langage-action en manipulation tels que Pi-0, GR00T N2 ou Helix. Ce travail illustre un basculement de la recherche humanoïde, concentrée jusqu'ici sur la manipulation avec les modèles vision-langage-action, vers la locomotion en environnement non structuré, restée en retrait malgré la course menée par Figure, Tesla ou Unitree. Le choix du flow-matching pour générer les trajectoires prolonge une tendance déjà observée après les modèles de diffusion. Le preprint ne précise ni plateforme robotique commerciale ni entreprise porteuse : il reste, à ce stade, un résultat de recherche testé en simulation et sur un nombre limité de configurations physiques réelles, sans calendrier de transfert vers un produit. Aucun acteur français ou européen n'y figure.

RecherchePaper
1 source