Aller au contenu principal
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
RecherchearXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés.

L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur.

La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

Dans nos dossiers

À lire aussi

Adaptation de la démarche économe en énergie par apprentissage par renforcement hiérarchique pour la locomotion quadrupède sur terrains variés
1arXiv cs.RO 

Adaptation de la démarche économe en énergie par apprentissage par renforcement hiérarchique pour la locomotion quadrupède sur terrains variés

Des chercheurs proposent un cadre d'apprentissage par renforcement hiérarchique (HRL) qui sépare deux niveaux de contrôle pour la locomotion des robots quadrupèdes. Une politique haute fréquence assure l'exécution stable et robuste du mouvement au niveau des articulations. Une politique basse fréquence adapte la démarche en minimisant explicitement le coût de transport (CoT), c'est-à-dire l'énergie dépensée par unité de poids et de distance parcourue. L'entraînement se fait en trois étapes sous Isaac, le simulateur de NVIDIA. Il permet un transfert direct de la simulation au réel (zero-shot, sans réglage supplémentaire). Les auteurs le valident sur un quadrupède Unitree AlienGo. En simulation, ils le comparent à des politiques monolithiques et à des architectures hiérarchiques de référence. Ils annoncent un CoT réduit sur une large plage de vitesses commandées, avec une locomotion qui reste robuste sur sol plat, sol irrégulier et pentes. Le résumé publié ne donne aucun chiffre précis, ni pourcentage de réduction, ni valeur de CoT, ni vitesse maximale. L'intérêt principal est de s'attaquer à un défaut connu des politiques entièrement apprises de bout en bout. Dans ces systèmes, la génération de la démarche, l'exécution du mouvement et l'optimisation énergétique sont étroitement imbriquées. Le résultat dépend alors fortement de la pondération des termes de récompense, ce qui rend les politiques fragiles et difficiles à ajuster. En isolant la minimisation du CoT dans un niveau dédié, l'approche rend l'efficacité énergétique plus contrôlable, sans dégrader le suivi de vitesse. La hiérarchie fait aussi émerger une adaptation automatique de la démarche : le robot passe de l'amble (pacing) à basse vitesse au trot à vitesse plus élevée. Cela rappelle les transitions de allures observées chez les animaux, sans qu'elles aient été programmées. Pour les intégrateurs, l'autonomie est un facteur limitant des quadrupèdes d'inspection industrielle. Un gain énergétique obtenu par la politique seule, sans changement matériel, serait donc précieux. Il faudra toutefois le confirmer par des mesures d'autonomie réelles. Cette publication s'inscrit dans une série de travaux sur la locomotion apprise, qui ont largement utilisé Isaac Gym et Isaac Lab pour entraîner des politiques déployées sur des plateformes Unitree. Les approches hiérarchiques existent déjà. Elles séparent en général un planificateur de démarche ou de pas d'un contrôleur bas niveau. Ici, la particularité tient à l'optimisation explicite du CoT au niveau supérieur. Les limites sont claires. Il s'agit d'un preprint arXiv (2610.10297v1) non évalué par les pairs. Le test matériel porte sur un seul robot, l'AlienGo, plateforme plus ancienne que les Go2 ou B2 actuels de Unitree. Les terrains testés restent relativement simples. La suite logique serait de valider sur des plateformes plus récentes, avec des mesures de consommation en conditions réelles. Il faudrait aussi tester des terrains plus difficiles comme les escaliers, et comparer avec les contrôleurs commerciaux.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Reactivité physiquement réalisable pour la locomotion adaptative au terrain
2arXiv cs.RO 

Reactivité physiquement réalisable pour la locomotion adaptative au terrain

Voici l'article traduit et résumé selon les consignes. Une équipe de recherche présente un nouveau cadre de planification pour la locomotion des robots quadrupèdes sur des terrains changeants et imprévisibles, détaillé dans un article arXiv (2509.23185v2, version révisée). Le système combine deux briques technique distinctes : une synthèse réactive qui génère des contrôleurs symboliques "corrects par construction" pour décider quelle action prendre à chaque instant, et une programmation convexe en nombres mixtes (MICP) qui calcule en temps réel des placements de pas dynamiquement faisables. Pour éviter de recalculer sans cesse des problèmes MICP coûteux en ressources, et pour gérer les cas où une spécification devient physiquement impossible à tenir, les chercheurs ajoutent un mécanisme de réparation symbolique qui ne régénère que les transitions strictement nécessaires. Le tout a été validé en simulation puis sur robot physique, avec des scénarios volontairement difficiles : pierres de gué dispersées et terrains jonchés de barres d'armature (rebar), deux configurations classiques pour tester la robustesse du contact pied-sol. L'enjeu dépasse la simple démonstration académique. La marche sur terrain accidenté reste l'un des points faibles récurrents des plateformes quadrupèdes et humanoïdes commerciales, où les méthodes actuelles reposent soit sur des heuristiques de sélection d'appui limitant la fiabilité, soit sur une optimisation de trajectoire trop lourde pour tourner en temps réel sur de longs horizons. En montrant qu'un système peut identifier lui-même les "compétences de locomotion manquantes" et réagir en environnement critique, les auteurs adressent directement un doute répandu chez les intégrateurs industriels : la capacité réelle des robots à gérer l'imprévu hors des sols plats de laboratoire, condition clé pour un déploiement en logistique, construction ou inspection. Ce travail s'inscrit dans une lignée de recherches académiques en synthèse formelle et planification de mouvement pour la robotique legged, un domaine où les grands noms commerciaux (Boston Dynamics, Unitree) restent discrets sur leurs méthodes internes. La publication étant une "replace" d'une version arXiv antérieure, il s'agit d'un travail de recherche affiné plutôt que d'une annonce produit, sans calendrier de transfert industriel communiqué à ce stade.

RecherchePaper
1 source
EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive
3arXiv cs.RO 

EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive

Un article de recherche publié sur arXiv sous la référence 2609.14432 (septembre 2026) présente EMoG, un framework de génération de démarche modulée par l'émotion pour la locomotion expressive de robots humanoïdes, construit autour d'un « code de style émotionnel » dont l'intensité est ajustable en continu. Combiné à des commandes physiques classiques (vitesse, direction), ce code alimente un réseau MLP léger qui génère en temps réel des trajectoires de démarche périodiques, expressives et cohérentes avec la commande demandée, ensuite exécutées par une politique unique d'apprentissage par renforcement. Pour l'entraînement, les auteurs ont constitué un jeu de données de démarches annotées par émotion auprès de performeurs professionnels, avec un pipeline automatisé extrayant des cycles de marche périodiques physiquement cohérents. EMoG intègre également un parseur basé sur un LLM convertissant des instructions en langage naturel libre en paramètres de style émotionnel et de mouvement, pour un contrôle interactif. Les expériences rapportées montrent une modulation continue du style de marche avec des signaux expressifs perceptibles, sans dégradation du suivi des commandes physiques. La plupart des systèmes de locomotion humanoïde se concentrent sur la stabilité et l'exécution de tâches, laissant l'expressivité émotionnelle de côté ou reléguée aux gestes du haut du corps plutôt qu'intégrée au contrôle de la marche lui même. En traitant l'émotion comme un paramètre continu du contrôleur de bas niveau plutôt que comme une couche cosmétique ajoutée après coup, EMoG ouvre la voie à des robots capables de signaler un état (prudent, enjoué, fatigué) par leur simple façon de marcher, sans sacrifier la précision de navigation attendue par les intégrateurs. C'est aussi un signal de plus que les interfaces en langage naturel pilotées par LLM s'imposent comme couche de contrôle au dessus des politiques d'apprentissage par renforcement de bas niveau, une tendance déjà visible dans les architectures vision langage action du secteur. Ce travail s'inscrit dans un champ encore jeune : la quasi totalité des efforts commerciaux sur les humanoïdes, stabilité de marche, manipulation, téléopération, ignore largement la dimension expressive, jugée secondaire face aux enjeux de fiabilité et de rentabilité industrielle. EMoG reste à ce stade un travail académique publié en preprint, sans plateforme robotique ni partenaire industriel nommés dans le résumé, et sans annonce de déploiement réel : les résultats proviennent d'expériences contrôlées, pas d'un déploiement en usine ou en environnement public. Il rejoint néanmoins un intérêt croissant pour l'expressivité robotique comme levier d'acceptabilité sociale, un axe que laboratoires et startups d'interaction humain robot devraient suivre de près pour des usages d'accueil, de service ou de robotique sociale, où la perception émotionnelle du geste compte autant que la performance motrice.

RecherchePaper
1 source
UniPoint : fusion unifiée de capteurs au niveau des points pour la locomotion humanoïde sur terrains difficiles
4arXiv cs.RO 

UniPoint : fusion unifiée de capteurs au niveau des points pour la locomotion humanoïde sur terrains difficiles

Un preprint publié sur arXiv (référence 2609.23666v1) décrit UniPoint, un système de locomotion pour robots humanoïdes reposant sur la fusion de capteurs au niveau du point. Un LiDAR 360° et deux caméras de profondeur sont fusionnés dès l'acquisition en un nuage de points unique exprimé dans le référentiel du robot, puis voxélisé en un nombre fixe de tokens traités par auto-attention linéaire et par une attention croisée guidée par la proprioception, ce qui découple le coût de calcul du nombre de capteurs utilisés. Une seule session d'entraînement, combinant récompenses adaptées au terrain, injection de pannes de perception et randomisation de domaine, produit une politique unique valable pour huit types de terrains, déployée en embarqué sur un module RK3588 sans réglage fin additionnel. Sur un robot humanoïde baptisé DR02, les auteurs rapportent 20 essais pour chacune de neuf configurations réelles couvrant sept terrains, validant le franchissement de plateformes hautes de 70 cm, de brèches de 100 cm, d'obstacles fins verticaux et d'appuis étroits ou épars, avec une généralisation zero-shot en extérieur. Le résultat cible un problème concret pour tout déploiement humanoïde en environnement non structuré: la perception doit couvrir un large champ, rester précise localement et tolérer la panne d'un capteur, trois exigences que les approches existantes ne satisfont pas ensemble, une caméra frontale unique couvrant trop peu et les cartes d'élévation corrigées par odométrie dérivant sous mouvement brusque ou manquant les structures fines. En conservant une représentation par points plutôt que par grille d'image, et en ne perdant qu'une fraction des tokens quand une modalité tombe en panne, UniPoint dégrade progressivement plutôt que brutalement, un critère de fiabilité plus qu'une prouesse de démonstration. Qu'une politique unique, entraînée une seule fois, tienne sur huit terrains avec un calculateur embarqué grand public sans réajustement terrain par terrain va dans le sens d'architectures perception-action plus génériques. Ces travaux s'inscrivent dans la course à une locomotion humanoïde robuste hors laboratoire, où la difficulté porte moins sur la démonstration contrôlée que sur la tenue en conditions réelles avec des capteurs susceptibles de tomber en panne partiellement. Contrairement aux approches à encodage d'image par caméra, dont le coût croît avec le nombre de capteurs, UniPoint mise sur une fusion précoce au niveau point pour un coût constant. Il s'agit d'un preprint non encore relu par les pairs: il ne précise ni le fabricant du DR02 ni de calendrier commercial, et les essais rapportés (20 répétitions par scénario) restent des validations techniques limitées plutôt qu'un déploiement en flotte.

RecherchePaper
1 source