Aller au contenu principal
RecherchearXiv cs.RO 

Guidage dynamique inspiré de la marche passive pour une locomotion humanoïde économe en énergie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un cadre d'apprentissage par renforcement inspiré de la marche dynamique passive (PDW) pour réduire le coût énergétique de la locomotion humanoïde. Pendant les premières phases d'entraînement, un champ de gravité incliné crée des conditions équivalentes à une pente et facilite la progression sagittale sur un sol pourtant plat, avec des termes de récompense couplés à un curriculum. Toute aide spécifique à la PDW est ensuite retirée avant l'optimisation sous dynamique nominale. Le cœur de la méthode n'exige ni trajectoire de référence, ni phases de marche, ni calendrier de contacts. Testé sur un Unitree G1 à 29 DOF, avec cinq graines d'entraînement en marche avant, le cadre réduit le coût de transport mécanique de 6,8 à 15,2 % pour des vitesses commandées de 0,5 à 2,0 m/s, sans dégrader le suivi de vitesse. La décomposition du travail mécanique attribue ce gain au travail positif des actionneurs. Sur le matériel réel, le coût de transport en marche avant baisse de 16,3 % avec un a priori de mouvement dédié à la marche, et de 4,5 % sans lui.

Ce résultat déplace la question de l'efficacité énergétique, qui n'est plus seulement une affaire de pénalités d'effort dans la récompense. Ces pénalités n'orientent que indirectement la mécanique pas à pas, alors que le guidage par la dynamique agit sur la coordination de la démarche elle-même. Pour les intégrateurs et les décideurs B2B, l'autonomie est un facteur limitant du déploiement des humanoïdes : un coût de transport plus bas prolonge le temps de service par charge et allège les contraintes thermiques. Le gain est aussi obtenu sans données de mouvement propriétaires. Les auteurs distinguent l'accélération de l'apprentissage de la marche, apportée par le régime guidé, du bénéfice supplémentaire de l'inclinaison sur l'économie finale. Il faut toutefois nuancer : sur robot réel, le gain de 4,5 % sans a priori de mouvement reste dans la dispersion d'un essai à l'autre, donc statistiquement fragile.

Le travail s'inscrit dans le courant dominant de la locomotion humanoïde par apprentissage par renforcement en simulation, où la marche est généralement obtenue par mise en forme de la récompense, imitation de références ou contraintes de contacts. Le G1 d'Unitree sert de plateforme de recherche répandue, ce qui facilite la reproduction. Le cadre s'étend à la locomotion omnidirectionnelle sans assistance : le bénéfice persiste lorsqu'un a priori de mouvement spécifique à la marche fournit la coordination cinématique, et l'association réduit alors le coût de transport à vitesse égale de 18,7 %. Aucun pilote industriel ni calendrier de déploiement n'est annoncé, et les résultats matériels portent sur un seul type de robot, en marche avant. La suite logique consiste à valider ces gains sur d'autres morphologies, en charge utile et sur terrains variés, avant tout transfert vers des produits commerciaux.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Apprentissage par renforcement informé par la dynamique pour la locomotion agile et économe en énergie d'un quadricoptère sauteur monopode
1arXiv cs.RO 

Apprentissage par renforcement informé par la dynamique pour la locomotion agile et économe en énergie d'un quadricoptère sauteur monopode

Une équipe de recherche en robotique présente un cadre d'apprentissage par renforcement (RL) appliqué à un quadcopter monopode à sauts, un robot hybride combinant rotors et une jambe unique à ressort pour se déplacer par bonds plutôt que par vol stationnaire pur. Publié sur arXiv (2609.15399v1, article de recherche, pas d'annonce produit), le travail introduit une méthode dite "dynamics-informed" où une valeur cible d'énergie spécifique est intégrée directement dans la fonction de récompense, ce qui contraint l'optimisation à rester sur une trajectoire énergétique physiquement viable. Le système récompense aussi la cohérence de phase entre les appuis au sol, ce qui encourage un mouvement d'impulsion bio-inspiré pendant la phase de contact, et pénalise le gaspillage électromécanique pour que les moteurs génèrent une impulsion efficace sans recourir à des machines à états programmées à la main. Validé uniquement en simulation MuJoCo, et non sur un prototype physique, le contrôleur régule la hauteur de saut et suit une vitesse d'avancement jusqu'à 2,0 m/s malgré un fort couplage entre l'attitude du robot et les phases de contact au sol, tout en réduisant la consommation d'énergie de 82% par rapport à un vol stationnaire classique et de 73% par rapport à une politique RL non contrainte énergétiquement. L'enjeu dépassе la simple performance: les auteurs ciblent explicitement le "reward hacking", un travers connu du RL où l'algorithme trouve des raccourcis qui maximisent la récompense sans produire un comportement physiquement sensé ou économe. En forçant l'optimisation à rester sur une enveloppe énergétique réaliste, l'étude propose une piste méthodologique transférable à d'autres robots hybrides ou legged, un sujet clé pour les intégrateurs qui cherchent à réduire l'autonomie limitée des drones et des robots à pattes. Elle illustre aussi les limites actuelles du secteur: la démonstration reste cantonnée au simulateur, ce qui laisse ouverte la question classique du transfert sim-to-real. Les robots aériens à pattes forment une catégorie encore émergente, cherchant à combiner l'agilité du saut avec l'efficacité énergétique du vol, deux modes de locomotion habituellement traités séparément dans la littérature. L'article ne mentionne ni partenaire industriel ni calendrier de test matériel, ce qui situe cette contribution au stade de la recherche amont, avec un prototype physique et une validation réelle comme suites logiques attendues.

RecherchePaper
1 source
EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive
2arXiv cs.RO 

EMoG : génération de démarche modulée par l'émotion pour une locomotion humanoïde expressive

Un article de recherche publié sur arXiv sous la référence 2609.14432 (septembre 2026) présente EMoG, un framework de génération de démarche modulée par l'émotion pour la locomotion expressive de robots humanoïdes, construit autour d'un « code de style émotionnel » dont l'intensité est ajustable en continu. Combiné à des commandes physiques classiques (vitesse, direction), ce code alimente un réseau MLP léger qui génère en temps réel des trajectoires de démarche périodiques, expressives et cohérentes avec la commande demandée, ensuite exécutées par une politique unique d'apprentissage par renforcement. Pour l'entraînement, les auteurs ont constitué un jeu de données de démarches annotées par émotion auprès de performeurs professionnels, avec un pipeline automatisé extrayant des cycles de marche périodiques physiquement cohérents. EMoG intègre également un parseur basé sur un LLM convertissant des instructions en langage naturel libre en paramètres de style émotionnel et de mouvement, pour un contrôle interactif. Les expériences rapportées montrent une modulation continue du style de marche avec des signaux expressifs perceptibles, sans dégradation du suivi des commandes physiques. La plupart des systèmes de locomotion humanoïde se concentrent sur la stabilité et l'exécution de tâches, laissant l'expressivité émotionnelle de côté ou reléguée aux gestes du haut du corps plutôt qu'intégrée au contrôle de la marche lui même. En traitant l'émotion comme un paramètre continu du contrôleur de bas niveau plutôt que comme une couche cosmétique ajoutée après coup, EMoG ouvre la voie à des robots capables de signaler un état (prudent, enjoué, fatigué) par leur simple façon de marcher, sans sacrifier la précision de navigation attendue par les intégrateurs. C'est aussi un signal de plus que les interfaces en langage naturel pilotées par LLM s'imposent comme couche de contrôle au dessus des politiques d'apprentissage par renforcement de bas niveau, une tendance déjà visible dans les architectures vision langage action du secteur. Ce travail s'inscrit dans un champ encore jeune : la quasi totalité des efforts commerciaux sur les humanoïdes, stabilité de marche, manipulation, téléopération, ignore largement la dimension expressive, jugée secondaire face aux enjeux de fiabilité et de rentabilité industrielle. EMoG reste à ce stade un travail académique publié en preprint, sans plateforme robotique ni partenaire industriel nommés dans le résumé, et sans annonce de déploiement réel : les résultats proviennent d'expériences contrôlées, pas d'un déploiement en usine ou en environnement public. Il rejoint néanmoins un intérêt croissant pour l'expressivité robotique comme levier d'acceptabilité sociale, un axe que laboratoires et startups d'interaction humain robot devraient suivre de près pour des usages d'accueil, de service ou de robotique sociale, où la perception émotionnelle du geste compte autant que la performance motrice.

RecherchePaper
1 source
Apprentissage de l'exploitation de la dynamique passive pour un saut ciblé économe en énergie d'un quadricoptère à pattes ressorts
3arXiv cs.RO 

Apprentissage de l'exploitation de la dynamique passive pour un saut ciblé économe en énergie d'un quadricoptère à pattes ressorts

Le 15 septembre 2026, une équipe de recherche a publié sur arXiv (arXiv:2609.15447v1) une nouvelle méthode de contrôle pour un quadricoptère monopode à jambe ressort, un robot hybride qui combine poussée aérienne et rebond passif sur une jambe équipée d'un ressort pour se déplacer sur terrain accidenté. Les auteurs remplacent le réglage heuristique par PID, habituellement utilisé pour coordonner poussée active et dynamique de contact passive, par une politique entraînée par apprentissage par renforcement (Proximal Policy Optimization, PPO) qui commande directement les quatre moteurs à partir de l'état estimé du robot, sans machine à états de saut ni boucle PID d'attitude bas niveau. La fonction de récompense combine un module "Energy-Manifold Shaping", qui suit une trajectoire d'énergie verticale normalisée par la masse et ancre l'état au sommet de chaque saut, et un module "Efficiency Shaping", qui s'appuie sur un estimateur de puissance tenant compte de l'historique pour pénaliser la consommation générale, ajouter un coût spécifique à la puissance en phase aérienne, et limiter la quasi-immobilité en vol. Sur des essais matériels représentatifs, la politique PPO réduit la puissance électrique mesurée, moyennée sur le cycle, de 30,7%, et la poussée totale normalisée moyenne de 49,8% par rapport au contrôleur PID de référence, tout en conservant des sauts répétables à hauteur commandée et des atterrissages plus concentrés. Ce résultat s'adresse directement aux limites connues des robots hybrides sol-air: le PID, réglé à la main, sous-exploite la dynamique passive du ressort et gaspille de l'énergie en poussée continue pour compenser une coordination imparfaite. Montrer qu'une politique bout-en-bout, sans machine à états ni boucles imbriquées, réduit à la fois la consommation électrique et la poussée nécessaire tout en gardant la précision de saut, constitue un argument concret pour l'apprentissage par renforcement appliqué à des systèmes physiques à dynamiques de contact intermittentes, un cas plus difficile que la marche pure ou le vol pur. Pour les intégrateurs travaillant sur des robots de terrain autonomes sur batterie, ce type de gain énergétique conditionne directement l'autonomie de mission, un facteur souvent plus limitant que la puissance de calcul embarquée. Le papier s'inscrit dans une lignée de recherche qui cherche à combiner la rapidité de déplacement de l'aérien avec l'efficacité énergétique du contact au sol, une alternative aux quadrirotors purs ou aux robots à pattes classiques pour franchir des obstacles. Il s'agit ici d'un résultat de recherche publié en preprint, validé sur du matériel en conditions représentatives mais pas encore d'un produit commercial ni d'un déploiement opérationnel. Les auteurs ne précisent pas de prochaine étape chiffrée, mais la logique de l'article ouvre la voie à des essais sur terrains plus variés et à une généralisation au-delà du suivi de hauteur de saut.

RecherchePaper
1 source
Spiderbot : un hexapode open source économe en énergie, à compensation passive de la gravité
4arXiv cs.RO 

Spiderbot : un hexapode open source économe en énergie, à compensation passive de la gravité

Une équipe de recherche a publié en open source Spiderbot, un robot hexapode conçu pour réduire drastiquement sa consommation d'énergie grâce à une compensation passive de la gravité. Contrairement à la plupart des plateformes hexapodes, qui utilisent des pattes à 3 degrés de liberté (DOF) sans gain notable en locomotion, Spiderbot repose sur une conception à 2 DOF par patte associée à un mécanisme à quatre barres muni d'un ressort passif soutenant mécaniquement le poids du corps. Ce dispositif ramène la consommation en position debout à 1,5W seulement, soit une réduction de plus de 90% par rapport à une version non ressortée du même robot et jusqu'à 96% par rapport à d'autres hexapodes comparables. La compensation reste efficace jusqu'à une charge utile de 3,25kg, sans couple supplémentaire requis. Fabriqué pour moins de 400 dollars, le robot a été testé sur terrain plat et accidenté, sur des pentes jusqu'à 15 degrés et face à des obstacles de type marches, avec une locomotion pilotée par une politique d'apprentissage par renforcement entraînée dans le simulateur mjlab et transférée avec succès en conditions réelles. L'équipe a mis en ligne l'ensemble des fichiers CAO, des instructions d'assemblage, du code d'entraînement et de déploiement, ainsi que les points de contrôle du modèle. La démonstration a une portée pratique concrète pour la robotique à pattes: en montrant qu'une compensation mécanique passive peut réduire de plus de 90% la consommation d'énergie en position statique, Spiderbot lève l'un des principaux obstacles aux déploiements longue durée sur batterie modeste. Son coût sous les 400 dollars et son caractère entièrement open source en font une base attractive pour des expérimentations multi-agents à grande échelle, un terrain de recherche habituellement coûteux avec des plateformes commerciales fermées. Le transfert sim-to-real réussi via mjlab confirme par ailleurs que l'apprentissage par renforcement peut gérer un mécanisme non trivial à quatre barres et ressort, sans nécessiter de modèle dynamique simplifié, un point souvent fragile dans les démonstrations robotiques. Cette publication s'inscrit dans une littérature de recherche sur les compromis entre degrés de liberté, poids et consommation énergétique des robots à pattes, où les architectures à 3 DOF par patte restent la norme malgré leur surcoût énergétique. Les auteurs comparent explicitement leur plateforme à une version non ressortée du même hexapode ainsi qu'à d'autres hexapodes similaires, sans citer de concurrents commerciaux issus de l'industrie humanoïde. En publiant intégralement matériel et logiciel sous licence ouverte, l'équipe vise une adoption par d'autres laboratoires pour des expériences reproductibles, notamment en essaims robotiques, plutôt qu'une commercialisation immédiate. Aucun calendrier de déploiement pilote n'est annoncé: à ce stade, il s'agit d'une contribution académique publiée sur arXiv, sans produit commercial associé.

RecherchePaper
1 source