Aller au contenu principal
RecherchearXiv cs.RO 

La fluidité comme contrainte pour une locomotion humanoïde stable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publié sur arXiv (2609.24552) présente DeCap, un algorithme d'apprentissage par renforcement sous contraintes pour le contrôle corps entier des robots humanoïdes. Le constat de départ : le bas du corps doit rester réactif pour l'équilibre, tandis que le haut du corps doit être fortement régulé pour la stabilité, une distinction que les méthodes RL classiques ignorent en imposant la fluidité via des récompenses auxiliaires uniformes, qui entrent en concurrence avec les objectifs de tâche. DeCap découple les contraintes en deux groupes, haut et bas du corps, formulées comme des limites physiques explicites de vitesse et d'accélération, complétées par une pénalité barrière qui s'active dès l'approche de ces limites sans diverger. Sur une tâche réelle de contrôle corps entier, il réduit le taux de variation des actions du haut du corps d'un facteur 2,50 et l'accélération d'un facteur 2,18 par rapport aux politiques basées récompense, tout en améliorant aussi la fluidité du bas du corps.

Ce résultat s'attaque à un compromis concret pour l'industrie : un haut du corps trop rigide limite la dextérité utile, un haut du corps mal amorti compromet l'équilibre et use l'actionnement, un frein réel au déploiement en usine ou en entrepôt où sécurité et répétabilité priment. Le tuning manuel des récompenses selon le terrain ou la tâche est un goulot d'étranglement connu du RL appliqué à la locomotion humanoïde ; qu'un même jeu de contraintes se transfère sans retuning à des terrains variés, si confirmé au-delà des conditions testées, réduirait le coût d'ingénierie pour les intégrateurs. L'approche questionne aussi la pratique dominante du reward shaping en RL, en montrant qu'une contrainte physique explicite offre un contrôle plus direct et prévisible que des pénalités négociées.

Le travail s'inscrit dans le champ du RL sous contraintes, une alternative au RL par récompense pure qui gagne du terrain à mesure que les humanoïdes passent des démonstrations en laboratoire à des essais en conditions réelles, où la marge d'erreur mécanique est faible. Il agit à un niveau différent de celui des modèles vision-langage-action qui pilotent la planification haut niveau des humanoïdes : DeCap se concentre sur la couche bas niveau de génération de mouvement. Classé comme nouvelle publication sur arXiv, l'article ne précise ni le robot ni le laboratoire à l'origine des essais réels et n'annonce aucun calendrier de déploiement : il s'agit à ce stade d'une contribution de recherche méthodologique, validée expérimentalement mais non commercialisée.

À lire aussi

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
1arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
FastDSAC : améliorer la plasticité des politiques par exploration contrainte pour la locomotion humanoïde évolutive
2arXiv cs.RO 

FastDSAC : améliorer la plasticité des politiques par exploration contrainte pour la locomotion humanoïde évolutive

FastDSAC, un nouvel algorithme d'apprentissage par renforcement développé par des chercheurs pour l'entraînement de robots humanoïdes, vient d'être présenté sur arXiv (référence 2606.31691). Cette variante rapide de l'architecture Distributional Actor-Critic cible spécifiquement les configurations d'entraînement à haut débit, où de nombreux environnements simulés tournent en parallèle pour accélérer l'apprentissage des politiques de locomotion. Le problème identifié par les auteurs est que cette vitesse a un coût : plus le volume de données et la fréquence de mise à jour augmentent, plus les méthodes basées sur la valeur deviennent instables et plus les réseaux de politique perdent leur capacité d'adaptation, un phénomène connu sous le nom de perte de plasticité. Pour y remédier, FastDSAC introduit une distribution gaussienne tronquée qui approxime la politique apprise, écartant les actions hors distribution qui faussent l'estimation de la valeur cible tout en conservant la part d'aléa nécessaire à l'exploration. Les tests ont été menés sur les bancs d'essai MuJoCo Playground et HumanoidBench, deux environnements de référence pour la locomotion robotique simulée. Sur le plan pratique, ce travail s'attaque à un vrai goulot d'étranglement du secteur : entraîner des politiques de contrôle pour robots humanoïdes reste coûteux en temps de calcul, et les architectures d'échantillonnage massif censées accélérer ce processus introduisent en pratique de l'instabilité qui annule une partie du gain. Si les résultats annoncés (convergence plus rapide, meilleure performance asymptotique) se confirment au-delà des benchmarks simulés, cela intéresserait directement les équipes de recherche qui développent des contrôleurs pour humanoïdes, en réduisant le temps et le coût de calcul nécessaires avant tout transfert vers du matériel réel. Il faut toutefois noter que l'étude reste purement académique et simulée : aucun déploiement sur robot physique n'est mentionné, et les gains restent à valider en dehors des environnements MuJoCo. FastDSAC s'inscrit dans la lignée des méthodes actor-critic distributionnelles dérivées de SAC (Soft Actor-Critic), en se distinguant des approches rapides précédentes qui s'appuyaient sur des distributions de valeur discrètes plutôt que sur une représentation gaussienne continue à variance adaptative. Les auteurs positionnent leur méthode comme une alternative aux algorithmes de référence actuels pour l'entraînement parallèle à grande échelle, sans toutefois nommer d'acteur industriel ni de plateforme robotique spécifique. La suite logique, non abordée dans l'article, serait une validation sur du matériel humanoïde réel.

RecherchePaper
1 source
CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur
3arXiv cs.RO 

CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur

Cette avancée en recherche fournit une méthode de bout en bout pour permettre à un robot humanoïde de marcher sur des terrains complexes en utilisant seulement une caméra de profondeur, sans passer par une carte 3D intermédiaire du terrain. Baptisée CReF (Cross-modal and Recurrent Fusion), l'approche fusionne directement les données de profondeur brutes captées à l'avant du robot avec les signaux de proprioception (l'état interne des articulations et du corps), via un mécanisme d'attention croisée piloté par la proprioception. Cette fusion passe ensuite par un bloc résiduel à porte, puis par une unité récurrente GRU dotée d'une porte de sortie de type "highway", qui pondère dynamiquement la contribution des informations récurrentes et instantanées selon le contexte. Les chercheurs ajoutent une récompense d'appui au sol qui identifie, à partir de nuages de points sous les pieds, les zones porteuses les plus proches et incite le robot à y poser le pied. Testée en simulation puis sur un humanoïde physique, la méthode montre un transfert zero-shot réussi vers des environnements réels variés : mains courantes, palettes ajourées, surfaces fortement réfléchissantes et terrains extérieurs encombrés visuellement. L'intérêt pour l'industrie tient à la simplification radicale du pipeline perception-vers-contrôle. Les méthodes précédentes s'appuyaient souvent sur des représentations de terrain 2.5D centrées sur le robot ou sur des objectifs géométriques auxiliaires pendant l'apprentissage, ce qui imposait des étapes de construction de carte ou des transferts de compétences en plusieurs stades. En évitant ces intermédiaires géométriques explicites, CReF réduit la latence et la complexité d'intégration, un enjeu direct pour les intégrateurs qui cherchent à déployer des humanoïdes en environnement logistique ou industriel réel plutôt qu'en démonstration contrôlée. Le succès du transfert zero-shot sur des surfaces réfléchissantes et des structures ajourées, deux cas connus pour perturber les capteurs de profondeur, est une preuve empirique concrète que l'apprentissage bout-en-bout depth-vers-contrôle peut tenir la route hors laboratoire, un point encore débattu dans le secteur. Ce travail s'inscrit dans la lignée des recherches sur la locomotion perceptive des humanoïdes, où la tension entre robustesse et simplicité d'architecture reste un problème ouvert, à côté des approches concurrentes utilisant des cartes d'élévation ou des skills pré-entraînés séparément. L'article, disponible sur arXiv, en est à sa troisième version révisée, signe d'itérations après retours de relecture. Les auteurs ne précisent pas de plateforme commerciale ni de partenaire industriel associé à ces travaux, qui relèvent pour l'instant de la recherche académique plutôt que d'un produit déployé ; la prochaine étape naturelle serait une validation sur davantage de plateformes humanoïdes et en conditions de production prolongées.

RecherchePaper
1 source
SOLO : locomotion humanoïde perceptive stable, tout-terrain et longue portée
4arXiv cs.RO 

SOLO : locomotion humanoïde perceptive stable, tout-terrain et longue portée

Des chercheurs présentent SOLO (Stable Omni-terrain Long-horizon perceptive humanoid locomotion), décrit dans un preprint publié sur arXiv (arXiv:2608.26583), pour corriger la fragilité des politiques de locomotion perceptive des robots humanoïdes sur de longues distances. Le problème identifié est double : la reconstruction dense du terrain lisse les détails critiques pour l'action, comme les bords de marches ou de pierres de gué, et l'apprentissage par imitation point par point ne distribue pas correctement le crédit temporel entre une action passée et une erreur future. SOLO combine deux composants : un "Query Reconstructor" (QR), qui utilise des requêtes de cellules encodées par transformée de Fourier pour extraire des informations spatialement précises à partir des tokens de profondeur et de proprioception tout en préservant les frontières nettes du terrain, et une distillation "Trajectory-Aware MSE" (TA-MSE), qui ajoute au signal de récompense PPO un terme de désaccord entre l'état futur prédit et celui du modèle professeur, permettant à l'estimation d'avantage généralisée de répercuter les pénalités futures sur les actions précédentes. En simulation, le QR réduit l'erreur L1 de la carte de hauteur d'un facteur 3,3 à 4,0, et la méthode TA-MSE dépasse les approches PPO classiques et MSE+PPO en progression de curriculum. Sur des terrains de test extrêmes, SOLO atteint 97,5% de réussite moyenne de franchissement et 96% sur les pierres de gué, contre 75,0-75,6% et seulement 0-3% pour les variantes à reconstruction dense. Déployé en zero-shot avec pour seuls capteurs une caméra de profondeur montée sur le torse et la proprioception, le système a bouclé un parcours extérieur continu de 1,5 km ainsi qu'un parcours intérieur à terrain mixte. Ce travail cible un point faible récurrent des démonstrations humanoïdes actuelles : la plupart des vidéos montrent des trajectoires courtes et contrôlées, alors que la marche réelle sur de longs horizons accumule des erreurs de perception et de contrôle jusqu'à la chute. En validant son approche sur un trajet continu de 1,5 km en extérieur plutôt que sur des clips sélectionnés, SOLO apporte une preuve plus exigeante que la moyenne du secteur, même s'il s'agit d'un résultat de recherche et non d'un produit commercialisé. Pour les intégrateurs travaillant sur la navigation en terrain non structuré (chantiers, logistique extérieure, inspection), l'argument clé est la frugalité capteur : une seule caméra de profondeur et la proprioception suffisent, sans LiDAR dense ni cartographie 3D lourde, ce qui réduit le coût matériel et la charge de calcul embarquée. Cela contredit l'hypothèse répandue selon laquelle une reconstruction de terrain plus dense améliore mécaniquement la robustesse : les auteurs montrent au contraire qu'une reconstruction trop lissée nuit à la prise de décision fine. SOLO s'inscrit dans la recherche sur la locomotion humanoïde dite perceptive, où perception embarquée et apprentissage par renforcement (PPO) sont combinés pour franchir des obstacles détectés en temps réel, un domaine où le transfert simulation-vers-réel reste le principal goulot d'étranglement face à la diversité des terrains. Contrairement aux communications des fabricants commerciaux de robots humanoïdes, ce travail reste un résultat académique publié en preprint, accompagné d'une page projet dédiée, sans partenariat industriel ni calendrier de commercialisation annoncés. Aucun acteur français ou européen n'apparaît dans cette publication. La suite logique, non précisée par les auteurs, serait un portage sur des plateformes humanoïdes commerciales existantes et des essais en conditions réelles prolongées au-delà des deux parcours déjà validés.

RecherchePaper
1 source