Aller au contenu principal
ADP : a priori dynamiques adverses pour une locomotion humanoïde ancrée physiquement
RecherchearXiv cs.RO 

ADP : a priori dynamiques adverses pour une locomotion humanoïde ancrée physiquement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2607.03454) une nouvelle méthode d'apprentissage baptisée Adversarial Dynamics Priors (ADP), destinée a rendre la marche des robots humanoïdes plus résistante aux chocs et poussées extérieures. Les approches actuelles de type AMP (Adversarial Motion Priors) imposent un style de démarche naturel en imitant des caractéristiques cinématiques du mouvement, mais elles ne regulent pas directement les grandeurs dynamiques sous jacentes: trajectoire du centre de masse, moment centroidal, forces de contact et états de contact au sol. ADP change la cible de l'apprentissage adversarial en remplaçant ces indices de style par des trajectoires générées via optimisation de trajectoire, utilisées comme jeu de référence. Un discriminateur est ensuite entraine a juger si les séquences temporelles produites par la politique de contrôle du robot restent cohérentes avec cette distribution de référence, sans suivi explicite de mouvement imprime a l'avance. Compare a AMP, la référence la plus solide testée, ADP améliore de 16,7% le seuil de réussite a 80% face a une impulsion (J80, une mesure de la force de choc absorbable sans chute), tout en réduisant de 47,9% le temps de récupération moyen et de 35,4% l'erreur de suivi de vitesse après perturbation.

Pour l'industrie robotique, ce travail cible un angle mort fréquent des démonstrations commerciales: la résilience a des perturbations réelles et non scriptées, plutôt que la seule fluidité du mouvement en conditions de laboratoire. Les contrôleurs entraines par imitation de style de mouvement produisent souvent des démarches visuellement convaincantes en vidéo mais fragiles des qu'un choc imprévu survient, un écart classique entre démonstration et déploiement réel évoque régulièrement dans le secteur des humanoïdes. En régulant directement la dynamique plutôt que l'apparence du mouvement, ADP fournit une piste concrète pour combler cet écart, un enjeu direct pour les intégrateurs qui envisagent des humanoïdes en environnements industriels non contrôles.

Ce travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation adversariale de mouvement (AMP), largement adoptées depuis plusieurs années pour entrainer des politiques de contrôle de robots bipèdes et quadrupèdes en simulation avant transfert au réel. Il ne s'accompagne pas, a ce stade, d'annonce de déploiement sur une plateforme commerciale identifiée: il s'agit d'une contribution de recherche méthodologique, évaluée en simulation, dont la généralisation a du matériel physique reste a démontrer dans de futurs travaux.

Dans nos dossiers

À lire aussi

Guidage dynamique inspiré de la marche passive pour une locomotion humanoïde économe en énergie
1arXiv cs.RO 

Guidage dynamique inspiré de la marche passive pour une locomotion humanoïde économe en énergie

Des chercheurs proposent un cadre d'apprentissage par renforcement inspiré de la marche dynamique passive (PDW) pour réduire le coût énergétique de la locomotion humanoïde. Pendant les premières phases d'entraînement, un champ de gravité incliné crée des conditions équivalentes à une pente et facilite la progression sagittale sur un sol pourtant plat, avec des termes de récompense couplés à un curriculum. Toute aide spécifique à la PDW est ensuite retirée avant l'optimisation sous dynamique nominale. Le cœur de la méthode n'exige ni trajectoire de référence, ni phases de marche, ni calendrier de contacts. Testé sur un Unitree G1 à 29 DOF, avec cinq graines d'entraînement en marche avant, le cadre réduit le coût de transport mécanique de 6,8 à 15,2 % pour des vitesses commandées de 0,5 à 2,0 m/s, sans dégrader le suivi de vitesse. La décomposition du travail mécanique attribue ce gain au travail positif des actionneurs. Sur le matériel réel, le coût de transport en marche avant baisse de 16,3 % avec un a priori de mouvement dédié à la marche, et de 4,5 % sans lui. Ce résultat déplace la question de l'efficacité énergétique, qui n'est plus seulement une affaire de pénalités d'effort dans la récompense. Ces pénalités n'orientent que indirectement la mécanique pas à pas, alors que le guidage par la dynamique agit sur la coordination de la démarche elle-même. Pour les intégrateurs et les décideurs B2B, l'autonomie est un facteur limitant du déploiement des humanoïdes : un coût de transport plus bas prolonge le temps de service par charge et allège les contraintes thermiques. Le gain est aussi obtenu sans données de mouvement propriétaires. Les auteurs distinguent l'accélération de l'apprentissage de la marche, apportée par le régime guidé, du bénéfice supplémentaire de l'inclinaison sur l'économie finale. Il faut toutefois nuancer : sur robot réel, le gain de 4,5 % sans a priori de mouvement reste dans la dispersion d'un essai à l'autre, donc statistiquement fragile. Le travail s'inscrit dans le courant dominant de la locomotion humanoïde par apprentissage par renforcement en simulation, où la marche est généralement obtenue par mise en forme de la récompense, imitation de références ou contraintes de contacts. Le G1 d'Unitree sert de plateforme de recherche répandue, ce qui facilite la reproduction. Le cadre s'étend à la locomotion omnidirectionnelle sans assistance : le bénéfice persiste lorsqu'un a priori de mouvement spécifique à la marche fournit la coordination cinématique, et l'association réduit alors le coût de transport à vitesse égale de 18,7 %. Aucun pilote industriel ni calendrier de déploiement n'est annoncé, et les résultats matériels portent sur un seul type de robot, en marche avant. La suite logique consiste à valider ces gains sur d'autres morphologies, en charge utile et sur terrains variés, avant tout transfert vers des produits commerciaux.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Replanification ancrée dans le corps pour une manipulation physiquement adaptative
2arXiv cs.RO 

Replanification ancrée dans le corps pour une manipulation physiquement adaptative

Publié sur arXiv le 25 septembre 2026 sous la référence 2609.30024, un article présente le « body-grounded replanning », une méthode qui permet à un bras manipulateur d'ajuster sa stratégie d'exécution selon son propre état physique interne, et non plus seulement selon la géométrie de l'environnement. Le système surveille l'état articulaire du robot, charge sur les joints et mobilité disponible, et déclenche une replanification dès qu'un événement corporel survient, comme une surcharge ou une contrainte de mobilité asymétrique. Un grand modèle de langage interprète alors cet état, les statistiques d'exécution récentes et l'historique des actions pour choisir une stratégie alternative, sans toucher à l'objectif de la tâche ni au contrôleur bas niveau. L'approche est validée sur une tâche d'atteinte sous charge contrôlée et contraintes de mobilité asymétriques, en simulation puis sur un robot réel, avant d'être étendue à des manipulations avec contacts. Cette approche cible un angle mort des architectures de manipulation actuelles : une stratégie peut rester géométriquement valide tout en devenant physiquement inadaptée, par exemple quand un bras accumule de la fatigue articulaire ou perd en amplitude de mouvement, un signal qui ne remonte d'ordinaire jamais au-delà du contrôle bas niveau. En faisant remonter l'état corporel jusqu'à la couche de décision de haut niveau, généralement réservée à la perception externe, les auteurs montrent qu'un robot peut réduire son effort physique et gagner en efficacité d'adaptation tout en gardant un taux de réussite élevé. Pour les intégrateurs qui déploient des modèles vision-langage-action sur des plateformes réelles, ce travail ouvre une piste pour limiter l'usure mécanique et les échecs liés à des contraintes physiques imprévues, sans réentraîner la politique de contrôle bas niveau. Cette proposition s'inscrit dans la tendance consistant à confier à un LLM le rôle d'orchestrateur au-dessus de politiques de contrôle bas niveau spécialisées, une architecture déjà explorée par plusieurs travaux de planification robotique assistée par langage. Sa spécificité tient à l'usage de signaux purement internes au robot, joints, charge, mobilité, plutôt que des seules entrées visuelles habituellement utilisées pour décider d'un changement de stratégie. Classé comme nouvelle soumission sur arXiv, l'article ne mentionne aucun partenariat industriel ni déploiement hors laboratoire : les essais se limitent à une tâche de reaching et à des manipulations avec contacts, en simulation et sur un seul robot réel, sans calendrier de transfert vers un produit commercial.

RecherchePaper
1 source
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
3arXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés. L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur. La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

RecherchePaper
1 source
Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture
4arXiv cs.RO 

Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture

Un article publié sur arXiv (référence 2609.20558v1) présente un cadre logiciel permettant à un robot humanoïde Unitree G1 d'exécuter des tâches de couvreur sur toitures en pente : marche en montée, utilisation d'une cloueuse pneumatique, martelage et mouvements de flexion. La méthode capture des démonstrations humaines par un système de suivi de mouvement, les retranscrit sur le robot, puis s'appuie sur un modèle métrique 3D du toit pour ancrer précisément les points de contact des pieds et des mains ainsi que les relations de travail (distance à l'outil, zones de dégagement) à la surface réelle. Une optimisation au niveau de la trajectoire fixe ces contraintes, tandis qu'un apprentissage par renforcement sensible à l'exécution maintient ces relations malgré les erreurs de suivi en conditions dynamiques. Les auteurs évaluent l'approche via une étude de suivi multi-mouvements, une matrice couvrant différentes pentes de toit, une ablation à cinq configurations sur la tâche de cloueuse, des tests croisés sur le martelage et la poussée latérale, ainsi que des comparaisons avec un apprentissage par renforcement pur et une téléopération sans apprentissage préalable. Résultats obtenus : des erreurs de dégagement de travail comprises entre 0,256 et 0,531 cm, un taux de réussite de 3 sur 3 pour chaque tâche testée, et des erreurs moyennes de position du tronc inférieures à 80 mm lors des expériences physiques. L'intérêt de ces travaux tient au problème qu'ils ciblent : les surfaces inclinées et irrégulières du bâtiment restent l'un des terrains les plus difficiles pour les humanoïdes, bien plus exigeants que les sols plats des entrepôts où la plupart des démonstrations commerciales sont tournées. L'étude illustre aussi un écueil classique de l'apprentissage par imitation : retranscrire fidèlement un geste humain capturé ne garantit pas un placement correct des appuis par rapport à l'environnement réel, d'où l'ajout d'un ancrage explicite à un modèle de scène. Pour les intégrateurs et décideurs du BTP, ce résultat reste un signal de recherche amont plutôt qu'une preuve de déploiement : il indique une piste méthodologique crédible pour doter les humanoïdes de compétences de chantier extérieur, sans annoncer de produit ni de pilote commercial. Le travail s'appuie sur le Unitree G1, plateforme humanoïde chinoise largement utilisée par les laboratoires de recherche en robotique incarnée pour son coût réduit face à des concurrents comme Boston Dynamics ou Tesla Optimus. Il s'inscrit dans une vague plus large de recherches combinant apprentissage par imitation et renforcement pour le contrôle corps entier des humanoïdes, dans la lignée conceptuelle de projets industriels comme Helix de Figure AI ou GR00T N2 de NVIDIA, sans toutefois émaner d'un acteur commercial identifié : il s'agit d'une prépublication arXiv non encore validée par relecture par les pairs. Les auteurs présentent leur approche comme une base pour de futures primitives de mouvement humanoïde dédiées au bâtiment, sans calendrier de pilote ni partenariat annoncé à ce stade.

RecherchePaper
1 source