Aller au contenu principal
RecherchearXiv cs.RO 

PhaseSync-Exo : adaptation de référence ancrée sur l'horloge humaine pour le suivi dynamique de la marche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv PhaseSync-Exo, une chaîne de commande pour exosquelette de marche qui vise à suivre la cadence propre du porteur au lieu d'imposer sa propre horloge. Le système empile trois briques. D'abord, une reconstruction de la marche à partir de deux centrales inertielles (IMU) par un réseau CNN-Transformer, qui atteint une erreur absolue moyenne de 3,24 degrés sur un enregistrement mis de côté pour le test. Ensuite, un retargeting qui sépare amplitude et cadence, alimentant une politique de suivi récurrente entraînée par curriculum. Cette politique, gelée après entraînement, termine 356 des 357 essais couvrant des combinaisons amplitude-fréquence. Enfin, un adaptateur ancré sur l'horloge humaine (HCA) ajuste la vitesse de la trajectoire de référence en combinant une attraction vers la phase du porteur et un retour relatif au robot. Face à une correction purement relative au robot, l'erreur de phase par rapport à l'horloge humaine passe de 95,55 à 10,99 degrés. Quand les phases humaine et délivrée divergent au départ, elle tombe de 72,02 à 13,90 degrés, contre une continuation à horloge fixe. Face à un reset de phase immédiat, l'erreur RMS de hanche en transitoire baisse de 22,7 %, sans saut de référence. Les 420 simulations de timing se terminent sans chute.

L'intérêt tient à la question traitée : la synchronisation temporelle entre l'humain et la machine, souvent le point faible des exosquelettes de marche, qui imposent un rythme que l'utilisateur doit subir. Un adaptateur qui acquiert la phase en continu, sans reset brutal, vise un meilleur confort et un meilleur transfert d'effort. Il faut toutefois lire ces résultats avec prudence. Ils sont exclusivement obtenus en simulation, la reconstruction est évaluée sur un seul enregistrement de test, et aucun essai sur un porteur réel avec un matériel physique n'est rapporté. Le zéro chute en simulation ne dit rien de la robustesse face aux retards d'actionnement, au bruit capteur ou aux interactions avec un corps humain. Le recours à seulement deux IMU est en revanche un atout potentiel : cela réduit la complexité d'instrumentation pour un déploiement clinique ou industriel.

Ce travail s'inscrit dans la montée de l'apprentissage par renforcement et des politiques apprises pour la locomotion assistée, qui remplacent peu à peu les machines à états finis et les contrôleurs à impédance réglés à la main. Il reste dans le champ de la recherche académique, sans produit, partenaire industriel ni calendrier de pilote annoncés. Il se place face à des acteurs commerciaux de l'exosquelette médical et d'assistance, comme le français Wandercraft, dont la marche autonome repose sur d'autres approches de génération de trajectoires. La suite logique, que les auteurs n'annoncent pas explicitement, serait une validation sur banc puis sur sujets humains, seule capable de confirmer que l'ancrage sur l'horloge humaine se maintient en conditions réelles.

Impact France/UE

Travail académique sans acteur européen impliqué ; seule mention indirecte de Wandercraft comme concurrent commercial, sans impact concret pour la France/UE.

À lire aussi

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde
1arXiv cs.RO 

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde

Des chercheurs du LECAR Lab (Learning, Computing and Autonomous Robots) ont publié le 30 juin 2026 sur arXiv (référence 2506.28476) un préprint décrivant FADA, un cadre d'adaptation en quelques exemples pour le contrôle de robots humanoïdes. L'architecture, baptisée Planner-IDM (Planner, Inverse Dynamics Model), fonctionne en trois étapes : entraînement d'une politique oracle avec accès à des informations privilégiées (état complet du simulateur), distillation de ce comportement dans un modèle étudiant déployable via DAgger, puis fine-tuning ciblé du seul module IDM à partir d'environ deux minutes de données collectées dans l'environnement réel. La supervision ne requiert ni démonstrations expertes ni signal de récompense : uniquement les paires (actions, observations) enregistrées lors de ces brefs rollouts. Les expériences montrent que FADA surpasse les baselines d'adaptation in-context et d'adaptation end-to-end sur des tâches whole-body à haute précision exécutées sur robot physique. L'enjeu pratique est réel : le "dynamics mismatch", écart entre les dynamiques simulées et celles du domaine cible dues aux variations de terrain, de charge utile ou de réponse actionneur, reste l'un des principaux freins au déploiement industriel des humanoïdes. Les approches actuelles forcent un compromis inconfortable entre la randomisation de domaine (zero-shot, mais sous-spécialisée) et le recalibrage complet du modèle ou le ré-entraînement de politique (précis, mais coûteux en données et en temps). Deux minutes de rollouts pour aligner un IDM représentent un point d'équilibre opérationnellement crédible pour des intégrateurs qui ne peuvent pas interrompre une ligne de production plusieurs heures. Cela dit, les vidéos hardware présentées sur le site du projet sont sélectionnées par les auteurs ; aucune évaluation statistique robuste sur variété de terrains ou charges n'est encore disponible dans ce préprint non relu par les pairs. Le sim-to-real gap est un problème structurel que l'ensemble de l'écosystème humanoïde, Figure (02/03), Tesla Optimus, Boston Dynamics Atlas, Physical Intelligence (pi-zero), tente de résoudre, principalement par randomisation massive en simulation ou par apprentissage en contexte (in-context RL). FADA s'inscrit dans une troisième voie, plus proche des travaux sur l'adaptation rapide de politiques (MAML, RMA) mais appliquée à l'architecture Planner-IDM. Le LECAR Lab, affilié à l'Université de Californie San Diego, capitalise ici sur des travaux antérieurs en locomotion et manipulation whole-body. Prochaine étape attendue : validation sur une plus large variété de dynamiques et de morphologies robotiques, ainsi qu'une soumission à conférence (ICRA ou CoRL) pour passer le filtre de la revue par les pairs.

RecherchePaper
1 source
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
2arXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés. L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur. La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

RecherchePaper
1 source
Politique de dérive d'horloge d'exécution partagée pour la manipulation dynamique de précision
3arXiv cs.RO 

Politique de dérive d'horloge d'exécution partagée pour la manipulation dynamique de précision

Une équipe de chercheurs, dont l'identité reste masquée le temps d'une évaluation en double aveugle, publie le 22 septembre 2026 sur arXiv (référence 2609.23305) une méthode baptisée SECD, pour Shared Execution-Clock Drifting, destinée à la manipulation robotique sous contrainte de temps. Le principe consiste à faire prédire par une politique en une seule étape de génération, à la fois une courbe d'action indexée sur la progression de la tâche et une horloge monotone partagée qui associe les instants de contrôle fixes à des positions sur cette courbe, l'ensemble étant calé sur des démonstrations puis affiné par un processus de "drifting" sur les actions décodées. Testée sur quatre tâches robotiques réelles avec inférence embarquée sur un module NVIDIA Thor, la méthode atteint un taux de réussite moyen de 77,00 % sur 300 essais, avec 91 % de réussite pour récupérer une tasse sur un convoyeur roulant à 16 mètres par minute, et 54 % pour redéplier et plier un vêtement froissé en moins de 90 secondes ; une variante à horloge fixe monte à 79 % sur le même protocole de convoyeur. L'enjeu dépasse la simple performance chiffrée : les politiques génératives en une seule étape, plus rapides à calculer que les approches par diffusion multi-étapes, laissaient jusqu'ici le rythme d'exécution implicite dans la séquence d'actions prédite, ce qui les pénalise dès qu'un objet bouge ou qu'une échéance s'impose. En rendant ce rythme explicite sans sacrifier la cadence de contrôle fixe ni ajouter d'évaluation réseau supplémentaire, SECD s'attaque directement à un angle mort de la course actuelle aux modèles vision-langage-action rapides. Le score de 54 % sur le pliage de tissu, nettement inférieur aux 91 % du convoyeur, rappelle toutefois que la manipulation déformable dynamique reste un problème largement non résolu, loin des démonstrations soignées habituellement mises en avant. Le travail s'inscrit dans la lignée des politiques dites "one-step", comparées ici à plusieurs bases de référence du même type, et complète ses essais réels par des expériences sur le simulateur RoboMimic, incluant des ablations multi-graines sur les tâches Transport et Square. Aucune affiliation industrielle, aucun partenaire ni calendrier de déploiement n'est mentionné : il s'agit à ce stade d'une contribution de recherche accompagnée d'une page de projet dédiée, sans indication de suite commerciale annoncée.

RecherchePaper
1 source
Guidage dynamique inspiré de la marche passive pour une locomotion humanoïde économe en énergie
4arXiv cs.RO 

Guidage dynamique inspiré de la marche passive pour une locomotion humanoïde économe en énergie

Des chercheurs proposent un cadre d'apprentissage par renforcement inspiré de la marche dynamique passive (PDW) pour réduire le coût énergétique de la locomotion humanoïde. Pendant les premières phases d'entraînement, un champ de gravité incliné crée des conditions équivalentes à une pente et facilite la progression sagittale sur un sol pourtant plat, avec des termes de récompense couplés à un curriculum. Toute aide spécifique à la PDW est ensuite retirée avant l'optimisation sous dynamique nominale. Le cœur de la méthode n'exige ni trajectoire de référence, ni phases de marche, ni calendrier de contacts. Testé sur un Unitree G1 à 29 DOF, avec cinq graines d'entraînement en marche avant, le cadre réduit le coût de transport mécanique de 6,8 à 15,2 % pour des vitesses commandées de 0,5 à 2,0 m/s, sans dégrader le suivi de vitesse. La décomposition du travail mécanique attribue ce gain au travail positif des actionneurs. Sur le matériel réel, le coût de transport en marche avant baisse de 16,3 % avec un a priori de mouvement dédié à la marche, et de 4,5 % sans lui. Ce résultat déplace la question de l'efficacité énergétique, qui n'est plus seulement une affaire de pénalités d'effort dans la récompense. Ces pénalités n'orientent que indirectement la mécanique pas à pas, alors que le guidage par la dynamique agit sur la coordination de la démarche elle-même. Pour les intégrateurs et les décideurs B2B, l'autonomie est un facteur limitant du déploiement des humanoïdes : un coût de transport plus bas prolonge le temps de service par charge et allège les contraintes thermiques. Le gain est aussi obtenu sans données de mouvement propriétaires. Les auteurs distinguent l'accélération de l'apprentissage de la marche, apportée par le régime guidé, du bénéfice supplémentaire de l'inclinaison sur l'économie finale. Il faut toutefois nuancer : sur robot réel, le gain de 4,5 % sans a priori de mouvement reste dans la dispersion d'un essai à l'autre, donc statistiquement fragile. Le travail s'inscrit dans le courant dominant de la locomotion humanoïde par apprentissage par renforcement en simulation, où la marche est généralement obtenue par mise en forme de la récompense, imitation de références ou contraintes de contacts. Le G1 d'Unitree sert de plateforme de recherche répandue, ce qui facilite la reproduction. Le cadre s'étend à la locomotion omnidirectionnelle sans assistance : le bénéfice persiste lorsqu'un a priori de mouvement spécifique à la marche fournit la coordination cinématique, et l'association réduit alors le coût de transport à vitesse égale de 18,7 %. Aucun pilote industriel ni calendrier de déploiement n'est annoncé, et les résultats matériels portent sur un seul type de robot, en marche avant. La suite logique consiste à valider ces gains sur d'autres morphologies, en charge utile et sur terrains variés, avant tout transfert vers des produits commerciaux.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source