Aller au contenu principal
SPRINT : a priori spectraux efficaces pour les sprints athlétiques des humanoïdes
RecherchearXiv cs.RO 

SPRINT : a priori spectraux efficaces pour les sprints athlétiques des humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en mai 2026, via arXiv (2605.28549), un framework nommé SPRINT visant à faire sprinter des robots humanoïdes à haute vitesse de manière stable et biomimétique. Le système repose sur des priors spectraux adaptatifs en fréquence : plutôt que d'entraîner le robot sur de grandes bibliothèques de captures de mouvement, SPRINT caractérise la périodicité fondamentale de la locomotion humaine dans le domaine fréquentiel à partir d'une bibliothèque de référence réduite à cinq séquences de mouvements discrets. Ces priors génèrent ensuite des trajectoires articulaires cinématiquement cohérentes sur un large spectre de vitesses, y compris des vitesses supérieures à celles présentes dans les données d'entraînement. Sur le robot Unitree G1, la politique résultante atteint 6 m/s en pointe lors d'expériences en conditions réelles, avec des transitions de foulée fluides et sans ajustement manuel post-simulation.

Ce résultat est notable pour deux raisons distinctes. Premièrement, le transfert sim-to-real s'effectue en zéro-shot, c'est-à-dire sans fine-tuning entre simulation et terrain réel, ce qui reste un verrou majeur dans les pipelines d'apprentissage par renforcement pour l'humanoïde. Deuxièmement, l'efficacité des données est exceptionnelle : cinq séquences de référence suffisent là où les approches concurrentes en imitation de mouvement nécessitent généralement des centaines, voire des milliers de captures. Pour une équipe R&D ou un intégrateur, cela réduit drastiquement le coût d'entrée pour des comportements locomoteurs à haute performance. La capacité à extrapoler au-delà de la distribution d'entraînement est prometteuse, même si les conditions exactes des tests terrain (surface, charge utile, durée de sprint) restent peu documentées dans la publication.

La course aux humanoïdes rapides s'est intensifiée ces deux dernières années : Boston Dynamics a publié des démonstrations d'Atlas dépassant 5 m/s, tandis que des équipes en Chine, notamment chez Unitree et Fourier Intelligence, publient régulièrement des benchmarks locomoteurs. SPRINT s'inscrit dans une tendance académique qui cherche à rendre ces capacités reproductibles avec peu de données, en opposition aux pipelines massifs type Tesla Optimus ou Figure. Le Unitree G1, plateforme commerciale disponible autour de 16 000 dollars, est devenu le banc d'essai standard pour ce type de travaux de recherche. L'article est un preprint, sans déploiement industriel annoncé ni partenariat commercial déclaré.

À lire aussi

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
1arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
ADP : a priori dynamiques adverses pour une locomotion humanoïde ancrée physiquement
2arXiv cs.RO 

ADP : a priori dynamiques adverses pour une locomotion humanoïde ancrée physiquement

Des chercheurs publient sur arXiv (arXiv:2607.03454) une nouvelle méthode d'apprentissage baptisée Adversarial Dynamics Priors (ADP), destinée a rendre la marche des robots humanoïdes plus résistante aux chocs et poussées extérieures. Les approches actuelles de type AMP (Adversarial Motion Priors) imposent un style de démarche naturel en imitant des caractéristiques cinématiques du mouvement, mais elles ne regulent pas directement les grandeurs dynamiques sous jacentes: trajectoire du centre de masse, moment centroidal, forces de contact et états de contact au sol. ADP change la cible de l'apprentissage adversarial en remplaçant ces indices de style par des trajectoires générées via optimisation de trajectoire, utilisées comme jeu de référence. Un discriminateur est ensuite entraine a juger si les séquences temporelles produites par la politique de contrôle du robot restent cohérentes avec cette distribution de référence, sans suivi explicite de mouvement imprime a l'avance. Compare a AMP, la référence la plus solide testée, ADP améliore de 16,7% le seuil de réussite a 80% face a une impulsion (J80, une mesure de la force de choc absorbable sans chute), tout en réduisant de 47,9% le temps de récupération moyen et de 35,4% l'erreur de suivi de vitesse après perturbation. Pour l'industrie robotique, ce travail cible un angle mort fréquent des démonstrations commerciales: la résilience a des perturbations réelles et non scriptées, plutôt que la seule fluidité du mouvement en conditions de laboratoire. Les contrôleurs entraines par imitation de style de mouvement produisent souvent des démarches visuellement convaincantes en vidéo mais fragiles des qu'un choc imprévu survient, un écart classique entre démonstration et déploiement réel évoque régulièrement dans le secteur des humanoïdes. En régulant directement la dynamique plutôt que l'apparence du mouvement, ADP fournit une piste concrète pour combler cet écart, un enjeu direct pour les intégrateurs qui envisagent des humanoïdes en environnements industriels non contrôles. Ce travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation adversariale de mouvement (AMP), largement adoptées depuis plusieurs années pour entrainer des politiques de contrôle de robots bipèdes et quadrupèdes en simulation avant transfert au réel. Il ne s'accompagne pas, a ce stade, d'annonce de déploiement sur une plateforme commerciale identifiée: il s'agit d'une contribution de recherche méthodologique, évaluée en simulation, dont la généralisation a du matériel physique reste a démontrer dans de futurs travaux.

RecherchePaper
1 source
Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes
3arXiv cs.RO 

Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes

Un article de recherche révisé sur arXiv (2602.08370v2) présente "Imitation-to-Interaction" (I2I), un framework d'apprentissage par renforcement progressif qui apprend à un robot humanoïde à jouer au badminton. La méthode construit d'abord un a priori moteur à partir de données de mouvement humain, le compresse en une représentation d'état compacte basée sur un modèle, puis stabilise la dynamique via des a priori adversariaux. Une stratégie d'expansion de variété (manifold expansion) généralise ensuite les points de frappe, rares dans les démonstrations expertes disponibles, en un volume d'interaction dense permettant d'intercepter le volant dans une zone continue plutôt qu'à des positions figées. En simulation, le robot maîtrise plusieurs coups caractéristiques comme les lifts (dégagés hauts) et les amortis courts (drop shots). Les auteurs revendiquent le premier transfert "zero-shot" simulation-vers-réel de ces gestes sur un robot humanoïde physique, sans préciser dans le résumé la plateforme utilisée, le nombre de degrés de liberté ni de taux de réussite des frappes. Le badminton combine une coordination corporelle explosive proche de la limite biomécanique et une interception où le timing se compte en dizaines de millisecondes, un défi bien supérieur à celui de la marche ou de la préhension statique en usine. L'enjeu dépasse le sport: la recherche en imitation de mouvement produit souvent des démonstrations visuellement convaincantes mais déconnectées de toute interaction physique fonctionnelle avec un objet dynamique. En affichant un transfert sim-to-real zero-shot sur une frappe à haute vitesse, ce travail s'attaque à l'un des goulots d'étranglement les plus cités du secteur humanoïde, l'écart persistant entre performance simulée et robustesse en conditions réelles. Pour les intégrateurs et décideurs évaluant la maturité des humanoïdes au-delà du pick-and-place répétitif, ce résultat suggère que des architectures combinant a priori de mouvement humain et modèles de dynamique commencent à généraliser à des gestes rapides, précis et non répétitifs. Ce travail prolonge une lignée de recherches en apprentissage par renforcement pour humanoïdes s'appuyant sur des a priori de mouvement adversariaux, technique utilisée pour ancrer des politiques de contrôle dans des captures de mouvement humain sans sacrifier le naturel du geste. Publiée en version révisée sur arXiv, la contribution reste académique à ce stade: le résumé ne cite aucun partenaire industriel, aucune plateforme robotique commerciale ni aucun site de déploiement, et rien n'indique de calendrier de mise en production. Elle s'inscrit dans un mouvement plus large de laboratoires testant la dextérité dynamique des humanoïdes via des tâches sportives, en complément des benchmarks classiques de locomotion et de manipulation statique.

RecherchePaper
1 source
iGPC : priors de mouvement génératifs pour l'interaction humanoïde sensible aux objets
4arXiv cs.RO 

iGPC : priors de mouvement génératifs pour l'interaction humanoïde sensible aux objets

Des chercheurs proposent iGPC, un cadre qui étend le Generative Pretrained Controller (GPC), un contrôleur humanoïde préentraîné sur de larges corpus de mouvements humains, à l'interaction corps entier avec des objets. Le travail, publié sur arXiv (2610.08120v1), procède en deux étapes. D'abord, GPC est adapté en « experts d'interaction » conditionnés par des indices d'affordance de la scène et par des informations d'état privilégiées (accessibles en simulation, mais pas sur un robot réel). Ces experts conservent le prior de mouvement humain tout en apprenant des comportements de contact propres à chaque tâche : atteindre un objet, s'agripper à un support de l'environnement pour se stabiliser, pousser un objet mobile. Ensuite, un « étudiant » piloté par la perception reprend la politique GPC préentraînée et distille les compétences des experts à partir des seules observations de capteurs embarqués. Deux objectifs d'entraînement complémentaires comblent l'écart entre observations privilégiées et signaux sensoriels. Les auteurs annoncent des résultats concluants sur plusieurs tâches corps entier. Le résumé ne donne ni plateforme matérielle, ni taux de réussite, ni nombre de degrés de liberté, ni validation chiffrée en conditions réelles. L'enjeu est le passage du mouvement naturel à l'interaction physique guidée par la perception, point de blocage récurrent pour les humanoïdes. Les priors issus de données humaines donnent des mouvements fluides et variés, mais ils sont rarement exploités pour des contacts riches avec l'environnement, où la perception bruitée et l'absence d'information privilégiée fragilisent les politiques. Si les résultats tiennent, ils plaident pour un modèle de fond de mouvement réutilisable, adapté ensuite à des tâches de manipulation et de stabilisation, plutôt qu'une politique entraînée de zéro pour chaque scénario. Pour un intégrateur, la capacité à s'appuyer sur un support ou à pousser une charge sans cartographie parfaite de la scène serait pertinente en logistique ou en maintenance. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, sans chiffres publics dans le résumé. Il ne permet donc pas d'évaluer l'écart entre démonstration et fiabilité en production. Ce travail s'inscrit dans la lignée des approches de distillation enseignant-étudiant, devenues standard pour le transfert simulation-réel en locomotion et en contrôle corps entier. Il prolonge GPC, proposé récemment pour le contrôle humanoïde général à partir de mouvements humains à grande échelle. Il rejoint aussi les efforts sur les politiques généralistes corps entier des acteurs industriels et académiques, comme GR00T chez NVIDIA, sans rapport de performance direct démontré ici. La suite logique serait une validation sur un robot physique, avec des métriques de robustesse et des comparaisons à des méthodes de référence. Aucune échéance de déploiement ni partenaire industriel n'est mentionné à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source