Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage du contrôle de mouvement basse fréquence pour une locomotion robotique robuste et dynamique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du groupe Dynamic Robot Systems de l'université d'Oxford démontrent qu'un contrôleur de locomotion appris peut fonctionner à seulement 8 Hz sur un quadrupède ANYmal C réel, là où la pratique courante pousse la fréquence de commande très haut pour gagner en réactivité. Le robot atteint de façon répétable une vitesse de 1,5 m/s, franchit des terrains irréguliers et résiste à des perturbations externes imprévues. Les auteurs comparent aussi des politiques d'apprentissage par renforcement profond (deep RL) entraînées et exécutées de 5 Hz à 200 Hz. Résultat central : les politiques basses fréquences se montrent moins sensibles aux latences d'actionnement et aux variations de la dynamique du système. Au point qu'un transfert simulation-réel réussit sans randomisation de la dynamique ni modélisation des actionneurs. Le code d'entraînement et de déploiement est publié, avec une analyse étendue, pour permettre la reproduction. Il s'agit d'une version révisée (v3) d'un article déposé en 2022 sur arXiv, et non d'une nouveauté.

L'enjeu est d'abord économique et d'ingénierie. Réduire la fréquence de commande allège la charge de calcul embarquée, ce qui ouvre la voie à des processeurs plus modestes, moins énergivores et moins coûteux. Cela compte pour les intégrateurs et les fabricants de robots à pattes, dont les budgets de masse et de batterie sont serrés. Surtout, le résultat s'attaque à l'une des principales difficultés du sim-to-real : la fabrication de simulateurs et de modèles d'actionneurs très fidèles, ainsi que l'ajustement fin de la randomisation de domaine. Si un simple abaissement de la fréquence suffit à absorber une partie de l'écart de réalité, le pipeline de déploiement se simplifie. Il faut toutefois nuancer. La démonstration porte sur un seul robot, l'ANYmal C, et sur une tâche de locomotion aveugle ou proche de celle-ci. Les 1,5 m/s restent modestes face aux records de vitesse des quadrupèdes. Rien ne prouve que la conclusion s'étende à des humanoïdes, plus instables, ni à la manipulation, où des boucles rapides restent souvent nécessaires.

Ces travaux contredisent l'idée répandue selon laquelle plus de fréquence signifie plus de robustesse, et ils s'inscrivent dans la recherche sur la locomotion par RL née des travaux d'ETH Zurich et d'ANYbotics, constructeur de l'ANYmal. Aujourd'hui, les politiques de locomotion des quadrupèdes comme des humanoïdes tournent typiquement autour de 50 Hz, avec des contrôleurs bas niveau à plusieurs kHz. Les modèles VLA (vision-langage-action) actuels, eux, produisent des actions à basse fréquence et s'appuient sur des contrôleurs rapides en dessous, ce qui rend cette étude pertinente pour l'architecture hiérarchique de ces systèmes. La suite logique serait de tester l'approche sur d'autres morphologies, notamment bipèdes, et de l'intégrer à des pipelines de déploiement à grande échelle.

À lire aussi

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
1arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables
2arXiv cs.RO 

Politique de contrainte de surface pour l'apprentissage de compétences robotiques contraintes et dynamiquement réalisables

Des chercheurs ont déposé en mai 2026 sur arXiv (identifiant 2605.31321) un article présentant la Surface Constraint Policy (SCP), une méthode destinée à améliorer la fiabilité des robots dans des tâches de manipulation dextre impliquant des contraintes de surface complexes et de forme libre. L'approche encode la géométrie de surface à partir de démonstrations humaines via une fonction noyau gaussien pondérée en deux dimensions. Sur cette base, une politique de diffusion infère des intentions d'action à partir d'entrées multimodales (observations visuelles et retour d'état du robot), qui sont ensuite transformées en primitives de mouvement dynamique contraintes à la surface (DMPs, Dynamic Movement Primitives) via une méthode de mapping par similarité. Ce pipeline produit des trajectoires à la fois géométriquement admissibles et dynamiquement réalisables. Les auteurs font état de taux de succès et d'une stabilité de contact supérieurs aux méthodes comparées, sans que le résumé ne détaille les métriques précises ni les benchmarks utilisés. Ce travail pointe un angle mort persistant des approches actuelles d'apprentissage par imitation à base de diffusion : les politiques classiques génèrent des actions de manière stochastique, sans modéliser explicitement la géométrie de la surface de contact. En pratique, cela se traduit par des glissements, des décrochages ou des trajectoires physiquement inadmissibles, problèmes rédhibitoires pour des applications industrielles comme le polissage, l'assemblage surfacique ou le soudage. L'originalité de SCP tient à l'intégration des contraintes géométriques dès la génération d'action, couplée à des DMPs qui garantissent la faisabilité dynamique. Pour les intégrateurs et les équipes R&D, cette approche représente un pas concret vers la répétabilité requise en production, là où la stabilité du contact prime sur la généralisation toutes-tâches. Ce travail s'inscrit dans une vague de recherche intense autour des politiques de diffusion pour la manipulation robotique, initiée par Diffusion Policy (Chi et al., 2023, Columbia University) et accélérée par des acteurs comme Physical Intelligence avec pi0, Google DeepMind avec RT-2, ou encore ACT de Stanford. Les primitives de mouvement dynamique mobilisées ici sont un outil classique de la robotique depuis les travaux de Schaal dans les années 2000, mais leur couplage avec un pipeline de diffusion moderne pour gérer des contraintes surfaciques constitue l'apport original de la méthode. Les limitations pointées par les auteurs sont partagées par la plupart des architectures VLA actuelles, ce qui signale un axe de recherche pertinent pour quiconque vise le déploiement industriel. Les prochaines étapes naturelles incluraient une validation sur des surfaces déformables ou en mouvement, ainsi qu'un test de passage à l'échelle avec une plus grande diversité de tâches et de morphologies robotiques.

RecherchePaper
1 source
Extreme-RGMT : apprentissage continu de compétences hautement dynamiques pour un contrôle humanoïde généraliste robuste
3arXiv cs.RO 

Extreme-RGMT : apprentissage continu de compétences hautement dynamiques pour un contrôle humanoïde généraliste robuste

Une équipe de recherche publie sur arXiv le framework Extreme-RGMT, une méthode d'apprentissage continu en deux étapes destinée au contrôle de robots humanoïdes généralistes. La première étape entraîne une politique de suivi de mouvement généraliste à partir de données de mouvement multi-sources diverses. La seconde étape introduit un mécanisme asymétrique d'acquisition de compétences et de consolidation des capacités, qui limite la dérive de la politique sur les mouvements déjà maîtrisés tout en concentrant l'apprentissage sur les segments dynamiques difficiles. Pour pallier la rareté des mouvements très dynamiques et leur fort taux d'échec à l'entraînement, les auteurs combinent un échantillonnage sensible à la difficulté avec un rééchantillonnage de trajectoires priorisé par l'avantage. Résultat annoncé : des performances état de l'art en suivi de mouvement corps entier généraliste, avec une nette amélioration du taux de réussite sur les mouvements dynamiques rares, le contrôleur final exécutant des mouvements inédits sous références fixes et sous entrées de capture de mouvement inertielle en ligne. L'enjeu dépassé ici est un compromis classique et bloquant du secteur : les politiques généralistes de suivi de mouvement échouent souvent sur les gestes rares et acrobatiques, tandis que le fine-tuning spécialisé sur ces gestes fait régresser les comportements courants déjà acquis, un phénomène d'oubli catastrophique bien connu en apprentissage continu. Si les résultats se confirment au-delà du papier, cela réduit un frein concret à la commercialisation des humanoïdes généralistes, où les intégrateurs veulent un seul contrôleur capable à la fois de gestes du quotidien fiables et de réactions dynamiques ponctuelles, sans devoir maintenir des politiques séparées ni recertifier le comportement de base à chaque ajout de compétence. Le travail s'inscrit dans la lignée des recherches sur le suivi de mouvement corps entier pour humanoïdes, où des approches génériques par imitation ou par capture de mouvement sont couramment utilisées pour transférer des mouvements humains vers des robots. Extreme-RGMT ne s'appuie pas sur des données terrain ni sur un déploiement industriel : il s'agit d'une contribution méthodologique en simulation ou banc d'essai contrôlé, publiée en preprint (arXiv:2607.20110), sans partenaire industriel ni plateforme matérielle nommée dans le résumé. Les suites logiques attendues seraient une validation sur robot physique réel et une comparaison directe avec les contrôleurs généralistes existants du secteur.

RecherchePaper
1 source
KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques
4arXiv cs.RO 

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques

Des chercheurs présentent KungfuBot, un cadre de contrôle corps-entier pour robots humanoïdes basé sur la physique, capable d'imiter des mouvements humains hautement dynamiques comme le kungfu ou la danse, là où les algorithmes existants ne parviennent à suivre que des mouvements lents et fluides malgré un travail soigné sur les récompenses et le curriculum d'apprentissage. Le système repose sur un pipeline de traitement du mouvement qui extrait, filtre, corrige et retargete les captures de mouvement humain tout en respectant au maximum les contraintes physiques du robot. Pour l'imitation, les auteurs formulent un problème d'optimisation à deux niveaux qui ajuste dynamiquement la tolérance de précision de suivi selon l'erreur courante, créant un mécanisme de curriculum adaptatif, complété par une architecture acteur-critique asymétrique pour l'entraînement des politiques. Déployé sur le robot Unitree G1, le système atteint des erreurs de suivi nettement inférieures aux approches existantes et produit des comportements stables et expressifs. Le projet est documenté sur kungfubot.github.io. L'enjeu dépasse la simple prouesse technique : la capacité à reproduire des mouvements rapides et dynamiques est un point de blocage connu du contrôle corps-entier par imitation, où le compromis entre stabilité physique et fidélité au mouvement source devient critique à haute vitesse. En démontrant qu'un curriculum adaptatif basé sur l'erreur de suivi permet de dépasser ce plafond, KungfuBot apporte une preuve de concept utile pour toute l'industrie humanoïde, où l'expressivité et la robustesse des mouvements dynamiques sont devenues un argument de démonstration autant qu'un vrai défi d'ingénierie. Reste que les vidéos de démonstration, comme souvent dans ce type de publication, présentent probablement une sélection de résultats plutôt qu'un comportement systématique et généralisable. Ce travail s'inscrit dans la lignée des recherches sur l'imitation de mouvement par apprentissage par renforcement physique, un domaine où le retargeting de capture de mouvement humain vers des morphologies robotiques reste une difficulté majeure. Le fait qu'il s'agisse d'une troisième version révisée sur arXiv suggère un travail affiné après retours de la communauté. Le choix du Unitree G1, plateforme largement utilisée dans la recherche académique en robotique humanoïde, positionne ces résultats comme reproductibles par d'autres laboratoires, dans un secteur où Unitree, Figure ou Boston Dynamics rivalisent sur la démonstration de comportements dynamiques et expressifs.

RecherchePaper
1 source