Aller au contenu principal
PACE : augmentation physique pour un apprentissage par renforcement coordonné de bout en bout, vers un tennis de table humanoïde polyvalent
RecherchearXiv cs.RO 

PACE : augmentation physique pour un apprentissage par renforcement coordonné de bout en bout, vers un tennis de table humanoïde polyvalent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du TRACE Lab de l'université Purdue ont publié PACE, un système d'apprentissage par renforcement qui traduit directement les positions de balle observées en commandes articulaires pour tout le corps, bras et jambes, au tennis de table humanoïde. Un prédicteur léger anticipe la trajectoire future de la balle, tandis qu'un second prédicteur physique fournit, à l'entraînement, des récompenses denses guidant l'exploration. En simulation, sur une plage variée de services, la politique atteint un taux de frappe réussie supérieur ou égal à 96% et un taux de succès supérieur ou égal à 92%. Déployé en zero-shot sur un robot Booster T1 à 23 articulations rotatives, le système produit un jeu de jambes coordonné avec des retours rapides et précis; le code est publié en open source en vue d'ICRA 2026.

Ce résultat s'attaque à l'un des écarts les plus tenaces de la robotique humanoïde, celui entre démonstration et réalité: le tennis de table exige perception rapide, locomotion proactive et coordination bras-jambes sous contrainte de timing serré, un registre longtemps hors de portée du contrôle bout-en-bout. Le transfert zero-shot, fonctionnel sans réentraînement spécifique, apporte une preuve concrète que l'approche sim-to-real peut tenir sur des tâches dynamiques rapides, pas seulement sur de la marche ou de la manipulation lente. Pour les équipes de recherche, cela valide l'usage de prédicteurs physiques comme mécanisme de récompense à l'entraînement, une piste transférable à d'autres sports de raquette ou tâches exigeant réactivité et coordination corps entier.

Ce travail s'inscrit dans une vague plus large de recherche sur les humanoïdes sportifs, alimentée par des démonstrations de course ou de manipulation dynamique chez Boston Dynamics, Unitree ou Figure, mais rarement documentée avec un tel niveau de détail méthodologique et de code ouvert. Le choix du Booster T1, plateforme chinoise de Booster Robotics, confirme sa place croissante dans la recherche académique en RL humanoïde, aux côtés des Unitree G1 et H1 plus répandus dans les laboratoires occidentaux. Les prochaines étapes attendues, en vue d'ICRA 2026, incluent des échanges plus longs et compétitifs, au-delà du simple retour de service, et des tests face à des adversaires humains réels.

À lire aussi

Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne
1arXiv cs.RO 

Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs publient Robo-ValueRL, un framework d'apprentissage par renforcement offline-to-online pour la manipulation robotique, décrit dans un article arXiv (2607.09866v1) diffusé cette semaine. Le système entraîne un estimateur de valeur conditionné par l'historique des actions, dont la fiabilité est mesurée via deux métriques, la progression globale et la préférence locale. Ces estimations de valeur alimentent ensuite deux étapes : un pré-entraînement de politique par cohérence conditionnée à la qualité des données, puis un module d'adaptation résiduelle appliqué lors des déploiements en ligne. Les expériences s'appuient sur un volume conséquent, 240 heures de démonstrations hors ligne et plus de 3 000 trajectoires de rollout en ligne. Sur deux tâches de précision, l'insertion de puces électroniques au millimètre près et le désassemblage générique de blocs, le système atteint respectivement 86% et 84% de taux de réussite. L'apport principal ne se situe pas dans un nouveau record de performance mais dans la démonstration d'un lien direct entre la fiabilité de la fonction de valeur et la qualité de la politique finale. Concrètement, un estimateur de valeur fiable permet de prioriser les données de meilleure qualité parmi un ensemble hétérogène de démonstrations, ce qui bat le clonage comportemental classique, indifférent à la qualité des données, et stabilise la phase d'amélioration en ligne. Pour les équipes qui construisent des pipelines de RL robotique à partir de données de téléopération ou de simulation de qualité inégale, ce résultat justifie d'investir dans le diagnostic de la fonction de valeur plutôt que de simplement augmenter le volume de données ou la taille des modèles de politique. Le travail s'inscrit dans la tendance actuelle du secteur à combiner pré-entraînement hors ligne sur de larges jeux de démonstrations et affinage en ligne par rollouts réels, une approche jugée prometteuse pour la manipulation robotique généralisable mais dont la complexité technique rend la reproduction et le diagnostic difficiles, un point que les auteurs soulignent explicitement comme motivation de leur étude. Robo-ValueRL se positionne comme un banc d'essai unifié plutôt qu'un produit fini, destiné à isoler l'effet de la fiabilité de l'estimation de valeur des autres composants du pipeline. L'article ne précise pas de suite industrielle ni de partenaire de déploiement identifié à ce stade, le travail restant à un niveau de recherche académique.

RecherchePaper
1 source
Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL
2arXiv cs.RO 

Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL

Un article de recherche publié sur arXiv (2609.19041v1) en septembre 2026, intitulé "Loco-Loco-RL: Low-Cost Terrain Mapping for Humanoid Locomotion with Reinforcement Learning", propose une méthode de perception de terrain low-cost pour la locomotion humanoïde. Plutôt que les caméras de profondeur ou LiDAR habituels, coûteux et gourmands en calcul, les auteurs utilisent un simple capteur time-of-flight bon marché pour construire une représentation 3D locale du terrain. Pour exploiter ce signal épars, ils introduisent une politique transformer temporelle à compression de tokens: les observations proprioceptives et de terrain sont tokenisées, traitées par un transformer à self-attention multi-tête, compressées via un module MLP en espace latent, puis stockées dans un historique glissant de 15 pas de temps qu'un second transformer à cross-attention exploite pour la politique de renforcement. La méthode a été validée par transfert sim-to-real sur un robot humanoïde physique, sur un benchmark de locomotion en terrain accidenté, avec une marche jugée robuste malgré la faible résolution du capteur. Aucun partenaire industriel ni déploiement commercial n'est mentionné: c'est un travail de recherche, pas une annonce produit, et aucune plateforme humanoïde n'est nommée. L'intérêt pour les intégrateurs reste néanmoins direct, car le coût et la consommation des capteurs de perception pèsent lourd dans le bill of materials des humanoïdes et freinent leur déploiement en volume. En montrant qu'un capteur ToF bon marché et basse résolution suffit à une locomotion robuste sur terrain accidenté grâce à une architecture transformer compressée, le travail apporte un contre-exemple concret à l'idée qu'une perception haute résolution est indispensable au franchissement d'obstacles, une piste pour réduire les coûts de production à l'échelle. L'approche s'inscrit dans une lignée de travaux en apprentissage par renforcement pour la locomotion de robots à pattes, où la perception extéroceptive du terrain reste coûteuse à traiter face à la simple proprioception. Elle se positionne face aux approches concurrentes misant sur des caméras de profondeur ou LiDAR embarqués, plus riches mais plus chers et plus lourds à calculer en temps réel. L'article ne précise ni le robot utilisé pour les essais ni de calendrier de déploiement industriel: à ce stade, c'est un preprint validant un principe en laboratoire, sans partenaire ni pilote annoncés. La suite logique, non détaillée par les auteurs, serait une extension à des terrains plus variés et une comparaison directe des coûts et performances face aux stacks LiDAR ou caméra de profondeur standards du secteur.

RecherchePaper
1 source
Vers un apprentissage par renforcement piloté par couple pour la locomotion quadrupède
3arXiv cs.RO 

Vers un apprentissage par renforcement piloté par couple pour la locomotion quadrupède

Des chercheurs publient sur arXiv (référence 2607.18365v1) un nouveau cadre d'apprentissage par renforcement (RL) piloté par le couple moteur, plutôt que par la position, pour la locomotion de robots quadrupèdes. Contrairement aux approches RL classiques qui commandent les articulations en position et nécessitent une estimation d'état complexe (notamment la vitesse linéaire de l'engin), ce framework agit directement sur le couple et permet à un robot de suivre une vitesse cible sans connaître sa propre vitesse en temps réel. L'équipe a testé son approche en simulation sur Nvidia Isaac Sim et Isaac Lab, en utilisant le quadrupède Unitree B1, une plateforme lourde et à fort couple par rapport aux petits robots légers habituellement employés dans ce type de recherche. Résultat : le robot simulé atteint 3,5 m/s en vitesse linéaire et 1,5 rad/s en rotation, et parvient à monter et descendre des escaliers sans capteur extéroceptif (caméra ou lidar), en s'appuyant uniquement sur sa perception proprioceptive. L'enjeu dépasse la simple performance chiffrée : la plupart des frameworks RL actuels butent sur des robots légers, limités dès qu'il s'agit de tâches à forte exigence mécanique (charge utile, franchissement d'obstacles robustes). En démontrant qu'un contrôle par couple peut fonctionner sur une plateforme lourde et à haut couple sans état de vitesse explicite, ce travail ouvre la voie à des quadrupèdes RL capables d'opérations industrielles plus exigeantes, un axe clé pour les intégrateurs qui cherchent à sortir la locomotion apprise des laboratoires vers des usages réels (inspection, logistique en terrain difficile). Il faut toutefois noter que ces résultats restent purement issus de la simulation, sans validation sur robot physique à ce stade, ce qui laisse ouverte la question classique du transfert sim-to-real. Le choix du Unitree B1, une plateforme commerciale déjà répandue dans la recherche en robotique mobile, suggère une intention de test réel à venir, mais aucun calendrier n'est communiqué dans l'article.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
4arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source