Aller au contenu principal
RecherchearXiv cs.RO 

Football humanoïde fondé sur la locomotion : apprentissage par renforcement à portes de tâches d'une bibliothèque de frappes multidirectionnelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv une approche du football humanoïde qui inverse l'architecture dominante. Les systèmes récents prennent le suivi de mouvement (motion tracking) comme socle et en dérivent la locomotion, généralement en dirigeant une ancre de référence vers le ballon. Ici, les auteurs entraînent d'abord une politique de locomotion générale, pilotée par commandes de vitesse, puis lui ajoutent N compétences de frappe guidées par le mouvement, sous forme de couches activées selon la tâche (task-gated). Le dispositif est instancié sur un Unitree G1 à 29 degrés de liberté, avec sept frappes issues de mouvements retargetés. Elles couvrent 259,5 degrés de direction de visée nominale, dont des tirs latéraux, vers l'arrière et du pied faible, qu'une référence unique orientée vers l'avant ne peut pas exprimer. La bibliothèque est validée sur matériel avec des approches avant, latérales, arrière et commandées. Le papier rapporte la précision de tir, mais aussi le suivi de commandes, la tenue sur terrain irrégulier et la récupération après poussée, avec toute la bibliothèque de frappes active.

L'intérêt tient au choix de ce qui sert de fondation. Quand la locomotion n'est entraînée que sur la distribution étroite et déterministe de commandes qu'induit l'approche du ballon, elle n'est jamais évaluée comme capacité à part entière. Ici, l'espace de démarches atteignable dépend du curriculum de locomotion, pas d'un clip de référence. Chaque compétence part de cet état commandable et y revient, donc la locomotion sert de pivot de composition : le nombre de transitions croît en O(N) au lieu de O(N²). La stabilisation après frappe est confiée au contrôleur entraîné plutôt que scriptée clip par clip. Pour un intégrateur, cela rend l'ajout d'une compétence moins coûteux et plus sûr, car la robustesse de base n'est pas renégociée à chaque ajout. Le papier évalue aussi un axe que les systèmes précédents ne publient pas : la dégradation éventuelle de la locomotion une fois la bibliothèque attachée. À noter toutefois que le résumé ne donne aucun chiffre de précision ni de taux de réussite, et que la validation matérielle porte sur un seul robot. Ces points sont à vérifier dans le texte complet.

Ce travail s'inscrit dans la vague des humanoïdes footballeurs pilotés par apprentissage par renforcement et suivi de mouvement, qui ont produit de bons résultats de tir mais restent centrés sur le geste vers l'avant. Le G1 d'Unitree, plateforme peu chère et très répandue en recherche, sert de banc d'essai commun, ce qui facilite la comparaison avec les travaux concurrents. Le papier reste une préimpression (arXiv 2609.38852v1) sans pilote industriel ni calendrier annoncé. La suite logique serait d'étendre la bibliothèque au-delà de sept frappes et d'y intégrer la perception du ballon et des adversaires. Il faudra aussi voir si l'architecture inversée est reprise par d'autres équipes ou transférée vers des tâches de manipulation et de logistique.

Dans nos dossiers

À lire aussi

Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes
1arXiv cs.RO 

Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes

Une équipe de recherche a publié le 28 août 2026 sur arXiv (2608.28090) une étude sur la locomotion omnidirectionnelle d'un robot humanoïde assis sur une chaise mobile passive à roulettes. Contrairement aux humanoïdes debout, dont les actionneurs quasi-direct-drive génèrent en continu du couple articulaire, la position assise délègue le maintien du poids à la chaise. La politique de contrôle, entraînée par apprentissage par renforcement sans récompense d'imitation de mouvement, ne reçoit que la proprioception du robot et les commandes de vitesse, sans capteur de contact ni information sur l'état de la chaise. Lors d'essais à commandes aléatoires, elle a suivi les trajectoires demandées pendant la quasi-totalité de séquences de 20 secondes, dépassant même une politique de référence en position debout sur la précision de suivi. Une analyse factorielle menée sur quatre graines d'entraînement montre qu'une régularisation du glissement du pied réduit le coût de transport mais peut figer le robot dans un optimum stationnaire, un défaut corrigé en la combinant à une régularisation de symétrie ou à un curriculum de commandes. Le coût de transport se classe, du plus bas au plus élevé, marche arrière, déplacement latéral, puis marche avant. Transférée sans réentraînement sur un robot réel Unitree G1, la politique a produit une locomotion assise omnidirectionnelle. Ce travail s'attaque à un angle mort de la course aux humanoïdes, focalisée jusqu'ici sur la marche et la manipulation en position debout pour des tâches d'usine ou de logistique. Une grande partie du travail de bureau ou d'établi se fait pourtant assis, et maintenir un humanoïde debout en continu sollicite inutilement ses actionneurs et son énergie. En montrant qu'une politique entraînée uniquement par récompense de suivi de vitesse, sans imitation de mouvement ni capteurs de contact, transfère en zero-shot vers un robot réel, l'étude conforte l'idée que l'apprentissage par renforcement en simulation franchit l'écart sim-to-real sur des tâches de locomotion toujours plus spécialisées. L'étude reste un travail de recherche académique en prépublication, sans partenaire industriel ni calendrier de commercialisation annoncé, qui étend l'environnement standard de suivi de vitesse en position debout déjà utilisé dans la communauté robotique, avec un modèle de chaise passive et des récompenses propres à l'état assis. Le choix du Unitree G1, plateforme largement diffusée dans la recherche en contrôle moteur, en fait une base accessible plutôt qu'une vitrine commerciale, à la différence des plateformes propriétaires comme Figure ou Optimus. Les auteurs présentent ce résultat comme une première étape vers une locomanipulation assise complète, avant l'ajout probable de tâches de manipulation des bras pendant le déplacement sur la chaise.

RecherchePaper
1 source
Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL
2arXiv cs.RO 

Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL

Un article de recherche publié sur arXiv (2609.19041v1) en septembre 2026, intitulé "Loco-Loco-RL: Low-Cost Terrain Mapping for Humanoid Locomotion with Reinforcement Learning", propose une méthode de perception de terrain low-cost pour la locomotion humanoïde. Plutôt que les caméras de profondeur ou LiDAR habituels, coûteux et gourmands en calcul, les auteurs utilisent un simple capteur time-of-flight bon marché pour construire une représentation 3D locale du terrain. Pour exploiter ce signal épars, ils introduisent une politique transformer temporelle à compression de tokens: les observations proprioceptives et de terrain sont tokenisées, traitées par un transformer à self-attention multi-tête, compressées via un module MLP en espace latent, puis stockées dans un historique glissant de 15 pas de temps qu'un second transformer à cross-attention exploite pour la politique de renforcement. La méthode a été validée par transfert sim-to-real sur un robot humanoïde physique, sur un benchmark de locomotion en terrain accidenté, avec une marche jugée robuste malgré la faible résolution du capteur. Aucun partenaire industriel ni déploiement commercial n'est mentionné: c'est un travail de recherche, pas une annonce produit, et aucune plateforme humanoïde n'est nommée. L'intérêt pour les intégrateurs reste néanmoins direct, car le coût et la consommation des capteurs de perception pèsent lourd dans le bill of materials des humanoïdes et freinent leur déploiement en volume. En montrant qu'un capteur ToF bon marché et basse résolution suffit à une locomotion robuste sur terrain accidenté grâce à une architecture transformer compressée, le travail apporte un contre-exemple concret à l'idée qu'une perception haute résolution est indispensable au franchissement d'obstacles, une piste pour réduire les coûts de production à l'échelle. L'approche s'inscrit dans une lignée de travaux en apprentissage par renforcement pour la locomotion de robots à pattes, où la perception extéroceptive du terrain reste coûteuse à traiter face à la simple proprioception. Elle se positionne face aux approches concurrentes misant sur des caméras de profondeur ou LiDAR embarqués, plus riches mais plus chers et plus lourds à calculer en temps réel. L'article ne précise ni le robot utilisé pour les essais ni de calendrier de déploiement industriel: à ce stade, c'est un preprint validant un principe en laboratoire, sans partenaire ni pilote annoncés. La suite logique, non détaillée par les auteurs, serait une extension à des terrains plus variés et une comparaison directe des coûts et performances face aux stacks LiDAR ou caméra de profondeur standards du secteur.

RecherchePaper
1 source
Générer, suivre, améliorer : locomotion humanoïde multi-compétences perceptive via générateurs de mouvement affinés par apprentissage par renforcement
3arXiv cs.RO 

Générer, suivre, améliorer : locomotion humanoïde multi-compétences perceptive via générateurs de mouvement affinés par apprentissage par renforcement

Une équipe de recherche a publié le 28 septembre sur arXiv (référence 2609.31577) une architecture de locomotion en deux couches pour robots humanoïdes, baptisée "Generate, Track, Improve", testée sur un Unitree G1. Le système associe un générateur de mouvement par flow matching, qui planifie des trajectoires corps entier à partir d'images de profondeur brutes, à une politique de suivi entraînée par apprentissage par renforcement guidé par le contrôle. Les deux modules s'appuient sur une bibliothèque de clips de mouvement dérivés de données humaines optimisées dynamiquement pour rester cohérents avec le terrain. La contribution centrale est une boucle de réglage fin par RL hors politique (off-policy), combinant recherche structurée et régression pondérée par l'avantage, présentée comme plus économe en données qu'un réglage résiduel classique en politique (on-policy). Les auteurs annoncent une hausse allant jusqu'à 25 points de pourcentage des franchissements de terrain réussis et jusqu'à 80 points pour la sélection de compétence. Avec deux caméras de profondeur seulement, sans odométrie ni carte de hauteur, une seule paire de politiques permet au G1 de marcher, courir, sauter sur des caisses et gravir des escaliers en extérieur, en adaptant sa vitesse au relief perçu à distance. Pour l'industrie robotique, ce travail cible deux limites connues des humanoïdes actuels: la dépendance à des cartes de terrain préconstruites ou à une odométrie précise, et l'écart persistant entre démonstrations en simulation et robustesse réelle. En montrant qu'une seule paire de politiques suffit à enchaîner plusieurs compétences en extérieur à partir de vision brute, l'étude conforte l'idée que des architectures de type génération de mouvement plus suivi, dans l'esprit des modèles VLA employés en manipulation comme Pi-0 ou GR00T N2, peuvent s'étendre à la locomotion perceptive multi-compétences. C'est un signal utile pour les intégrateurs cherchant des contrôleurs capables de généraliser à des géométries de terrain inédites sans recalibration lourde, condition pour des usages en logistique extérieure, chantier ou inspection. Il s'agit toutefois de résultats de recherche publiés sur arXiv, mesurés sur les benchmarks propres des auteurs, et non d'un produit commercialisé ni d'un déploiement en flotte. Le choix du Unitree G1 comme plateforme d'essai confirme son rôle de banc de test de référence pour la recherche académique en locomotion humanoïde, aux côtés d'autres travaux sur le contrôle par renforcement et les modèles génératifs de mouvement. L'approche se positionne explicitement contre le fine-tuning résiduel on-policy, jugé plus coûteux en échantillons, en proposant une alternative off-policy plus sobre en calcul. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste à ce stade un article de recherche accompagné d'une page projet, sans calendrier de transfert vers un produit ni pilote industriel annoncé. La suite logique, non confirmée par les auteurs, consisterait à valider l'architecture sur d'autres plateformes humanoïdes ou à l'associer à des tâches de manipulation pour former une pile complète perception-locomotion-manipulation.

RecherchePaper
1 source
Apprentissage par renforcement pour le contrôle adaptatif multi-tâches de robots bipèdes jouant au football
4arXiv cs.RO 

Apprentissage par renforcement pour le contrôle adaptatif multi-tâches de robots bipèdes jouant au football

Des chercheurs ont publié sur arXiv (preprint arXiv:2604.19104, avril 2026) un cadre d'apprentissage par renforcement modulaire destiné aux robots bipèdes évoluant dans des environnements de football dynamiques. L'architecture propose deux modules distincts : un réseau de recherche et de frappe de balle (BSKN, Ball-Seeking and Kicking Network) et un réseau de récupération après chute (FRN, Fall Recovery Network), commutés par une machine à états basée sur la posture du robot. La génération de gaits de base est confiée à un oscillateur feedforward en boucle ouverte, tandis qu'un résiduel RL en boucle fermée gère les actions football plus complexes. Le FRN est entraîné via une stratégie de curriculum à atténuation progressive des forces. Les validations ont été conduites entièrement en simulation Unity, avec un temps de récupération après chute mesuré à 0,715 secondes en moyenne, et une capacité démontrée à localiser et frapper le ballon même depuis des angles de coin restrictifs. Ce travail s'attaque à un verrou connu en robotique humanoïde : le couplage profond entre stabilité locomotrice et exécution de tâches complexes, qui provoque typiquement des interférences d'état lors des transitions (marche droite, frappe, chute, relevé). La séparation explicite en deux réseaux spécialisés, pilotée par une machine à états posturale, contourne ce problème architecturalement plutôt que de tenter de le résoudre par un unique réseau généraliste. Cela valide partiellement l'hypothèse que la modularité reste une approche compétitive face aux VLA (Vision-Language-Action models) monolithiques pour des tâches à contraintes temporelles dures. Réserve importante : les résultats sont entièrement sim-to-real non validés, l'écart simulation-réalité (sim-to-real gap) n'est pas quantifié, et les vidéos sélectives de démonstration Unity ne permettent pas d'évaluer la robustesse au déploiement physique. Le contexte est celui de la RoboCup et des compétitions de football robotique bipède, terrain historique de benchmarking pour la locomotion dynamique depuis les années 2000. Les auteurs ne sont pas identifiés institutionnellement dans l'abstract, mais le style et la thématique évoquent des groupes de recherche est-asiatiques actifs sur cette compétition. Sur le plan concurrentiel, des approches similaires à base de RL modulaire ont été explorées par des équipes de l'ETH Zurich (ANYmal), de CMU et de Berkeley pour des robots quadrupèdes, avec transfert sim-to-real validé sur hardware. Pour les bipèdes football, la prochaine étape crédible serait un déploiement sur plateforme physique type DARwIn-OP ou NAO, dont ce papier ne mentionne aucune planification.

RecherchePaper
1 source