Aller au contenu principal
Apprentissage de compétences réactives de football par vision pour robots humanoïdes
RecherchearXiv cs.RO 

Apprentissage de compétences réactives de football par vision pour robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente, dans une version mise à jour d'un preprint arXiv (2511.03996v2), un contrôleur basé sur l'apprentissage par renforcement qui permet à des robots humanoïdes d'acquérir des réflexes de football pilotés par la vision, en couplant directement perception visuelle et contrôle locomoteur plutôt que de séparer les deux étapes dans un pipeline modulaire. Entraîné en simulation avec des "adversarial motion priors" pour produire des mouvements naturels, le système repose sur une architecture encodeur-décodeur et un module de perception virtuelle reproduisant le bruit et les échecs de détection d'une caméra embarquée. Le robot exécute ainsi, avec la seule vision embarquée, la recherche du ballon, sa poursuite et des frappes multidirectionnelles. Face à une méthode de référence basée sur des règles fixes, l'erreur d'estimation de la position du ballon chute de 46%, le temps avant frappe diminue jusqu'à 64%, et le taux de réussite atteint environ 90% en zone offensive, testé lors de compétitions RoboCup réelles.

Ce résultat contredit une pratique répandue en robotique humanoïde, qui consiste à séparer perception et contrôle ou à supposer une détection quasi parfaite. En intégrant l'incertitude visuelle directement dans l'apprentissage de la politique, les auteurs montrent qu'un contrôleur de bout en bout peut rester réactif malgré un bruit de détection réaliste, fréquent dès la sortie du laboratoire. Pour les équipes travaillant sur des humanoïdes destinés à des environnements dynamiques, au-delà du seul football, cette boucle fermée perception-contrôle suggère une piste généralisable à des tâches de manipulation ou de navigation exigeant une adaptation continue sous perception dégradée, un enjeu clé pour combler l'écart entre simulation et conditions réelles.

Il s'agit d'une contribution académique publiée sur arXiv en version révisée, non d'une annonce de produit commercial: aucune entreprise ni modèle de robot n'est nommé, la validation s'appuyant sur une plateforme générique testée dans le cadre de la RoboCup Humanoid League, compétition où plusieurs équipes universitaires confrontent depuis des années leurs algorithmes de locomotion et de perception. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs n'annoncent ni calendrier de déploiement industriel ni partenariat, se limitant à évoquer la poursuite des tests en conditions de compétition réelle.

Dans nos dossiers

À lire aussi

Apprentissage de compétences d'attaquant agile pour robots humanoïdes footballeurs à partir de capteurs bruités
1arXiv cs.RO 

Apprentissage de compétences d'attaquant agile pour robots humanoïdes footballeurs à partir de capteurs bruités

Des chercheurs ont publié sur arXiv (réf. 2512.06571, troisième révision) un système d'apprentissage par renforcement permettant à des robots humanoïdes d'exécuter des frappes de balle précises et répétées, même face à des capteurs bruités et des perturbations extérieures simulant des adversaires. L'entraînement se structure en quatre étapes : une phase de poursuite longue distance, puis de frappe directionnelle, conduites par une politique dite "enseignant" alimentée en données d'état parfaites ; ensuite une distillation de cette politique vers un agent "étudiant" fonctionnant avec des capteurs imparfaits ; enfin une adaptation par RL contraint. Les expériences ont été conduites en simulation et sur un vrai robot humanoïde, avec des résultats solides en précision de frappe et en taux de buts sur des configurations balle-but variées. Ce qui distingue ces travaux, c'est la rigueur avec laquelle le fossé sim-to-real est traité. Le bruit de perception est modélisé explicitement pendant l'entraînement, et l'étape de RL contraint permet de raffiner le comportement de l'agent sans dégrader ses acquis antérieurs. Maintenir l'équilibre sur un seul appui pendant une frappe rapide constitue un défi de contrôle entier-corps que les approches classiques peinent souvent à transférer du simulateur au hardware. Le fait que le système fonctionne sur robot réel, et pas uniquement en simulation sélectionnée, est un indicateur de maturité non négligeable pour les équipes R&D travaillant sur des plateformes comme l'Unitree H1 ou le Fourier GR-1. Ce travail s'inscrit dans l'essor des compétitions de football humanoïde, notamment le RoboCup Humanoid League, où le passage de démonstrations contrôlées à des comportements robustes face à l'adversité reste le principal verrou. Le cadre enseignant-étudiant est une approche bien établie dans la littérature du contrôle locomoteur, portée par de nombreux travaux sur la locomotion quadrupède et humanoïde ces cinq dernières années. Ce qui singularise cette contribution est l'ajout d'une étape d'adaptation par RL contraint et la modélisation réaliste du bruit de perception dans la boucle d'entraînement, deux éléments que les études d'ablation de l'article identifient comme critiques pour la performance finale. Les auteurs proposent ce système comme benchmark de référence pour les compétences visuomotrices en contrôle entier-corps humanoïde, un angle encore peu formalisé dans un domaine dominé par la locomotion et la manipulation statique.

RecherchePaper
1 source
Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée
2arXiv cs.RO 

Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée

Une équipe de recherche propose une nouvelle méthode d'apprentissage par renforcement pour le dribble de ballon chez les robots humanoïdes, appliquée en simulation à un Booster T1. Publiée le 12 juillet 2026 sur arXiv, l'approche intègre un encodeur de profondeur temporel directement dans la politique de contrôle via une couche de projection spécifique à la tâche, permettant au robot d'apprendre à dribbler uniquement à partir d'images de profondeur embarquées, sans estimation d'état explicite ni information privilégiée sur la scène. Les résultats chiffrés sont précis : 100% de réussite en dribble nominal vers une cible fixe, 96% avec un obstacle statique unique sur le trajet, mais seulement 46% de réussite face à un adversaire mobile qui tente activement de intercepter le ballon. Cet écart de performance entre scénarios statiques et dynamiques est en soi la donnée la plus intéressante pour l'industrie robotique : il illustre concrètement le fossé qui sépare les démonstrations contrôlées des conditions réelles d'usage, un problème récurrent chez les humanoïdes commerciaux (Figure 03, Optimus, ou les plateformes utilisant des architectures VLA comme Pi-0 ou GR00T N2). Pour les intégrateurs et décideurs qui évaluent la maturité de la locomotion-manipulation embarquée, ce travail confirme qu'apprendre la perception et le contrôle de façon conjointe, plutôt que de les traiter comme deux modules séparés, améliore la robustesse face aux occlusions et aux mouvements rapides du ballon. Mais le taux de succès de 46% contre un adversaire actif montre que la gestion d'interactions dynamiques et imprévisibles reste un problème ouvert, loin d'être résolu à l'échelle. Le travail s'inscrit dans la lignée des recherches sur le soccer humanoïde comme banc d'essai pour l'agilité robotique, un domaine où les approches classiques séparaient historiquement perception et contrôle moteur, au prix d'une fragilité en conditions réelles. Les auteurs positionnent leur méthode comme une base pour aborder des scénarios encore plus complexes impliquant des adversaires mobiles multiples, sans toutefois annoncer de calendrier de transfert vers un robot physique, l'ensemble des expériences restant à ce stade purement simulé.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
3arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
4arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source