
Générer, suivre, améliorer : locomotion humanoïde multi-compétences perceptive via générateurs de mouvement affinés par apprentissage par renforcement
Une équipe de recherche a publié le 28 septembre sur arXiv (référence 2609.31577) une architecture de locomotion en deux couches pour robots humanoïdes, baptisée "Generate, Track, Improve", testée sur un Unitree G1. Le système associe un générateur de mouvement par flow matching, qui planifie des trajectoires corps entier à partir d'images de profondeur brutes, à une politique de suivi entraînée par apprentissage par renforcement guidé par le contrôle. Les deux modules s'appuient sur une bibliothèque de clips de mouvement dérivés de données humaines optimisées dynamiquement pour rester cohérents avec le terrain. La contribution centrale est une boucle de réglage fin par RL hors politique (off-policy), combinant recherche structurée et régression pondérée par l'avantage, présentée comme plus économe en données qu'un réglage résiduel classique en politique (on-policy). Les auteurs annoncent une hausse allant jusqu'à 25 points de pourcentage des franchissements de terrain réussis et jusqu'à 80 points pour la sélection de compétence. Avec deux caméras de profondeur seulement, sans odométrie ni carte de hauteur, une seule paire de politiques permet au G1 de marcher, courir, sauter sur des caisses et gravir des escaliers en extérieur, en adaptant sa vitesse au relief perçu à distance.
Pour l'industrie robotique, ce travail cible deux limites connues des humanoïdes actuels: la dépendance à des cartes de terrain préconstruites ou à une odométrie précise, et l'écart persistant entre démonstrations en simulation et robustesse réelle. En montrant qu'une seule paire de politiques suffit à enchaîner plusieurs compétences en extérieur à partir de vision brute, l'étude conforte l'idée que des architectures de type génération de mouvement plus suivi, dans l'esprit des modèles VLA employés en manipulation comme Pi-0 ou GR00T N2, peuvent s'étendre à la locomotion perceptive multi-compétences. C'est un signal utile pour les intégrateurs cherchant des contrôleurs capables de généraliser à des géométries de terrain inédites sans recalibration lourde, condition pour des usages en logistique extérieure, chantier ou inspection. Il s'agit toutefois de résultats de recherche publiés sur arXiv, mesurés sur les benchmarks propres des auteurs, et non d'un produit commercialisé ni d'un déploiement en flotte.
Le choix du Unitree G1 comme plateforme d'essai confirme son rôle de banc de test de référence pour la recherche académique en locomotion humanoïde, aux côtés d'autres travaux sur le contrôle par renforcement et les modèles génératifs de mouvement. L'approche se positionne explicitement contre le fine-tuning résiduel on-policy, jugé plus coûteux en échantillons, en proposant une alternative off-policy plus sobre en calcul. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste à ce stade un article de recherche accompagné d'une page projet, sans calendrier de transfert vers un produit ni pilote industriel annoncé. La suite logique, non confirmée par les auteurs, consisterait à valider l'architecture sur d'autres plateformes humanoïdes ou à l'associer à des tâches de manipulation pour former une pile complète perception-locomotion-manipulation.
Dans nos dossiers




