LooperMuscle : apprentissage rapide et stable du suivi corporel complet chez l'humanoïde via un mélange d'experts structuré
Publié sur arXiv le 2 août 2026 sous la référence 2608.00820v1, l'article présente LooperMuscle, un framework d'apprentissage par renforcement conçu pour combler l'écart de performance entre deux familles de méthodes utilisées pour entraîner des humanoïdes au suivi de mouvement corps entier (whole-body tracking). Les méthodes de type FastSAC permettent d'entraîner une politique en environ 15 minutes, mais avec une qualité de suivi nettement inférieure à celle obtenue par PPO, qui nécessite environ 6 heures pour un résultat plus solide. LooperMuscle combine trois composants entraînés en boucle fermée : un acteur en mélange d'experts structuré sémantiquement, un critique distributionnel conscient de la contribution de chaque expert, et un mécanisme de replay routé par contribution avec curriculum différé. Les contributions des experts orientent le routage des données, ces données façonnent l'apprentissage de la fonction de valeur, et les gradients de valeur affinent en retour la spécialisation des experts. Résultat mesuré : environ 45 minutes de simulation suffisent pour récupérer une part substantielle de l'écart restant avec PPO, tout en restant très en dessous de son temps d'entraînement.
Pour l'industrie robotique, ce travail s'attaque à un vrai goulot d'étranglement : l'entraînement des contrôleurs de locomotion et de manipulation coordonnée reste coûteux en temps de calcul, ce qui freine l'itération rapide des politiques avant tout passage en réel. Un gain de vitesse d'entraînement sans sacrifier la précision du suivi profiterait directement aux équipes qui développent des contrôleurs pour humanoïdes, en accélérant les cycles de conception en simulation. Il faut toutefois noter que les résultats annoncés sont uniquement des mesures en simulation, sans validation sur robot physique ni comparaison au sim-to-real gap.
Ce travail s'inscrit dans la tension bien connue entre méthodes on-policy comme PPO, stables mais lentes, et méthodes off-policy de la famille SAC, rapides mais historiquement moins fiables sur des tâches complexes comme le contrôle corps entier. LooperMuscle tente de concilier les deux approches plutôt que de choisir un camp. Le code doit être publié sur loopermuscle.github.io, sans date précisée, ce qui laissera la communauté vérifier ces résultats de manière indépendante.
Dans nos dossiers



