Aller au contenu principal
RecherchearXiv cs.RO 

LooperMuscle : apprentissage rapide et stable du suivi corporel complet chez l'humanoïde via un mélange d'experts structuré

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv le 2 août 2026 sous la référence 2608.00820v1, l'article présente LooperMuscle, un framework d'apprentissage par renforcement conçu pour combler l'écart de performance entre deux familles de méthodes utilisées pour entraîner des humanoïdes au suivi de mouvement corps entier (whole-body tracking). Les méthodes de type FastSAC permettent d'entraîner une politique en environ 15 minutes, mais avec une qualité de suivi nettement inférieure à celle obtenue par PPO, qui nécessite environ 6 heures pour un résultat plus solide. LooperMuscle combine trois composants entraînés en boucle fermée : un acteur en mélange d'experts structuré sémantiquement, un critique distributionnel conscient de la contribution de chaque expert, et un mécanisme de replay routé par contribution avec curriculum différé. Les contributions des experts orientent le routage des données, ces données façonnent l'apprentissage de la fonction de valeur, et les gradients de valeur affinent en retour la spécialisation des experts. Résultat mesuré : environ 45 minutes de simulation suffisent pour récupérer une part substantielle de l'écart restant avec PPO, tout en restant très en dessous de son temps d'entraînement.

Pour l'industrie robotique, ce travail s'attaque à un vrai goulot d'étranglement : l'entraînement des contrôleurs de locomotion et de manipulation coordonnée reste coûteux en temps de calcul, ce qui freine l'itération rapide des politiques avant tout passage en réel. Un gain de vitesse d'entraînement sans sacrifier la précision du suivi profiterait directement aux équipes qui développent des contrôleurs pour humanoïdes, en accélérant les cycles de conception en simulation. Il faut toutefois noter que les résultats annoncés sont uniquement des mesures en simulation, sans validation sur robot physique ni comparaison au sim-to-real gap.

Ce travail s'inscrit dans la tension bien connue entre méthodes on-policy comme PPO, stables mais lentes, et méthodes off-policy de la famille SAC, rapides mais historiquement moins fiables sur des tâches complexes comme le contrôle corps entier. LooperMuscle tente de concilier les deux approches plutôt que de choisir un camp. Le code doit être publié sur loopermuscle.github.io, sans date précisée, ce qui laissera la communauté vérifier ces résultats de manière indépendante.

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

StableMimic : récupération fluide et humaine pour le suivi de mouvement humanoïde, un apprentissage au-delà de la distribution de suivi pour un comportement structuré post-chute

StableMimic, présenté début août 2026 sur arXiv (2608.02385v1), est un système unifié de suivi de mouvement pour robots humanoïdes conçu pour gérer les chutes sans intervention externe. Le problème visé : les politiques de suivi classiques fonctionnent bien tant que le robot reste dans la distribution de trajectoires apprises, mais une chute le projette dans des états de contact au sol (à plat ventre, sur le dos, en déséquilibre) où la commande suivante devient temporairement irréalisable, poussant ces politiques à produire des corrections de membres brutales et risquées. La solution repose sur deux experts dédiés, l'un pour le suivi normal et l'autre pour la relevée post-chute, mélangés en continu par une porte proprioceptive, entraînés grâce à des réinitialisations perturbées autour de références humaines de redressement variées. Un objectif d'état successeur caché structure cette relevée sans jamais exposer au module déployé l'identité de la référence utilisée. Sur le sous-ensemble de danse LAFAN1 retargeté, StableMimic obtient les erreurs les plus basses sur les quatre métriques de suivi parmi cinq méthodes comparées, et sur 100 essais de chute provoquée par poussée, il se relève 100 fois sur 100 avec les meilleurs scores sur six des sept mesures de sécurité post-chute. Des déploiements réels sur un robot Unitree G1 confirment un mouvement des membres borné et une reprise autonome de la commande. Ce résultat comble un angle mort des démonstrations humanoïdes commerciales : la plupart des vitrines publiques, qu'il s'agisse de plateformes pilotées par des VLA comme Pi-0 ou GR00T N2, montrent des robots qui marchent ou manipulent en conditions contrôlées, rarement ce qui se passe après une chute, pourtant fréquente en usage réel. Un taux de relevée de 100% mesuré, plutôt qu'anecdotique, suggère qu'une récupération autonome et sans bascule logicielle externe est atteignable, un prérequis d'exploitation pour tout intégrateur évaluant des humanoïdes en logistique ou en usine. La méthode s'inscrit dans la recherche sur l'imitation par renforcement pour humanoïdes, qui bute généralement sur l'écart entre mouvements normaux retargetés (via LAFAN1) et états hors distribution réels. Les tests restent qualitatifs, limités au G1 de Unitree, plateforme académique courante face aux systèmes propriétaires type Figure ou Optimus. Aucun calendrier de déploiement industriel ni acteur français ou européen n'est mentionné.

RecherchePaper
1 source
Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action
2arXiv cs.RO 

Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action

Les chercheurs proposent une nouvelle méthode de collecte de démonstrations pour l'entraînement de modèles Vision-Language-Action (VLA), publiée sur arXiv le 4 juillet 2026 (arXiv:2607.04591v1). Plutôt que de se concentrer sur l'architecture des modèles ou la taille des jeux de données, comme le fait la majorité des travaux récents, l'équipe s'attaque à un maillon jusqu'ici négligé de l'apprentissage par imitation : la manière dont les démonstrations elles-mêmes sont organisées. Leur approche, testée sur une plateforme robotique à double bras, repose sur trois principes: décomposer les tâches de manipulation complexes en sous-compétences apprises progressivement, standardiser l'environnement d'interaction pour limiter la variabilité inutile, et ordonner les démonstrations par complexité croissante plutôt que de les collecter en bloc. Deux tâches servent de banc d'essai: le tri et la préhension de blocs, et le pliage de serviettes. Les auteurs rapportent une amélioration du taux de réussite et une meilleure stabilité d'entraînement par rapport à la méthode de référence, qui consiste à enregistrer directement des trajectoires complètes de bout en bout, sans toutefois détailler de métriques chiffrées précises dans le résumé. Pour l'industrie robotique, ce travail pointe un angle mort du secteur VLA: la course actuelle privilégie l'échelle des modèles et des jeux de données, sur le modèle de Pi-0, GR00T N2 ou Helix, mais néglige souvent la qualité et la structure des données d'apprentissage. Si l'organisation curriculaire des démonstrations s'avère aussi déterminante que le suggèrent ces résultats, cela remettrait en question l'hypothèse dominante selon laquelle il suffit d'accumuler des heures de téléopération pour obtenir des politiques robustes et généralisables sur des tâches longues et séquentielles. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par curriculum, déjà éprouvé en apprentissage par renforcement, mais peu exploré pour l'imitation robotique à l'ère des VLA. Alors que les grands acteurs du secteur, qu'il s'agisse de Figure, Tesla avec Optimus ou Physical Intelligence, communiquent surtout sur les capacités finales de leurs robots humanoïdes, cette étude reste à un stade de recherche académique, sans annonce de déploiement industriel. Ses auteurs présentent ces résultats comme une preuve de concept ouvrant la voie à une collecte de données plus efficace et plus scalable pour la manipulation robotique à long horizon.

RecherchePaper
1 source
Rapide apprentissage du contrôle de robots souples via un pas de temps implicite
3arXiv cs.RO 

Rapide apprentissage du contrôle de robots souples via un pas de temps implicite

Des chercheurs démontrent qu'un apprentissage rapide de politiques de contrôle pour robots souples est possible grâce au pas de temps implicite, une avancée jusqu'ici jugée hors de portée en raison du coût de calcul de la simulation de mécanique des milieux continus. Leur simulateur, DisMech, est un moteur généraliste entièrement implicite capable de gérer à la fois la dynamique des corps souples et les contacts frictionnels. L'équipe introduit aussi le contrôle par delta de courbure naturelle, une méthode analogue au contrôle delta de position articulaire des manipulateurs rigides, offrant un moyen intuitif d'appliquer des commandes lors de l'apprentissage. Testée sur quatre tâches de manipulation souple et comparée à Elastica, l'un des frameworks de simulation souple les plus répandus, l'approche atteint jusqu'à 6 fois la vitesse d'exécution sur les scénarios sans contact et jusqu'à 40 fois sur les scénarios riches en contact, avec 500 environnements simulés en parallèle. Une évaluation de l'écart sim à sim, entraînement dans un simulateur puis test dans un autre, confirme que ces gains de vitesse ne sacrifient pas la précision. Cette avancée s'attaque à un verrou connu du secteur : la simulation de corps rigides a permis l'essor massif de l'apprentissage par renforcement pour les robots articulés classiques, mais la robotique souple est restée à la traîne faute d'outils accessibles et rapides. Pour les chercheurs et industriels développant des préhenseurs souples, des trompes robotiques ou des manipulateurs continus destinés à la manutention délicate, ce travail suggère que l'apprentissage de politiques par simulation, longtemps réservé aux morphologies rigides, devient enfin praticable pour les morphologies déformables. Cela pourrait accélérer le transfert de techniques d'apprentissage de bout en bout vers des applications comme la préhension d'objets fragiles ou la chirurgie assistée, où la rigidité mécanique classique est un handicap. Le fossé entre simulateurs rigides matures et frameworks souples rudimentaires explique en partie le retard de la robotique douce sur l'apprentissage par simulation, un constat que ce travail cherche à combler en misant sur un solveur implicite plutôt que sur des approches explicites plus lentes comme Elastica. L'article, publié sur arXiv en version révisée (arXiv:2511.06667v2), s'inscrit dans une dynamique de recherche visant à doter la robotique souple d'outils logiciels aussi matures que ceux dont bénéficie la robotique rigide depuis des années, ouvrant la voie à de futurs benchmarks entre frameworks concurrents.

RecherchePaper
1 source
Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes
4arXiv cs.RO 

Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes

Des chercheurs ont publié le 25 juin 2026 sur arXiv (preprint 2606.25706) un cadre de contrôle baptisé "asynchronous upper body task-space tracking" pour robots humanoïdes. Le problème qu'ils adressent est architectural : les planificateurs de haut niveau génèrent des trajectoires dans l'espace des tâches à faible fréquence (quelques Hz), alors que les contrôleurs de corps entier tournent à haute fréquence (typiquement plusieurs centaines de Hz). Cette désynchronisation temporelle entre planification et exécution produit des dérives de référentiel et des incohérences dans le contrôle. Pour y remédier, l'équipe propose une politique étudiante initialisée par distillation enseignant-étudiant, conditionnée sur la trajectoire future complète mise en cache et un index d'exécution temporel, puis entraînée avec une récompense globale à fenêtre glissante. Un module MPC (Model Predictive Control) complète les références creuses en guidage corps flottant et membre supérieur, tandis que des contraintes au niveau des actions et de la cinématique directe (FK) limitent la dérive de la politique. Les expériences ont été conduites en simulation et sur le robot Unitree G1, un humanoïde commercial à 23 degrés de liberté. Ce travail touche un goulot d'étranglement concret qui freine la commercialisation des humanoïdes : la chaîne planification-exécution reste fragmentée dans la quasi-totalité des architectures actuelles, forçant des compromis entre réactivité et cohérence de mouvement. Le fait que la politique obtienne de meilleures performances que les baselines synchrones et découplées, et qu'elle s'adapte plus sûrement aux mouvements hors distribution, suggère une progression vers un déploiement robuste en environnement non contrôlé. L'approche sans estimation explicite de référentiel réduit aussi la charge computationnelle, ce qui est pertinent pour les intégrateurs industriels cherchant à embarquer le traitement. Toutefois, il s'agit d'un preprint non encore évalué par les pairs, et les métriques de suivi de trajectoire présentées restent contextualisées à des scénarios de laboratoire ; la généralisabilité à des tâches industrielles réelles reste à démontrer. Unitree Robotics, fabricant chinois fondé en 2016, s'est imposé comme fournisseur de plateformes de recherche abordables avec des robots quadrupèdes puis le G1 humanoïde. Ce contexte explique le choix du matériel : le G1 est accessible à de nombreux labos académiques, ce qui élargit la portée reproductible des résultats. Sur le fond, la course à la maîtrise du pipeline planification-exécution pour les humanoïdes mobilise simultanément Figure (02 et bientôt 03), Tesla Optimus, Agility Robotics, 1X Technologies et les laboratoires académiques liés à Physical Intelligence (Pi-0) et à NVIDIA (GR00T N2). La distillation enseignant-étudiant couplée au MPC comme module de complétion de trajectoire s'inscrit dans une tendance plus large : combler le sim-to-real gap par des architectures hybrides apprises/optimisées plutôt que par du RL pur. Les prochaines étapes naturelles seraient une validation sur des cycles de manipulation répétitifs en cadence industrielle et une intégration avec des VLA (Vision-Language-Action models) pour fermer la boucle perception-planification-exécution.

RecherchePaper
1 source