Gradients de contact groupés : stabiliser la simulation différentiable pour des tâches dynamiques déployables
Des chercheurs présentent Bundled Contact Gradients (BCG), une méthode qui stabilise l'apprentissage de politiques par simulation différentiable pour des tâches dynamiques transférées à des humanoïdes réels. Le papier, publié sur arXiv (2609.30951v1) le 28 septembre 2026, s'attaque à un problème connu de la simulation différentiable : pour obtenir des gradients exploitables à travers les contacts rigides, il faut habituellement assouplir les modèles de contact, ce qui dégrade la fidélité physique et limite les politiques apprises à la simulation. Augmenter la raideur du contact améliore le réalisme mais rend la dynamique très sensible aux petites perturbations d'état, produisant des gradients à haute variance qui déstabilisent l'optimisation du premier ordre. BCG répond à ce problème par un lissage aléatoire localisé au contact : quand un contact rigide est détecté, la méthode évalue un ensemble de rollouts perturbés autour de cette configuration et agrège leurs signaux de gradient pour réduire la variance. Les auteurs rapportent un entraînement et un transfert zero-shot réussis de mouvements dynamiques sur une plateforme humanoïde réelle Unitree G1, avec vidéos disponibles sur le site du projet.
L'enjeu dépasse la seule prouesse académique : le fossé sim-to-real reste l'un des principaux freins à la commercialisation des humanoïdes, en particulier pour les mouvements dynamiques (sauts, contacts pied-sol impulsifs, manipulation en force) où les modèles de contact assouplis échouent typiquement à se transférer au réel. Une méthode qui permet d'augmenter la raideur des contacts en simulation sans faire exploser la variance des gradients touche directement à la crédibilité des pipelines d'apprentissage par renforcement ou par optimisation différentiable utilisés par les fournisseurs de plateformes humanoïdes (Unitree, mais aussi les architectures VLA comme GR00T N2, Pi-0 ou Helix qui s'appuient sur des politiques apprises). Pour les intégrateurs et laboratoires de recherche, cela suggère une voie pour entraîner des comportements dynamiques plus riches sans dépendre uniquement du reinforcement learning classique, plus gourmand en échantillons.
Le travail s'inscrit dans une lignée de recherches sur la simulation différentiable appliquée à la robotique, où la gestion du contact rigide reste un verrou technique majeur depuis plusieurs années. Les auteurs ne précisent pas d'affiliation industrielle ni de partenariat de déploiement commercial : il s'agit d'un résultat de recherche démontré sur une seule plateforme (Unitree G1), avec transfert zero-shot en environnement contrôlé plutôt qu'un déploiement en production. Aucun calendrier de suite n'est communiqué au-delà de la publication des vidéos et du code supplémentaire sur le site dédié du projet ; il reste à voir si la méthode sera reprise par d'autres laboratoires ou intégrée dans des pipelines d'entraînement à plus grande échelle pour des humanoïdes commerciaux comme Figure 03 ou Optimus.
Dans nos dossiers




