Aller au contenu principal
RecherchearXiv cs.RO 

Gradients de contact groupés : stabiliser la simulation différentiable pour des tâches dynamiques déployables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Bundled Contact Gradients (BCG), une méthode qui stabilise l'apprentissage de politiques par simulation différentiable pour des tâches dynamiques transférées à des humanoïdes réels. Le papier, publié sur arXiv (2609.30951v1) le 28 septembre 2026, s'attaque à un problème connu de la simulation différentiable : pour obtenir des gradients exploitables à travers les contacts rigides, il faut habituellement assouplir les modèles de contact, ce qui dégrade la fidélité physique et limite les politiques apprises à la simulation. Augmenter la raideur du contact améliore le réalisme mais rend la dynamique très sensible aux petites perturbations d'état, produisant des gradients à haute variance qui déstabilisent l'optimisation du premier ordre. BCG répond à ce problème par un lissage aléatoire localisé au contact : quand un contact rigide est détecté, la méthode évalue un ensemble de rollouts perturbés autour de cette configuration et agrège leurs signaux de gradient pour réduire la variance. Les auteurs rapportent un entraînement et un transfert zero-shot réussis de mouvements dynamiques sur une plateforme humanoïde réelle Unitree G1, avec vidéos disponibles sur le site du projet.

L'enjeu dépasse la seule prouesse académique : le fossé sim-to-real reste l'un des principaux freins à la commercialisation des humanoïdes, en particulier pour les mouvements dynamiques (sauts, contacts pied-sol impulsifs, manipulation en force) où les modèles de contact assouplis échouent typiquement à se transférer au réel. Une méthode qui permet d'augmenter la raideur des contacts en simulation sans faire exploser la variance des gradients touche directement à la crédibilité des pipelines d'apprentissage par renforcement ou par optimisation différentiable utilisés par les fournisseurs de plateformes humanoïdes (Unitree, mais aussi les architectures VLA comme GR00T N2, Pi-0 ou Helix qui s'appuient sur des politiques apprises). Pour les intégrateurs et laboratoires de recherche, cela suggère une voie pour entraîner des comportements dynamiques plus riches sans dépendre uniquement du reinforcement learning classique, plus gourmand en échantillons.

Le travail s'inscrit dans une lignée de recherches sur la simulation différentiable appliquée à la robotique, où la gestion du contact rigide reste un verrou technique majeur depuis plusieurs années. Les auteurs ne précisent pas d'affiliation industrielle ni de partenariat de déploiement commercial : il s'agit d'un résultat de recherche démontré sur une seule plateforme (Unitree G1), avec transfert zero-shot en environnement contrôlé plutôt qu'un déploiement en production. Aucun calendrier de suite n'est communiqué au-delà de la publication des vidéos et du code supplémentaire sur le site dédié du projet ; il reste à voir si la méthode sera reprise par d'autres laboratoires ou intégrée dans des pipelines d'entraînement à plus grande échelle pour des humanoïdes commerciaux comme Figure 03 ou Optimus.

À lire aussi

RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM
1arXiv cs.RO 

RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM

Des chercheurs présentent RigPI (arXiv:2606.25212, juin 2026), un framework d'identification des paramètres dynamiques d'objets rigides manipulés par un bras robotique, sans connaissance préalable de leurs propriétés physiques. Le système fusionne trois sources : un modèle vision-langage (VLM) qui initialise sémantiquement les estimations à partir de l'apparence de l'objet, des capteurs force-couple pour capturer les interactions réelles, et un simulateur physique différentiable qui affine les paramètres par descente de gradient. RigPI couvre les objets libres non contraints et les corps multi-articulés à joints rotoïdes ou prismatiques. Une optimisation en deux étapes atténue la sensibilité au bruit et évite les solutions physiquement aberrantes. Des expériences en conditions réelles valident que le robot reproduit fidèlement les trajectoires de manipulation en utilisant les paramètres identifiés. L'enjeu pour l'industrie est direct : construire des jumeaux numériques fiables exige de connaître les propriétés inertielles et frictionnelles d'un objet inconnu, pas seulement sa géométrie. Les pipelines classiques d'identification de système déraillent face au bruit capteur, aux erreurs de modèle et à l'absence de prior. RigPI innove sur deux fronts : l'usage d'un VLM comme oracle physique pour contraindre l'espace de recherche avant optimisation numérique, réduisant le risque de minima locaux incohérents ; et l'exploitation de la simulation différentiable pour propager des gradients analytiques plutôt que de procéder par essais-erreurs. Pour un intégrateur ou un responsable de production, cela signifie qu'une cellule de manipulation peut s'auto-calibrer sur un nouvel objet sans intervention humaine, comprimant les délais de mise en service. Ce travail prend place dans un effort de recherche dense autour de la simulation différentiable en robotique, où des groupes de MIT, Stanford et de laboratoires comme DeepMind publient des approches parallèles. Le sim-to-real sur les paramètres physiques reste un problème ouvert : la majorité des pipelines actuels supposent des masses et frictions connues, ou les approximent grossièrement. RigPI est à ce stade un prototype académique, preprint non encore peer-reviewé, sans partenaire industriel annoncé. Les prolongements logiques incluent l'intégration avec des politiques VLA (vision-language-action) pour fermer la boucle perception-identification-contrôle, et l'extension aux matériaux déformables ou aux contacts multi-points.

RecherchePaper
1 source
Dynamique différentiable et simulation rapide d'un poisson robotique élastique continu
2arXiv cs.RO 

Dynamique différentiable et simulation rapide d'un poisson robotique élastique continu

Des chercheurs publient sur arXiv (article 2509.16145, version 3, remplaçant une version antérieure) un nouveau modèle de dynamique différentiable couplé à un cadre de simulation rapide pour poissons robotiques à corps élastique actionnés par moteur. La formulation, fondée sur le principe de Hamilton, représente le robot comme un corps élastique continûment déformable et couple sa dynamique structurelle aux forces hydrodynamiques sans imposer au préalable la cinématique du corps, c'est-à-dire sans prescrire la façon dont il doit onduler. Le simulateur obtenu est différentiable par rapport aux paramètres du modèle et de conception, ce qui permet une optimisation par descente de gradient. Les auteurs valident leur cadre par des études de convergence numérique ainsi que par des expériences menées sur un poisson robotique physique, puis démontrent son utilité en optimisant par gradient la distribution de raideur le long du corps pour améliorer l'efficacité de nage. Cette avancée cible un verrou concret de la robotique bio-inspirée sous-marine : les approches existantes imposaient soit une cinématique corporelle fixe, soit approximaient le corps par des segments rigides ou compliants discrets, soit reposaient sur des simulations d'interaction fluide-structure trop coûteuses pour être intégrées dans une boucle d'optimisation de conception. En rendant la simulation différentiable et rapide, ce travail permet de co-concevoir la répartition de raideur et le contrôle moteur sans recourir à des campagnes d'essais physiques répétées, un enjeu direct pour les concepteurs de robots souples et de véhicules sous-marins autonomes bio-inspirés. La flexibilité du corps est identifiée depuis longtemps comme un facteur clé de la propulsion des poissons : la répartition spatiale de la raideur détermine la déformation, les charges hydrodynamiques et la performance propulsive. Les méthodes antérieures peinaient à capturer simultanément cette élasticité continue, le couplage fluide-structure et le mouvement auto-propulsé résultant, sans exploser en coût de calcul. Ce travail s'inscrit dans le courant plus large de la robotique molle différentiable, où la simulation rapide et dérivable devient un outil standard pour l'optimisation automatisée de conception, à l'image des approches sim-to-real développées pour d'autres classes de robots.

RecherchePaper
1 source
Apprentissage de la dynamique de contact par le toucher : réseaux de neurones sur graphes conditionnés par l'action pour l'insertion de tiges robotique
3arXiv cs.RO 

Apprentissage de la dynamique de contact par le toucher : réseaux de neurones sur graphes conditionnés par l'action pour l'insertion de tiges robotique

Une équipe de recherche publie sur arXiv (2509.12151, version 3) un modèle physique apprenable capable de prédire le mouvement de l'effecteur terminal d'un robot ainsi que la force et le couple de réaction lors de manipulations à contact riche. L'architecture représente l'effecteur et l'environnement comme des maillages en interaction organisés en graphe, et conditionne explicitement ses prédictions sur la commande de contrôle appliquée : elle prédit directement la mise à jour de pose au niveau de l'objet, tandis que le couple de réaction émerge d'un champ de force calculé par sommet du maillage. L'entraînement est auto-supervisé, à partir des seules données des encodeurs articulaires et du capteur de force-couple, pendant que le robot touche aléatoirement son environnement sans consigne de tâche. En simulation, ce modèle se transfère à une tâche d'insertion de pièce (peg insertion) sur des géométries concaves inédites : un agent de commande prédictive (MPC) qui l'utilise atteint jusqu'à 98% de taux de réussite, et après un réglage fin sur des données auto-collectées, il égale un agent planifiant avec la dynamique de référence au jeu le plus serré testé, 1 mm. Dans le monde réel, ce modèle surpasse un modèle MuJoCo calibré par identification de système classique de 45% en précision de position, et de 74% et 63% respectivement en erreur de force et de couple. L'enjeu dépasse la démonstration académique : l'insertion de pièces à tolérances serrées reste un point de blocage classique pour l'assemblage robotique de précision, car les simulateurs physiques standards peinent à modéliser fidèlement le frottement et la déformation de contact, ce qui creuse l'écart simulation-réel et oblige les intégrateurs à des campagnes coûteuses de calibration manuelle. En montrant qu'un modèle appris à partir de simples contacts aléatoires, sans démonstration de tâche, généralise à des géométries jamais vues et rivalise avec une dynamique de référence à 1 mm de clearance, ce travail suggère une voie pour réduire la dépendance à l'identification de système traditionnelle et améliorer la robustesse hors simulation, un enjeu direct pour les intégrateurs travaillant sur l'assemblage électronique ou mécanique fin. Les résultats restent toutefois circonscrits à une tâche unique testée en conditions contrôlées, avec une comparaison réelle limitée à un seul modèle de référence, et non à un déploiement industriel à l'échelle. Cette approche s'inscrit dans un courant de recherche appliquant les réseaux de neurones sur graphes à la simulation physique à base de maillages, et l'étend ici à la dynamique de contact robot-environnement conditionnée par l'action. Elle se distingue des politiques de bout en bout de type vision-langage-action, qui apprennent un comportement directement à partir de démonstrations massives et spécifiques à la tâche, en misant plutôt sur un modèle dynamique générique et réutilisable appris de façon indépendante de la tâche. Le principal point de comparaison méthodologique reste l'identification de système classique utilisée dans des moteurs comme MuJoCo, que ce travail cherche explicitement à dépasser sur la fidélité des forces de contact. Le fait que le papier en soit à sa troisième version sur arXiv signale des itérations après relecture, sans partenariat industriel, pilote ou calendrier de déploiement mentionné à ce stade ; les suites attendues porteraient sur l'extension à d'autres tâches d'assemblage à tolérances serrées et une validation sur davantage de plateformes robotiques réelles.

RecherchePaper
1 source
ContactDP : politique de diffusion guidée par le contact pour les tâches d'insertion de précision
4arXiv cs.RO 

ContactDP : politique de diffusion guidée par le contact pour les tâches d'insertion de précision

Une équipe de recherche présente ContactDP (Contact-Guided Diffusion Policy), une politique de diffusion conçue pour l'insertion de connecteurs à tolérances serrées, dans un preprint publié sur arXiv (2609.23800v1). Le système fusionne trois flux de perception en temps réel : une caméra RGB montée au poignet pour l'alignement global, des capteurs tactiles au bout des doigts et des mesures de force-couple au poignet, afin d'inférer l'état de contact et de générer des corrections de trajectoire temporellement cohérentes pendant l'insertion. Cette politique apprise pilote un contrôleur hybride position-force en boucle basse, qui assure une interaction compliante lors du contact physique avec le connecteur. Les auteurs l'ont testée sur une série de tâches d'insertion de connecteurs de qualité industrielle, en faisant varier la géométrie des pièces, les conditions de préhension et le désalignement initial de la pince. Le résultat annoncé est un gain net de performance, de fiabilité et de capacité de généralisation par rapport aux politiques de diffusion qui ne s'appuient que sur la vision. Cette approche s'attaque à un point de friction classique de la manipulation fine en robotique : dès que la pince entre en contact avec la pièce, l'occlusion visuelle et l'ambiguïté du contact rendent l'image seule insuffisante pour corriger la trajectoire, ce qui explique une partie de l'écart persistant entre les démonstrations en laboratoire et la fiabilité requise en ligne d'assemblage. En montrant qu'ajouter du tactile et de la force-couple à une politique de diffusion améliore nettement la robustesse sur des connecteurs aux géométries variées, les auteurs apportent un argument concret pour les intégrateurs qui cherchent à automatiser des tâches d'assemblage électronique ou de câblage, un segment où les robots à apprentissage visuel seul échouent encore souvent en production. Le travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, une famille de méthodes popularisée ces dernières années comme alternative aux politiques de clonage comportemental classiques, et vise spécifiquement le sous-problème de l'insertion contact-rich plutôt que la manipulation générale à la manière des modèles VLA de type Pi-0 ou GR00T. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier de transfert vers un produit industriel : il s'agit à ce stade d'un résultat de recherche évalué en conditions contrôlées, sans déploiement commercial annoncé.

RecherchePaper
1 source