Aller au contenu principal
RecherchearXiv cs.RO 

DRHeC : rendu différentiable pour l'étalonnage main-œil à partir de gradients RGB

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent DRHeC, un cadre de calibration œil-main (hand-eye calibration) fondé sur le rendu différentiable, qui exploite cette fois l'image RGB complète plutôt que de simples masques binaires. La calibration œil-main consiste à déterminer la transformation géométrique entre une caméra et la base ou l'effecteur d'un bras robotique, condition indispensable à toute manipulation de précision. L'équipe valide l'approche en simulation et sur un bras UR5e réel. Sur des tâches physiques, elle obtient un taux de réussite de préhension de 88,9 % et un taux de réussite d'insertion de 57,4 %. Ces résultats dépassent de 46,3 et 48,1 points de pourcentage ceux d'EasyHeC, la méthode de rendu différentiable qui fait aujourd'hui référence. Les auteurs ajoutent une méthode de traduction image-à-image guidée par masque, censée préserver explicitement la cohérence des couleurs et de la géométrie pendant la conversion entre images rendues et images réelles.

L'enjeu est très concret pour les intégrateurs. Les méthodes classiques reposent sur des marqueurs dont la précision et la visibilité limitent celle de la calibration, et elles imposent une intervention humaine à chaque recalibrage. Les approches par apprentissage profond se passent de marqueurs et estiment la transformation depuis une seule image, mais leur fonctionnement reste opaque. Le rendu différentiable comble en partie ce manque : il s'appuie sur un modèle physique du robot et offre une optimisation interprétable, sans mire de calibration. Les masques binaires écrasent toutefois les détails de profil interne du robot et conduisent à des optimisations instables ou piégées dans des minima locaux. L'écart de 48 points sur l'insertion, tâche la plus exigeante en précision, suggère qu'une part importante des erreurs de manipulation venait de la calibration elle-même. Une réserve s'impose : ces chiffres proviennent d'un seul type de robot et d'un protocole défini par les auteurs. Même avec la méthode proposée, l'insertion ne réussit qu'un peu plus d'une fois sur deux, ce qui reste loin d'un niveau industriel.

Ce travail s'inscrit dans une évolution en trois temps. Les marqueurs ont d'abord dominé, puis sont venues les méthodes de keypoints et de features apprises. Les méthodes par rendu différentiable, dont EasyHeC est l'exemple le plus abouti, sont apparues plus récemment. DRHeC prolonge cette dernière lignée en enrichissant le signal de comparaison avec la couleur et des caractéristiques géométriques issues des masques. L'article, publié sur arXiv (2609.36779v1), est une prépublication qui n'a pas encore été évaluée par des pairs. Aucun code, calendrier de déploiement ni partenaire industriel n'est mentionné dans le résumé. La suite dépendra de la généralisation à d'autres bras, à d'autres caméras et à des scènes moins contrôlées, et de la robustesse face aux occlusions et aux variations d'éclairage.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Estimation d'état de maillage différentiable par inférence sur graphe de facteurs pour la reconstruction d'objets déformables
1arXiv cs.RO 

Estimation d'état de maillage différentiable par inférence sur graphe de facteurs pour la reconstruction d'objets déformables

Une équipe de recherche propose, dans un article publié le 16 septembre 2026 sur arXiv (2609.16686v1), un nouveau cadre probabiliste pour estimer l'état de maillages déformables en robotique et en simulation. La méthode s'appuie sur des graphes de facteurs (factor graphs) pour mettre à jour directement un maillage tétraédrique, représentation dense et physiquement cohérente d'un objet ou d'un environnement, en combinant trois sources d'information dans une formulation probabiliste unifiée : des a priori physiques, des mesures de capteurs bruitées, et des contraintes de lissage temporel. Le problème d'estimation est posé comme une optimisation par moindres carrés non linéaires, résolue via l'algorithme de Levenberg-Marquardt. Les auteurs valident l'approche sur deux terrains distincts : des expériences ex vivo d'obstruction des voies aériennes centrales, et des simulations de cubes en déformation, démontrant une reconstruction fiable aussi bien en mouvement rigide qu'en déformation. Cette contribution s'adresse à un problème récurrent en robotique de manipulation et en robotique médicale : les objets déformables (tissus mous, câbles, textiles, organes) restent difficiles à modéliser en temps réel avec des méthodes purement géométriques ou purement basées capteurs. En ancrant l'estimation dans une représentation physique explicite plutôt que dans un modèle appris de bout en bout, l'approche vise une meilleure généralisation et une interprétabilité utile pour des applications critiques comme la chirurgie assistée ou la planification d'intervention, où la traçabilité des estimations compte autant que leur précision. Elle illustre aussi une tendance de fond en robotique de manipulation : hybrider physique et inférence probabiliste plutôt que de tout confier à des réseaux de neurones appris sur de larges corpus. Le travail s'inscrit dans la lignée des recherches sur le SLAM déformable et la reconstruction de scènes dynamiques, domaines où les représentations neuronales (NeRF, Gaussian splatting) ont récemment dominé. Les auteurs positionnent leur méthode comme une alternative structurée à ces approches, mieux adaptée aux contraintes physiques. Les tests restent limités à un cadre ex vivo et à des simulations, sans validation in vivo ni intégration robotique complète annoncée à ce stade, ce qui situe la publication du côté de la recherche méthodologique plutôt que d'un système prêt au déploiement.

RecherchePaper
1 source
Gradients de contact groupés : stabiliser la simulation différentiable pour des tâches dynamiques déployables
2arXiv cs.RO 

Gradients de contact groupés : stabiliser la simulation différentiable pour des tâches dynamiques déployables

Des chercheurs présentent Bundled Contact Gradients (BCG), une méthode qui stabilise l'apprentissage de politiques par simulation différentiable pour des tâches dynamiques transférées à des humanoïdes réels. Le papier, publié sur arXiv (2609.30951v1) le 28 septembre 2026, s'attaque à un problème connu de la simulation différentiable : pour obtenir des gradients exploitables à travers les contacts rigides, il faut habituellement assouplir les modèles de contact, ce qui dégrade la fidélité physique et limite les politiques apprises à la simulation. Augmenter la raideur du contact améliore le réalisme mais rend la dynamique très sensible aux petites perturbations d'état, produisant des gradients à haute variance qui déstabilisent l'optimisation du premier ordre. BCG répond à ce problème par un lissage aléatoire localisé au contact : quand un contact rigide est détecté, la méthode évalue un ensemble de rollouts perturbés autour de cette configuration et agrège leurs signaux de gradient pour réduire la variance. Les auteurs rapportent un entraînement et un transfert zero-shot réussis de mouvements dynamiques sur une plateforme humanoïde réelle Unitree G1, avec vidéos disponibles sur le site du projet. L'enjeu dépasse la seule prouesse académique : le fossé sim-to-real reste l'un des principaux freins à la commercialisation des humanoïdes, en particulier pour les mouvements dynamiques (sauts, contacts pied-sol impulsifs, manipulation en force) où les modèles de contact assouplis échouent typiquement à se transférer au réel. Une méthode qui permet d'augmenter la raideur des contacts en simulation sans faire exploser la variance des gradients touche directement à la crédibilité des pipelines d'apprentissage par renforcement ou par optimisation différentiable utilisés par les fournisseurs de plateformes humanoïdes (Unitree, mais aussi les architectures VLA comme GR00T N2, Pi-0 ou Helix qui s'appuient sur des politiques apprises). Pour les intégrateurs et laboratoires de recherche, cela suggère une voie pour entraîner des comportements dynamiques plus riches sans dépendre uniquement du reinforcement learning classique, plus gourmand en échantillons. Le travail s'inscrit dans une lignée de recherches sur la simulation différentiable appliquée à la robotique, où la gestion du contact rigide reste un verrou technique majeur depuis plusieurs années. Les auteurs ne précisent pas d'affiliation industrielle ni de partenariat de déploiement commercial : il s'agit d'un résultat de recherche démontré sur une seule plateforme (Unitree G1), avec transfert zero-shot en environnement contrôlé plutôt qu'un déploiement en production. Aucun calendrier de suite n'est communiqué au-delà de la publication des vidéos et du code supplémentaire sur le site dédié du projet ; il reste à voir si la méthode sera reprise par d'autres laboratoires ou intégrée dans des pipelines d'entraînement à plus grande échelle pour des humanoïdes commerciaux comme Figure 03 ou Optimus.

RecherchePaper
1 source
Apprentissage de politiques robotiques à partir de signaux de succès épars via le gradient de politique de Stein guidé par STL
3arXiv cs.RO 

Apprentissage de politiques robotiques à partir de signaux de succès épars via le gradient de politique de Stein guidé par STL

Des chercheurs présentent STL-SVPG (Signal Temporal Logic-guided Stein Variational Policy Gradient), une méthode d'apprentissage de politiques robotiques pour des taches ou le signal de succès est rare, décrite dans un preprint mis en ligne sur arXiv en septembre 2026 (référence 2609.31606). La méthode combine la logique temporelle de signal (Signal Temporal Logic, STL) avec un algorithme d'optimisation de politique base sur une population, le Stein Variational Policy Gradient. Plutot que d'utiliser des récompenses locales façonnées, qui peuvent progresser sans jamais aboutir a la complétion réelle de la tache, STL-SVPG calcule une mesure de robustesse STL différentiable sur la trajectoire complète, ce qui permet d'attribuer le mérite aux actions selon leur contribution a la spécification globale plutôt qu'au seul progrès local. La méthode est évaluée sur six taches impliquant un quadricoptere et un bras manipulateur: réponses déclenchées par événements, comportements strictement ordonnes, respect de délais, et interactions physiques de contact. STL-SVPG obtient le meilleur taux de succès moyen sur cinq des six bancs d'essai compares, et les politiques entraînées en simulation transfèrent leur comportement temporel et de contact vers le monde réel, sans que l'article ne precise le nombre d'essais physiques réalisés. Pour l'industrie robotique, ce travail cible un problème très concret: de nombreuses taches manufacturières ou logistiques (assemblage séquentiel, manipulation sous contrainte de temps, réaction a des événements extérieurs) ne se réduisent pas a un objectif unique mais a une combinaison de contraintes temporelles et logiques, exactement ce que la STL est censée capturer. Le reward shaping classique, très utilise en apprentissage par renforcement applique a la robotique, produit souvent des politiques qui optimisent des récompenses intermédiaires sans accomplir la tache complète, un écart connu entre démonstration et fiabilité en production. En améliorant le taux de succès sur des taches composées a contraintes multiples, l'étude plaide pour des spécifications formelles plutôt que des récompenses ad hoc, un argument utile pour les intégrateurs qui cherchent a fiabiliser des politiques de RL avant tout déploiement en manipulation fine ou en pilotage de drones en environnement contraint. Cette approche s'inscrit dans une ligne de recherche déjà établie sur l'usage de logiques temporelles (STL, logique temporelle linéaire) comme alternative au reward shaping face aux limites de ce dernier sur les taches a succès rares. STL-SVPG s'en distingue en associant la robustesse STL a une optimisation par population de politiques, censé améliorer l'exploration sur des objectifs multi-contraintes. Le résume disponible ne mentionne aucun partenariat industriel, aucune entreprise ni laboratoire spécifique, et aucun calendrier de suite: il s'agit d'un travail académique valide sur bancs d'essai simules, avec une démonstration de transfert réel encore limitée, dont l'adoption industrielle dépendra de la publication complète des résultats et, le cas échéant, du code.

RecherchePaper
1 source
DiffPhysCam : simulation physique différentiable de caméra pour le rendu inverse et l'IA incarnée
4arXiv cs.RO 

DiffPhysCam : simulation physique différentiable de caméra pour le rendu inverse et l'IA incarnée

Des chercheurs présentent DiffPhysCam, un simulateur de caméra différentiable conçu pour la robotique et l'IA incarnée, décrit dans une version mise à jour d'un article arXiv (2508.08831v2, signé Bo-Hsun Chen). L'outil permet d'optimiser par descente de gradient des pipelines de perception visuelle, une approche impossible avec les moteurs de rendu virtuels classiques. Son pipeline multi-étapes offre un contrôle fin sur les paramètres intrinsèques de la caméra, modélise des artefacts optiques comme le flou de défocalisation, et se calibre à partir de données réelles. DiffPhysCam fonctionne dans les deux sens : rendu direct pour générer des images synthétiques, et rendu inverse pour reconstruire des scènes 3D, y compris l'optimisation des maillages et des textures de matériaux. Les auteurs illustrent la méthode en créant un jumeau numérique d'une scène réelle par rendu inverse, puis en l'intégrant dans un simulateur multiphysique où un véhicule terrestre autonome navigue à partir d'images générées par l'outil. Le code, les données et les résultats sont publiés en ligne pour reproductibilité. L'intérêt pour l'industrie robotique tient au problème récurrent du fossé simulation-réel : les caméras virtuelles génériques produisent des images trop propres, sans les défauts optiques (flou, distorsions, réponse capteur) qui caractérisent les flux réels, ce qui dégrade les performances des modèles entraînés en simulation une fois déployés sur du matériel physique. En rendant la simulation de caméra différentiable et calibrable sur des données réelles, DiffPhysCam vise à réduire cet écart pour l'apprentissage visuomoteur de bout en bout, une brique utile pour qui entraîne des politiques de navigation ou de manipulation en environnement simulé avant transfert vers un robot réel. Le travail s'inscrit dans une lignée de recherche sur les jumeaux numériques et le rendu différentiable appliqué à la robotique, où les simulateurs existants pâtissent d'un contrôle limité sur les réglages de caméra et d'une modélisation optique sommaire. En combinant reconstruction de scène et simulation multiphysique, DiffPhysCam se positionne comme un outil de recherche plutôt qu'un produit commercial ; sa validation reste pour l'instant limitée à un exemple de navigation d'AMR, sans indication de déploiement à plus grande échelle.

RecherchePaper
1 source