Aller au contenu principal
RecherchearXiv cs.RO 

ContactDP : politique de diffusion guidée par le contact pour les tâches d'insertion de précision

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ContactDP (Contact-Guided Diffusion Policy), une politique de diffusion conçue pour l'insertion de connecteurs à tolérances serrées, dans un preprint publié sur arXiv (2609.23800v1). Le système fusionne trois flux de perception en temps réel : une caméra RGB montée au poignet pour l'alignement global, des capteurs tactiles au bout des doigts et des mesures de force-couple au poignet, afin d'inférer l'état de contact et de générer des corrections de trajectoire temporellement cohérentes pendant l'insertion. Cette politique apprise pilote un contrôleur hybride position-force en boucle basse, qui assure une interaction compliante lors du contact physique avec le connecteur. Les auteurs l'ont testée sur une série de tâches d'insertion de connecteurs de qualité industrielle, en faisant varier la géométrie des pièces, les conditions de préhension et le désalignement initial de la pince. Le résultat annoncé est un gain net de performance, de fiabilité et de capacité de généralisation par rapport aux politiques de diffusion qui ne s'appuient que sur la vision.

Cette approche s'attaque à un point de friction classique de la manipulation fine en robotique : dès que la pince entre en contact avec la pièce, l'occlusion visuelle et l'ambiguïté du contact rendent l'image seule insuffisante pour corriger la trajectoire, ce qui explique une partie de l'écart persistant entre les démonstrations en laboratoire et la fiabilité requise en ligne d'assemblage. En montrant qu'ajouter du tactile et de la force-couple à une politique de diffusion améliore nettement la robustesse sur des connecteurs aux géométries variées, les auteurs apportent un argument concret pour les intégrateurs qui cherchent à automatiser des tâches d'assemblage électronique ou de câblage, un segment où les robots à apprentissage visuel seul échouent encore souvent en production.

Le travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, une famille de méthodes popularisée ces dernières années comme alternative aux politiques de clonage comportemental classiques, et vise spécifiquement le sous-problème de l'insertion contact-rich plutôt que la manipulation générale à la manière des modèles VLA de type Pi-0 ou GR00T. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier de transfert vers un produit industriel : il s'agit à ce stade d'un résultat de recherche évalué en conditions contrôlées, sans déploiement commercial annoncé.

À lire aussi

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
1arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style
2arXiv cs.RO 

Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style

Des chercheurs ont publié sur arXiv (preprint 2503.16368, mis à jour en mai 2026) un framework baptisé Style-Conditioned Diffusion Policy (SCDP), conçu pour résoudre un compromis fondamental en collaboration humain-robot : la lisibilité des mouvements face à leur efficacité temporelle et énergétique. Le système s'appuie sur une politique de diffusion pré-entraînée qu'il enrichit via un pipeline post-entraînement léger, ajoutant un encodeur de scène et un prédicteur de conditionnement sans modifier les poids du modèle de base. À l'inférence, un module de détection d'ambiguïté détermine automatiquement si l'objectif du robot est déjà évident pour un observateur humain ; si oui, la trajectoire optimale est maintenue ; sinon, le système bascule vers des mouvements plus expressifs et intentionnels. Les évaluations portent sur des tâches de manipulation et de navigation. Ce travail adresse un point de friction concret dans le déploiement industriel des bras collaboratifs et des robots mobiles : un robot trop optimal génère des trajectoires difficiles à anticiper pour un opérateur humain, augmentant le risque d'accident et la charge cognitive. À l'inverse, rendre tous les mouvements expressifs coûte du temps de cycle et de l'énergie, ressources critiques en production. SCDP propose un arbitrage automatique et contextuel, ce qui le distingue des approches à style fixe. Le fait que le framework ne nécessite pas de réentraîner la politique de base est l'argument technique le plus fort : cela ouvre la voie à une adaptation post-déploiement sur des modèles existants, un avantage réel pour les intégrateurs qui ne peuvent pas se permettre des cycles de réentraînement complets. Les Diffusion Policies se sont imposées depuis 2023 comme architecture de référence pour l'imitation de comportements complexes, notamment via les travaux de Chi et al. (Columbia/MIT) et leur intégration dans des systèmes comme pi0 de Physical Intelligence. SCDP s'inscrit dans une vague de recherches visant à rendre ces politiques modulables sans réentraînement, une direction également explorée par des approches de guidance conditionnel et d'adaptateurs de type LoRA appliqués à la robotique. Côté lisibilité robot, les travaux sur la motion legibility remontent aux équipes de Dragan et Srinivasa (Carnegie Mellon, 2013), mais leur intégration dans des politiques génératives modernes reste peu exploitée. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; il s'agit d'une contribution académique dont la robustesse hors conditions contrôlées reste à démontrer.

RecherchePaper
1 source
Découverte guidée de nouveaux comportements par politiques de diffusion
3arXiv cs.RO 

Découverte guidée de nouveaux comportements par politiques de diffusion

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.08743v1, juin 2026) un cadre algorithmique pour diversifier les comportements générés par les diffusion policies en robotique. Ces politiques basées sur des modèles de diffusion modélisent efficacement des distributions multimodales de trajectoires d'action, mais souffrent d'un biais documenté : avec peu de démonstrations, l'échantillonnage standard reproduit les comportements dominants et ignore les modes rares mais valides. Les auteurs combinent des correcteurs de Feynman-Kac, outil issu des processus stochastiques, avec un potentiel de guidage orientant l'échantillonnage vers des trajectoires prometteuses mais sous-représentées. Ces trajectoires candidates sont ensuite affinées par optimisation par échantillonnage, puis réintégrées dans le jeu d'entraînement pour réentraîner la politique. Les expériences portent sur plusieurs environnements de manipulation en simulation, où la méthode découvre systématiquement de nouveaux comportements exécutables. L'enjeu est concret pour les équipes travaillant sur l'apprentissage par imitation en robotique industrielle ou de service. Un robot entraîné sur peu de données converge vers une seule stratégie même lorsque plusieurs solutions existent : ce cadre propose d'explorer l'espace des comportements sans collecter davantage de démonstrations humaines, ce qui touche directement à l'efficacité des données dans les pipelines de robot learning. Les auteurs positionnent leur approche contre les méthodes de guidage classiques, qui poussent les échantillons vers des régions infaisables, et contre le couplage RL+diffusion, qui peine à sortir des minima locaux. Les résultats restent cependant limités à la simulation de manipulation; aucune validation sur robot réel n'est rapportée dans ce préprint. Les diffusion policies ont connu une adoption rapide depuis les travaux de Chi et al. en 2023, supplantant progressivement les politiques comportementales classiques sur des tâches de manipulation complexes. Le domaine est aujourd'hui concurrentiel, avec Physical Intelligence (pi0), Google DeepMind et plusieurs laboratoires universitaires poussant les limites de ces modèles génératifs. L'approche Feynman-Kac s'inscrit dans une tendance plus large de réutilisation d'outils de la physique statistique pour le contrôle robotique. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension à des tâches à horizon long, où la diversité des trajectoires est encore plus critique.

UELes laboratoires européens travaillant sur l'apprentissage par imitation (INRIA, CEA-List) pourraient exploiter ce cadre pour réduire leur dépendance aux données de démonstration, mais aucun acteur ou déploiement européen n'est impliqué dans ce préprint.

RecherchePaper
1 source
RodForesight : politique de diffusion enrichie par un modèle du monde pour l'insertion de tiges fines, tous matériaux
4arXiv cs.RO 

RodForesight : politique de diffusion enrichie par un modèle du monde pour l'insertion de tiges fines, tous matériaux

Publiée le 12 septembre 2026 sur arXiv (2609.12103), une étude présente RodForesight, une méthode d'apprentissage pour insérer des tiges fines et flexibles en fabrication de précision, où le diamètre se compte en millimètres et les jeux sont très serrés. Contrairement aux méthodes peg-in-hole classiques, qui supposent un objet rigide dont la pointe reste fixe par rapport à la pince, une tige à fort rapport d'aspect fléchit pendant la manipulation, rendant sa trajectoire dépendante de la configuration, de la prise, du matériau et des contacts. RodForesight sépare une approche grossière par asservissement visuel et une insertion prédictive, où une politique de diffusion génère des segments d'action qu'un modèle du monde évalue à l'avance en prédisant l'erreur d'inclinaison et l'erreur radiale, avant de sélectionner le meilleur. Ce mécanisme fait passer le taux de réussite de 88,9% avec une politique de diffusion classique à 96,7% avec RodForesight. Ce résultat cible un angle mort classique de la robotique industrielle: la plupart des systèmes d'insertion automatisés supposent des pièces rigides, ce qui exclut tiges longues, câbles semi-rigides ou aiguilles utilisés en assemblage électronique, médical ou aéronautique, où la flexion du matériau échappe à un contrôle purement réactif. En couplant une politique de diffusion à un modèle du monde qui simule l'effet d'une action avant son exécution, RodForesight illustre une tendance de fond de l'apprentissage robotique: évaluer les actions candidates avant de les exécuter plutôt que les corriger après coup, sans capteur de force ni modèle physique explicite du matériau. Pour les intégrateurs, le gain de 88,9% à 96,7% reste un résultat de laboratoire, obtenu sur des expériences contrôlées, non une validation en production réelle. Le peg-in-hole reste un problème classique de la manipulation robotique, mais les travaux récents se tournent vers les objets déformables, alors que les politiques de diffusion et les modèles du monde gagnent du terrain face aux architectures VLA plus lourdes de systèmes comme Pi-0 ou GR00T N2. RodForesight demeure une contribution académique publiée sur arXiv, non un produit commercial ni un système déployé en usine. Les auteurs valident séparément l'approche grossière, l'insertion prédictive et le pipeline complet, sans annoncer de calendrier de transfert industriel ni de partenaire intégrateur.

RecherchePaper
1 source