Aller au contenu principal
VIDP : politique de diffusion à impédance variable pour une manipulation robotique compliante à partir de démonstrations variées
RecherchearXiv cs.RO 

VIDP : politique de diffusion à impédance variable pour une manipulation robotique compliante à partir de démonstrations variées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VIDP (Variable Impedance Diffusion Policy), un cadre d'apprentissage par imitation qui permet à un robot manipulateur d'ajuster automatiquement sa raideur mécanique pendant une tâche en contact avec son environnement, sans capteur de force. Détaillée dans un article publié sur arXiv (2608.06210), la méthode s'appuie sur un modèle appelé TP-DAMM (Task-Parameterized Directionality-Aware Mixture Model) pour extraire, à partir de démonstrations humaines variées, des distributions de trajectoires physiquement cohérentes, puis les convertir en profils de raideur. VIDP prédit ainsi conjointement la trajectoire du robot et le niveau de compliance requis à chaque instant. Lors d'expériences réelles, il dépasse les contrôleurs à impédance fixe en taux de réussite, tout en réduisant les forces d'interaction par rapport aux contrôleurs à forte raideur et les erreurs de suivi par rapport aux contrôleurs à faible raideur.

L'enjeu dépasse la seule prouesse académique. Le contrôle en impédance variable est considéré comme indispensable pour les tâches de manipulation en contact étroit, comme l'insertion de pièces, l'assemblage ou le polissage, où une raideur fixe échoue dès que les contraintes de contact changent. Les méthodes précédentes, qui déduisaient la compliance à partir de la variabilité des trajectoires démontrées, confondaient souvent adaptation géométrique à une disposition spatiale différente et intention réelle de compliance du démonstrateur. En corrigeant ce biais, VIDP ouvre la voie à des robots capables d'apprendre des comportements de compliance fiables sans instrumentation de force coûteuse, un frein classique à l'adoption en usine, et sans modélisation physique complexe du contact.

Le travail s'inscrit dans la lignée des politiques de diffusion appliquées à la robotique, devenues ces dernières années une alternative privilégiée aux politiques de clonage comportemental pour l'apprentissage par imitation, et dans la continuité des recherches sur le contrôle en impédance variable appris à partir de démonstrations. Les auteurs comparent explicitement VIDP à des bases de référence à impédance fixe, haute et basse raideur, ce qui situe la contribution par rapport à l'état de l'art plutôt qu'à un produit commercial. L'article, publié sous forme de preprint, ne précise ni calendrier de transfert vers une plateforme industrielle ni partenaire de déploiement : il s'agit à ce stade d'une contribution de recherche académique, dont la prochaine étape logique serait une validation sur des tâches d'assemblage industrielles plus complexes.

À lire aussi

SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations
1arXiv cs.RO 

SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations

Des chercheurs ont présenté SID (Sliding into Distribution), un cadre structuré pour la manipulation robotique capable de généraliser à partir de seulement deux démonstrations humaines. Évalué sur six tâches réelles variées (saisies, manipulations d'objets), SID atteint environ 90 % de taux de succès dans des configurations hors-distribution (OOD), c'est-à-dire avec des poses d'objets, des points de vue ou des conditions d'éclairage non vus lors de l'entraînement. La dégradation reste inférieure à 10 % en présence de distracteurs visuels ou de perturbations physiques externes. Le système s'appuie sur deux composants clés : un champ de mouvement centré sur l'objet, appris depuis des démonstrations "canonicalisées" (normalisées en pose), et une politique d'exécution égocentrique légère entraînée par flow matching conditionné, complétée par une augmentation de données par reprojection de nuage de points cinématiquement cohérente. L'intérêt de SID tient à sa frugalité en données : là où les politiques visuomotrices end-to-end standard (type ACT, Diffusion Policy) réclament des dizaines à centaines de démonstrations, SID opère à deux. C'est un signal fort pour les intégrateurs industriels qui peinent à collecter des données en volume sur cellule réelle. Le mécanisme de correction distributional est particulièrement notable : le champ de mouvement génère de larges corrections quand le robot s'écarte de la trajectoire démontrée, puis s'annule naturellement à l'approche de la zone fiable, avant de passer la main à la politique locale. Ce découplage explicite entre récupération hors-distribution et exécution fine constitue une alternative architecturale aux approches purement régressives. Les résultats suggèrent que le "sim-to-real gap" n'est pas le seul problème à résoudre : gérer le glissement distributional en ligne, sans recollecte de données, est un levier sous-exploité. Cette publication s'inscrit dans une vague de travaux sur la manipulation à faible donnée qui cherchent à dépasser les limites des transformeurs d'actions (ACT, π0 de Physical Intelligence, GR00T N2 de NVIDIA) en introduisant des structures géométriques explicites plutôt que de tout apprendre de bout en bout. Le flow matching, popularisé ces deux dernières années comme alternative plus stable à la diffusion pour la génération de trajectoires, est ici combiné à une représentation canonique de l'objet, une approche qui rappelle les travaux sur les réseaux de catégorie neurale (NCF) ou les politiques basées sur des keypoints. Le papier ne mentionne pas de partenaires industriels ni de timeline de déploiement, et reste pour l'instant au stade de preuve de concept académique sur banc réel. Les prochaines étapes naturelles seraient une extension à des objets déformables et une validation sur des bras commerciaux (Franka, xArm) dans des environnements moins contrôlés que le labo.

RecherchePaper
1 source
L-SDPPO : optimisation de politique par diffusion à impulsions pour la manipulation robotique en véhicule
2arXiv cs.RO 

L-SDPPO : optimisation de politique par diffusion à impulsions pour la manipulation robotique en véhicule

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.06049) un framework baptisé L-SDPPO, conçu pour la manipulation robotique à bord des engins spatiaux. L'objectif : permettre à des bras robotiques opérant à l'intérieur de vaisseaux habités de réaliser des tâches précises, comme l'ouverture de trappes ou le bouchage de contenants, dans des conditions de micropesanteur. Le système combine une politique de diffusion à spics neuronaux (Spiking Diffusion Policy, SDP) avec un algorithme d'apprentissage par renforcement de type PPO. À cela s'ajoute un mécanisme original, le SDLI (state-dependent latency injection), qui module dynamiquement le timing des signaux d'entrée en imitant les délais biologiques des neurones. Les auteurs rapportent des taux de succès supérieurs à l'état de l'art sur cinq tâches représentatives, avec une consommation énergétique réduite par rapport aux architectures classiques. Le défi adressé est réel : dans un environnement sans gravité, les objets dérivent librement et de manière imprévisible, rendant les distributions d'actions multimodales difficiles à modéliser. Les politiques de diffusion classiques (Diffusion Policy, DP) gèrent bien cette complexité, mais leur processus d'échantillonnage itératif est coûteux en énergie, ce qui pose problème dans des systèmes embarqués aux budgets énergétiques serrés. Le recours aux réseaux de neurones à impulsions (spiking neural networks), naturellement plus frugaux, combiné à l'optimisation par RL, constitue une réponse architecturale cohérente. Si les résultats présentés sont prometteurs, les benchmarks utilisés restent des simulations de tâches intravéhiculaires, et aucune validation en conditions orbitales réelles n'est rapportée à ce stade. Ce travail s'inscrit dans un effort plus large pour doter les stations spatiales et vaisseaux habités de robots capables d'assister ou de remplacer les astronautes lors de tâches répétitives ou risquées, une priorité affichée par la NASA et l'ESA. Côté concurrence académique, des travaux antérieurs ont exploré les politiques de diffusion en robotique terrestre (Pi-0 de Physical Intelligence, par exemple), mais leur adaptation aux contraintes orbitales reste largement ouverte. La prochaine étape naturelle serait une validation sur hardware embarqué, voire un test en environnement parabolique ou en orbite basse, un saut qui conditionne l'adoption réelle de ce type de système.

UEL'ESA figure parmi les organisations dont la feuille de route en robotique spatiale est directement concernée par ce type de travaux, mais l'absence de validation hors simulation limite l'impact concret à court terme.

RecherchePaper
1 source
LieSpline-DP : politique de diffusion B-spline sur groupe de Lie pour une manipulation robotique fluide
3arXiv cs.RO 

LieSpline-DP : politique de diffusion B-spline sur groupe de Lie pour une manipulation robotique fluide

Une équipe de recherche décrit, dans un article publié sur arXiv (2609.15162v1), LieSpline-DP, une méthode qui corrige un défaut connu des Diffusion Policies (DP), une approche clé de l'apprentissage par démonstration en manipulation robotique : la production de trajectoires saccadées. Les variantes à base de splines lissent le mouvement à l'intérieur d'un segment d'action, mais sans garantir la continuité entre segments ni respecter la géométrie du groupe SE(3), l'espace des poses 3D de l'effecteur. LieSpline-DP génère les trajectoires directement sur SE(3) via des B-splines de Lie, en partageant les poses de contrôle entre segments consécutifs pour assurer une continuité C² sur toute la trajectoire. Sur trois tâches réelles, elle réduit le jerk des mouvements et fait bondir le taux de réussite : 100% pour verser un liquide et pour accrocher un seau, contre seulement 10% et 30% pour la Diffusion Policy de référence. Pour les équipes de recherche et les intégrateurs en manipulation robotique, ce résultat cible un point de friction connu des politiques génératives par diffusion, désormais utilisées jusque dans des piles vision-language-action (VLA) : des mouvements saccadés qui posent problème dès qu'une tâche exige un contact fin ou une dynamique continue, comme verser un liquide ou manipuler un objet souple. L'écart mesuré, 100% contre 10 à 30% de réussite, montre que cette discontinuité peut faire échouer une tâche entière plutôt que d'être un simple défaut esthétique. En ancrant la génération de trajectoire dans la géométrie propre de SE(3), plutôt qu'en traitant position et orientation comme de simples vecteurs, l'approche illustre une tendance plus large : injecter des priors géométriques explicites dans les modèles génératifs plutôt que de compter uniquement sur davantage de données de démonstration. Les Diffusion Policies se sont imposées ces dernières années comme alternative au clonage comportemental classique en manipulation robotique, en modélisant la distribution des actions futures par un processus de débruitage, une approche depuis reprise dans des modèles génératifs de type VLA. Des méthodes à base de splines avaient déjà tenté de lisser les segments d'action de ces politiques, sans résoudre la discontinuité aux jonctions ni la géométrie non euclidienne des poses. LieSpline-DP se présente comme un complément à ces politiques plutôt qu'un remplacement complet ; ses résultats restent pour l'instant limités à trois tâches réelles en laboratoire, leur extension à des tâches plus variées, d'autres bras robotiques ou des piles VLA plus larges restant à démontrer dans de futurs travaux.

RecherchePaper
1 source
ManiCM : politique de diffusion 3D en temps réel via un modèle de cohérence pour la manipulation robotique
4arXiv cs.RO 

ManiCM : politique de diffusion 3D en temps réel via un modèle de cohérence pour la manipulation robotique

Des chercheurs ont mis en ligne une version actualisée (v4) de leur article ManiCM sur arXiv (2406.01586), présentant un modèle capable de générer des actions robotiques par diffusion en une seule étape d'inférence, contre plusieurs dizaines habituellement nécessaires. Le système applique une contrainte de cohérence (consistency model) au processus de diffusion dans l'espace des actions, conditionné par un nuage de points représentant la scène en 3D. Plutôt que de prédire le bruit à chaque étape de débruitage comme le font les modèles de diffusion classiques, une technique de distillation de cohérence entraîne le modèle à prédire directement l'échantillon d'action final depuis n'importe quel point de la trajectoire ODE. Évalué sur 31 tâches de manipulation issues des bancs d'essai Adroit et Metaworld, ManiCM affiche une vitesse d'inférence moyenne dix fois supérieure aux méthodes de diffusion 3D de référence, tout en conservant un taux de réussite comparable. Cette accélération répond à un frein connu des politiques de diffusion en robotique : leur puissance pour modéliser des distributions d'actions complexes se paie par des dizaines d'étapes de débruitage séquentielles, incompatibles avec un contrôle temps réel, surtout avec des observations 3D haute dimension comme les nuages de points. En ramenant l'inférence à une seule étape sans sacrifier significativement le taux de succès, ManiCM s'attaque à un vrai goulot d'étranglement pour tout intégrateur voulant faire tourner ces modèles sur du matériel embarqué à fréquence de contrôle élevée, plutôt que dans des démonstrations hors ligne. Les gains restent toutefois mesurés en simulation, sur des bancs d'essai standards mais artificiels, et non sur des bras ou mains robotiques physiques : l'écart classique entre performance simulée et robustesse en conditions réelles reste à vérifier. La méthode s'inscrit dans la lignée des politiques de diffusion 3D (3D Diffusion Policy, DP3) qui se sont imposées pour la manipulation dextre depuis 2023-2024, en reprenant les modèles de cohérence initialement conçus pour accélérer la génération d'images dans la communauté vision par ordinateur, ici adaptés à l'espace d'action de dimension bien plus faible pour une convergence rapide. Il s'agit d'une publication de recherche académique, sans annonce d'intégration commerciale ni de partenaire industriel à ce stade. Les suites attendues pour ce type de travaux sont généralement une validation sur robot physique et une comparaison face à d'autres approches génératives rapides, VLA ou politiques distillées, qui visent le même compromis entre expressivité et latence de contrôle.

RecherchePaper
1 source