Aller au contenu principal
Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples
RecherchearXiv cs.RO 

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs décrit sur arXiv (arXiv:2509.19696, quatrième version) Diffusion-Based Impedance Learning (DIL), un framework combinant un modèle de diffusion Transformer et un contrôle d'impédance classique pour la manipulation robotique en contact riche. Conditionne par cross-attention sur les forces et couples externes mesures, le modèle reconstruit des trajectoires simulées a force nulle (sZFT), complétées par un ordonnanceur de bruit quaternion SLERP pour les rotations. Un estimateur énergétique adapte ensuite en ligne la raideur et l'amortissement du bras. Entraine sur des démonstrations de franchissement d'obstacles et de robotique thérapeutique collectées via téléopération au casque Apple Vision Pro, avec seulement quelques dizaines de milliers d'échantillons, le modèle atteint une précision sous le millimètre et sous le degré. Deploye en temps réel sur un bras KUKA LBR iiwa, il obtient 100% de réussite sur une tache d'insertion peg-in-hole multi-géométries.

La manipulation en contact riche (insertion, assemblage, interaction physique) reste un point faible des politiques robotiques purement apprises, qui peinent a garantir la sécurité lors du contact, tandis que le contrôle d'impédance classique exige un réglage manuel spécifique a chaque tache. En couplant les deux approches, ce travail vise a automatiser ce réglage tout en conservant les garanties de stabilité de l'impédance, un enjeu concret pour les intégrateurs qui déploient des bras collaboratifs sur des lignes d'assemblage ou en assistance thérapeutique. Les résultats restent toutefois ceux d'une démonstration de laboratoire, sur un seul bras et des taches contrôlées, et non d'un déploiement industriel a l'échelle.

Le contrôle d'impédance, théorisé il y a plusieurs décennies, reste la référence pour l'interaction physique sure homme-robot, tandis que les modèles de diffusion se sont imposes plus récemment comme méthode d'apprentissage de politiques robotiques, a l'image des travaux sur les diffusion policies, sans toutefois bien couvrir les taches de contact face aux approches VLA généralistes comme Pi-0 ou GR00T N2. Le recours a l'Apple Vision Pro pour la téléopération illustre une tendance croissante a collecter des démonstrations via des casques de réalité mixte plutôt que des combinaisons de capture de mouvement dédiées. Le KUKA LBR iiwa, bras collaboratif a détection de couple du fabricant allemand KUKA, sert de plateforme d'essai. Code et vidéos sont publics, sans annonce de pilote industriel a ce stade.

Impact France/UE

Le bras collaboratif utilise pour la demonstration est fabrique par l'entreprise allemande KUKA, mais aucune equipe de recherche europeenne ni pilote industriel europeen n'est mentionne.

À lire aussi

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
1arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts
2arXiv cs.RO 

VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts

Des chercheurs ont présenté VE2VF (Vision-Enabled to Vision-Free), un cadre d'apprentissage par renforcement (RL) pour la manipulation robotique en contact riche, publié en préprint sur arXiv (2605.29564). La méthode repose sur une distillation enseignant-élève conduite intégralement sur robot réel, sans simulation ni randomisation de domaine. Un module "enseignant" équipé de vision apprend d'abord la tâche, puis transfère sa politique à un "élève" n'utilisant que la pose, le twist et le wrench (position/orientation, vitesse et couple de force), sans aucun flux caméra. Sur le benchmark NIST d'assemblage, référence standardisée pour les tâches d'insertion de précision, le système atteint 95 % de taux de succès global après environ 50 minutes d'entraînement sur 3 tâches représentatives, et généralise à 8 variantes non vues lors de l'entraînement. Un fine-tuning par distillation permet d'atteindre 100 % de succès sur la variante la plus difficile. Ce résultat adresse un problème structurel en robotique industrielle: les politiques basées sur la vision surapprennent les conditions d'éclairage et de fond vues à l'entraînement, ce qui fragilise leur déploiement en environnement de production variable. En éliminant la vision à l'inférence tout en l'exploitant pendant l'apprentissage, VE2VF produit des politiques robustes aux perturbations visuelles sans coût supplémentaire en données. Plus significatif encore: atteindre cette généralisation en moins d'une heure d'entraînement réel suggère qu'on peut contourner le sim-to-real gap sans simulateur haute-fidélité ni dataset synthétique massif. Pour les intégrateurs déployant des cellules d'assemblage de précision, la combinaison rapidité d'adaptation et robustesse proprioceptive est directement actionnable. Le benchmark NIST Assembly Task Board est utilisé depuis plusieurs années comme terrain de comparaison inter-équipes en manipulation de précision, ce qui confère à ces résultats une lisibilité relative face aux travaux antérieurs. Les approches concurrentes combinent généralement simulation, randomisation de domaine et larges volumes de données synthétiques avant transfert sur robot réel. VE2VF se positionne comme une alternative ancrée dans le réel, avec une boucle human-in-the-loop permettant de superviser l'apprentissage en cours de session. Il s'agit à ce stade d'un préprint de recherche, non d'un système en production ni d'un produit commercialisé. Les suites naturelles incluent des tests sur d'autres plateformes matérielles et des tâches industrielles plus complexes, ainsi qu'une confrontation directe avec les approches de type VLA (Vision-Language-Action) qui ciblent elles aussi la généralisation en manipulation contact-riche à grande échelle.

RecherchePaper
1 source
Data et apprentissage là où ça compte pour la manipulation à contact riche
3arXiv cs.RO 

Data et apprentissage là où ça compte pour la manipulation à contact riche

Des chercheurs proposent une nouvelle méthode de collecte de données pour l'apprentissage de tâches de manipulation robotique à contact riche, où la précision est critique (insertion, assemblage, etc.). Décrite dans un article publié sur arXiv (arXiv:2607.15982v1), l'approche part d'un constat : les politiques apprises de bout en bout sur de larges jeux de données restent fragiles sur les tâches de haute précision et généralisent mal, notamment parce que la collecte de données manque de structure et de ciblage. Les auteurs proposent donc de concentrer la collecte dense de données uniquement sur le segment critique de contact, en s'appuyant sur une planification classique pour les mouvements simples en espace libre. Un schéma de collecte automatisée, combiné à de l'apprentissage par renforcement profond hors ligne, traite spécifiquement la phase de contact, sans dépendre de la dextérité d'un téléopérateur humain ni de mises à jour de politique en ligne. Sur quatre tâches réelles jugées difficiles, seulement 2 à 2,5 heures de collecte de données autonome suffisent pour atteindre un taux de réussite moyen de 96 %, contre 55 % pour la meilleure référence testée. Pour l'industrie robotique, ce résultat s'attaque directement à un problème central de la manipulation fine par apprentissage : le fossé entre démonstration et performance réelle, en particulier en dehors des conditions d'entraînement. Les approches de bout en bout perdent généralement en fiabilité sur des scénarios hors distribution, alors que la méthode proposée conserve un taux de réussite élevé dans ces conditions, ce qui suggère que cibler la collecte de données sur la phase de contact, plutôt que de tout apprendre uniformément, réduit la dépendance à des volumes massifs de démonstrations. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des déploiements de politiques d'assemblage ou d'insertion nécessitant beaucoup moins d'heures d'acquisition de données, et sans mobiliser un opérateur expert pendant tout le processus. Ce travail s'inscrit dans une tendance récente de la recherche en apprentissage par renforcement appliqué à la robotique, qui cherche à réduire le coût et la complexité de la téléopération humaine tout en conservant les gains de robustesse permis par l'apprentissage profond. En combinant planification traditionnelle et RL hors ligne de façon segmentée plutôt que de miser sur un unique modèle bout en bout, les auteurs proposent une piste concrète pour industrialiser les tâches de précision, un domaine où la robotique humanoïde et les bras manipulateurs peinent encore à passer de la démonstration en laboratoire au déploiement fiable en usine.

RecherchePaper
1 source
Représentation d'action par champ de potentiel pour l'apprentissage par renforcement en manipulation à contacts riches
4arXiv cs.RO 

Représentation d'action par champ de potentiel pour l'apprentissage par renforcement en manipulation à contacts riches

Des chercheurs décrivent, dans un préprint publié sur arXiv fin septembre 2026 (arXiv:2609.21609v1), PA-RL, un framework de reinforcement learning qui remplace les commandes cartésiennes directes par des champs de potentiel artificiels comme représentation d'action: la politique ajuste les paramètres d'un champ de potentiel énergétique, qui génère une direction de guidage exécutée par un contrôleur d'impédance cartésien. Testé en simulation sur l'insertion de cheville dans un trou (peg-in-hole), tâche de référence à contacts riches et transitions discontinues, PA-RL bat, avec le même algorithme RL, trois espaces d'action concurrents (vitesse cartésienne, pose cartésienne, impédance variable): 100% de réussite contre 92,6% pour la meilleure référence, avec 55,4% de variation de couple articulaire en moins et 70,8% de variation d'accélération cartésienne en moins. Transférée sans réentraînement, la politique entraînée uniquement en simulation réussit 9 insertions sur 9 sur robot réel. Ce résultat s'attaque à deux limites connues du RL appliqué à la manipulation industrielle: le couplage entre stratégie de tâche et génération de mouvement bas niveau, et l'écart persistant entre simulation et réel. En faisant agir la politique sur les paramètres d'un champ de potentiel plutôt que sur des commandes de trajectoire brutes, PA-RL allège l'apprentissage et produit des mouvements mécaniquement plus doux, un point concret pour les intégrateurs soucieux de limiter l'usure des actionneurs sur les lignes d'assemblage. Le transfert vers le réel sans fine-tuning est la donnée la plus significative pour les décideurs B2B: elle suggère qu'une représentation d'action mieux choisie peut réduire le besoin de réentraînement coûteux sur matériel physique, même si l'échantillon réel reste modeste, neuf essais sur une seule tâche, ce qui appelle à la prudence avant toute généralisation. Ce travail s'inscrit dans l'effort de recherche visant à rendre le RL exploitable pour l'assemblage industriel, où l'insertion de pièces sert de cas d'école face à des interfaces d'action plus directes déjà étudiées, comme la commande cartésienne en vitesse ou en pose et l'impédance variable. En s'appuyant sur les champs de potentiel artificiels, une technique historiquement utilisée en planification de mouvement classique plutôt qu'en apprentissage de bout en bout, les auteurs proposent une voie intermédiaire entre contrôle réactif et apprentissage profond. L'article ne mentionne ni partenaire industriel ni pilote de déploiement annoncé; les suites attendues porteraient sur l'extension à d'autres tâches de contact et sur une validation à plus grande échelle en conditions réelles, afin de confirmer la généralisation au-delà du seul scénario peg-in-hole testé ici.

RecherchePaper
1 source