Aller au contenu principal
RecherchearXiv cs.RO 

Clonage d'impédance : apprendre les paramètres du point d'équilibre pour la manipulation en contact riche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente, dans une prépublication arXiv (2609.30842v1), une méthode d'apprentissage par imitation nommée Impedance Cloning, testée sur deux bras CRANE-X7. Plutôt que reproduire des trajectoires comme le clonage comportemental classique, elle apprend les paramètres biomécaniques du mouvement, raideur et point d'équilibre, extraits par filtre particulaire de démonstrations en téléopération bilatérale, sans capteur de force/couple. En essuyage, la référence par trajectoire perd le contact sous -6 cm, tandis qu'Impedance Cloning maintient 4 à 5 newtons de force au-dessus de ce seuil, avec une baisse progressive en dessous ; en commande cartésienne, sa pente force-hauteur n'est que de 0,13 +/- 0,03 N/cm contre 0,34 à 0,83 N/cm pour les références à impédance fixe. En prise-dépose (dix tasses, 100 essais), elle réussit 84 fois contre 74 pour la référence à impédance fixe et 82 pour un contrôleur à impédance variable, ce dernier avec dix fois plus de démonstrations. Elle réduit aussi l'erreur de suivi de couple en préhension, avec les architectures ILBiT et Mamba.

Le travail cible une faiblesse connue de l'apprentissage par imitation en manipulation de contact : les politiques entraînées sur des trajectoires précises s'effondrent dès que la géométrie réelle d'une surface s'écarte des conditions d'entraînement. En apprenant l'intention, raideur et équilibre, plutôt que le résultat observé, la méthode absorbe passivement l'incertitude de contact, un enjeu direct pour les intégrateurs travaillant sur l'essuyage, l'assemblage ou la préhension d'objets à géométrie variable, où les capteurs de force/couple restent coûteux ou absents. Réussir avec une seule démonstration là où un contrôleur à impédance variable en réclame dix réduit le coût de collecte de données, frein connu au déploiement à l'échelle.

La méthode reprend le concept du point d'équilibre, issu de la biomécanique du mouvement humain, appliqué au contrôle par impédance, technique robotique ancienne rarement combinée à l'apprentissage par imitation à partir de démonstrations téléopérées. L'estimer par filtre particulaire, sans capteur de force/couple dédié, abaisse la barrière matérielle pour les équipes non équipées de capteurs spécialisés. Les essais, sur CRANE-X7 avec deux backbones, ILBiT et Mamba, visent à montrer la généralité de l'approche. Publiée comme simple prépublication, non encore relue par les pairs ni déployée industriellement, l'étude se positionne comme une alternative aux contrôleurs à impédance variable plutôt qu'un rival des politiques vision-langage-action comme Pi-0 ou GR00T N2.

À lire aussi

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples
1arXiv cs.RO 

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples

Une équipe de chercheurs décrit sur arXiv (arXiv:2509.19696, quatrième version) Diffusion-Based Impedance Learning (DIL), un framework combinant un modèle de diffusion Transformer et un contrôle d'impédance classique pour la manipulation robotique en contact riche. Conditionne par cross-attention sur les forces et couples externes mesures, le modèle reconstruit des trajectoires simulées a force nulle (sZFT), complétées par un ordonnanceur de bruit quaternion SLERP pour les rotations. Un estimateur énergétique adapte ensuite en ligne la raideur et l'amortissement du bras. Entraine sur des démonstrations de franchissement d'obstacles et de robotique thérapeutique collectées via téléopération au casque Apple Vision Pro, avec seulement quelques dizaines de milliers d'échantillons, le modèle atteint une précision sous le millimètre et sous le degré. Deploye en temps réel sur un bras KUKA LBR iiwa, il obtient 100% de réussite sur une tache d'insertion peg-in-hole multi-géométries. La manipulation en contact riche (insertion, assemblage, interaction physique) reste un point faible des politiques robotiques purement apprises, qui peinent a garantir la sécurité lors du contact, tandis que le contrôle d'impédance classique exige un réglage manuel spécifique a chaque tache. En couplant les deux approches, ce travail vise a automatiser ce réglage tout en conservant les garanties de stabilité de l'impédance, un enjeu concret pour les intégrateurs qui déploient des bras collaboratifs sur des lignes d'assemblage ou en assistance thérapeutique. Les résultats restent toutefois ceux d'une démonstration de laboratoire, sur un seul bras et des taches contrôlées, et non d'un déploiement industriel a l'échelle. Le contrôle d'impédance, théorisé il y a plusieurs décennies, reste la référence pour l'interaction physique sure homme-robot, tandis que les modèles de diffusion se sont imposes plus récemment comme méthode d'apprentissage de politiques robotiques, a l'image des travaux sur les diffusion policies, sans toutefois bien couvrir les taches de contact face aux approches VLA généralistes comme Pi-0 ou GR00T N2. Le recours a l'Apple Vision Pro pour la téléopération illustre une tendance croissante a collecter des démonstrations via des casques de réalité mixte plutôt que des combinaisons de capture de mouvement dédiées. Le KUKA LBR iiwa, bras collaboratif a détection de couple du fabricant allemand KUKA, sert de plateforme d'essai. Code et vidéos sont publics, sans annonce de pilote industriel a ce stade.

UELe bras collaboratif utilise pour la demonstration est fabrique par l'entreprise allemande KUKA, mais aucune equipe de recherche europeenne ni pilote industriel europeen n'est mentionne.

RecherchePaper
1 source
PredTac : apprentissage de la manipulation en contact riche par prédiction du toucher
2arXiv cs.RO 

PredTac : apprentissage de la manipulation en contact riche par prédiction du toucher

Des chercheurs présentent PredTac, un cadre qui remplace les capteurs tactiles physiques par une estimation visuelle du contact lors de la manipulation robotique. Le système entraîne d'abord un prédicteur tactile supervisé par des données de contact réelles, puis utilise ses inférences comme substitut au toucher mesuré pendant l'apprentissage et l'exécution de politiques, à partir de simples observations visuelles et de l'état du robot. L'équipe teste PredTac sur trois tâches à fort contact, en simulation et sur robot réel : insertion USB, extraction d'un objet barbelé (Barbed-spike) et rotation de vanne (Valve). En simulation, les politiques à toucher prédit atteignent 27,0%, 52,0% et 44,7% de réussite selon la tâche, soit un gain de 8,0 à 13,7 points de pourcentage par rapport à une politique purement visuelle. Sur robot réel, avec l'architecture ACT, les taux grimpent à 70,0%, 50,0% et 90,0% (moyenne de 70,0% sur les trois tâches), un score proche des 72,2% obtenus avec un toucher réellement mesuré et largement supérieur aux 21,1% d'une politique vision seule. Ce résultat s'attaque à un point de friction connu de la robotique de manipulation fine : les capteurs tactiles physiques ajoutent du coût matériel, des contraintes de calibration, de synchronisation et de maintenance qui freinent le déploiement en dehors des laboratoires. Si le toucher peut être inféré de façon fiable à partir de la vision et de la proprioception, cela lève un obstacle matériel pour les intégrateurs qui veulent équiper des bras robotiques de compétences fines (insertion de connecteurs, manipulation d'objets irréguliers, actionnement de vannes) sans multiplier les capteurs embarqués et leurs pannes associées. Les auteurs nuancent toutefois la promesse : des tests d'intervention montrent que la performance reste sensible à la structure spatiale du contact prédit, une simple réorganisation spatiale des valeurs prédites faisant chuter le succès sur la tâche Valve de 10,7 points. Le toucher prédit n'égale donc pas encore totalement le toucher mesuré, mais s'en approche suffisamment pour être une alternative crédible plutôt qu'un pis-aller. Ce travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) et des politiques comme ACT, qui cherchent à réduire la dépendance des robots manipulateurs à des capteurs spécialisés coûteux. Il complète les approches à toucher mesuré directement, en proposant une alternative bas coût sans capteur tactile dédié. L'étude, publiée en préprint sur arXiv le 15 septembre 2026, reste à ce stade une validation en laboratoire sur trois tâches ciblées et un unique bras robotique réel, sans indication de partenariat industriel ni de déploiement au-delà du cadre expérimental ; les prochaines étapes attendues concernent l'extension à davantage de tâches et de plateformes pour confirmer la généralisation de l'approche.

RecherchePaper
1 source
Data et apprentissage là où ça compte pour la manipulation à contact riche
3arXiv cs.RO 

Data et apprentissage là où ça compte pour la manipulation à contact riche

Des chercheurs proposent une nouvelle méthode de collecte de données pour l'apprentissage de tâches de manipulation robotique à contact riche, où la précision est critique (insertion, assemblage, etc.). Décrite dans un article publié sur arXiv (arXiv:2607.15982v1), l'approche part d'un constat : les politiques apprises de bout en bout sur de larges jeux de données restent fragiles sur les tâches de haute précision et généralisent mal, notamment parce que la collecte de données manque de structure et de ciblage. Les auteurs proposent donc de concentrer la collecte dense de données uniquement sur le segment critique de contact, en s'appuyant sur une planification classique pour les mouvements simples en espace libre. Un schéma de collecte automatisée, combiné à de l'apprentissage par renforcement profond hors ligne, traite spécifiquement la phase de contact, sans dépendre de la dextérité d'un téléopérateur humain ni de mises à jour de politique en ligne. Sur quatre tâches réelles jugées difficiles, seulement 2 à 2,5 heures de collecte de données autonome suffisent pour atteindre un taux de réussite moyen de 96 %, contre 55 % pour la meilleure référence testée. Pour l'industrie robotique, ce résultat s'attaque directement à un problème central de la manipulation fine par apprentissage : le fossé entre démonstration et performance réelle, en particulier en dehors des conditions d'entraînement. Les approches de bout en bout perdent généralement en fiabilité sur des scénarios hors distribution, alors que la méthode proposée conserve un taux de réussite élevé dans ces conditions, ce qui suggère que cibler la collecte de données sur la phase de contact, plutôt que de tout apprendre uniformément, réduit la dépendance à des volumes massifs de démonstrations. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des déploiements de politiques d'assemblage ou d'insertion nécessitant beaucoup moins d'heures d'acquisition de données, et sans mobiliser un opérateur expert pendant tout le processus. Ce travail s'inscrit dans une tendance récente de la recherche en apprentissage par renforcement appliqué à la robotique, qui cherche à réduire le coût et la complexité de la téléopération humaine tout en conservant les gains de robustesse permis par l'apprentissage profond. En combinant planification traditionnelle et RL hors ligne de façon segmentée plutôt que de miser sur un unique modèle bout en bout, les auteurs proposent une piste concrète pour industrialiser les tâches de précision, un domaine où la robotique humanoïde et les bras manipulateurs peinent encore à passer de la démonstration en laboratoire au déploiement fiable en usine.

RecherchePaper
1 source
4arXiv cs.RO 

Imp-ACT : contrôle d'impédance adaptatif et segmentation d'action par transformers pour la manipulation en contact

Des chercheurs présentent Imp-ACT, une méthode de contrôle robotique pour la manipulation en contact riche, décrite dans une prépublication arXiv (2609.31225v1, non encore relue par les pairs). Le principe consiste à intégrer la modulation de rigidité cartésienne directement dans la phase de collecte de démonstrations par téléopération, plutôt que de fixer cette rigidité au niveau du contrôleur comme le font la plupart des politiques vision-action actuelles. Un contrôleur d'impédance auto-ajustable adapte la rigidité selon la direction instantanée du mouvement tout en conservant de la souplesse dans les directions orthogonales, sans sélection manuelle ni reconstruction de cible hors ligne. Cette rigidité adaptée est enregistrée en même temps que les observations visuelles, proprioceptives et de force, puis utilisée pour entraîner une architecture Action Chunking with Transformer (ACT) qui prédit conjointement la pose de l'effecteur, l'action du gripper et la rigidité directionnelle. Sur deux tâches test, essuyage de surface et insertion de fiche, Imp-ACT égale ou dépasse le taux de réussite de deux références à rigidité fixe (basse et haute), tout en réduisant les forces de contact : la vibration des forces de contact chute d'environ 29 fois par rapport à la référence souple et 180 fois par rapport à la référence rigide lors de l'essuyage, et les forces orthogonales à l'axe d'insertion baissent de 43% par rapport à la meilleure référence à rigidité fixe lors de l'insertion. L'enjeu dépasse la simple démonstration académique : la plupart des politiques d'apprentissage par imitation actuelles séparent l'apprentissage du mouvement de la gestion de la compliance, laissant les intégrateurs choisir manuellement un compromis rigide/souple selon la tâche, un réglage coûteux et rarement optimal pour l'ensemble d'une opération de contact. En montrant qu'une politique unique peut apprendre à moduler sa rigidité en fonction de la direction, à partir de simples démonstrations téléopérées, Imp-ACT suggère une voie pour automatiser ce réglage dans des tâches industrielles sensibles comme l'assemblage, le câblage ou le nettoyage de surfaces, où un excès de rigidité génère des forces dommageables et un excès de souplesse compromet la précision. Le travail s'appuie sur l'architecture ACT, déjà répandue dans l'apprentissage par imitation robotique, et se distingue des politiques généralistes de type VLA en se concentrant spécifiquement sur le sous-problème du contrôle de compliance plutôt que sur la généralisation multi-tâches. Il s'agit à ce stade d'une évaluation de laboratoire sur deux tâches ciblées, sans annonce de déploiement industriel ni de partenariat commercial.

RecherchePaper
1 source