Aller au contenu principal
RecherchearXiv cs.RO 

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs décrit sur arXiv (arXiv:2509.19696, quatrième version) Diffusion-Based Impedance Learning (DIL), un framework combinant un modèle de diffusion Transformer et un contrôle d'impédance classique pour la manipulation robotique en contact riche. Conditionne par cross-attention sur les forces et couples externes mesures, le modèle reconstruit des trajectoires simulées a force nulle (sZFT), complétées par un ordonnanceur de bruit quaternion SLERP pour les rotations. Un estimateur énergétique adapte ensuite en ligne la raideur et l'amortissement du bras. Entraine sur des démonstrations de franchissement d'obstacles et de robotique thérapeutique collectées via téléopération au casque Apple Vision Pro, avec seulement quelques dizaines de milliers d'échantillons, le modèle atteint une précision sous le millimètre et sous le degré. Deploye en temps réel sur un bras KUKA LBR iiwa, il obtient 100% de réussite sur une tache d'insertion peg-in-hole multi-géométries.

La manipulation en contact riche (insertion, assemblage, interaction physique) reste un point faible des politiques robotiques purement apprises, qui peinent a garantir la sécurité lors du contact, tandis que le contrôle d'impédance classique exige un réglage manuel spécifique a chaque tache. En couplant les deux approches, ce travail vise a automatiser ce réglage tout en conservant les garanties de stabilité de l'impédance, un enjeu concret pour les intégrateurs qui déploient des bras collaboratifs sur des lignes d'assemblage ou en assistance thérapeutique. Les résultats restent toutefois ceux d'une démonstration de laboratoire, sur un seul bras et des taches contrôlées, et non d'un déploiement industriel a l'échelle.

Le contrôle d'impédance, théorisé il y a plusieurs décennies, reste la référence pour l'interaction physique sure homme-robot, tandis que les modèles de diffusion se sont imposes plus récemment comme méthode d'apprentissage de politiques robotiques, a l'image des travaux sur les diffusion policies, sans toutefois bien couvrir les taches de contact face aux approches VLA généralistes comme Pi-0 ou GR00T N2. Le recours a l'Apple Vision Pro pour la téléopération illustre une tendance croissante a collecter des démonstrations via des casques de réalité mixte plutôt que des combinaisons de capture de mouvement dédiées. Le KUKA LBR iiwa, bras collaboratif a détection de couple du fabricant allemand KUKA, sert de plateforme d'essai. Code et vidéos sont publics, sans annonce de pilote industriel a ce stade.

Impact France/UE

Le bras collaboratif utilise pour la demonstration est fabrique par l'entreprise allemande KUKA, mais aucune equipe de recherche europeenne ni pilote industriel europeen n'est mentionne.

À lire aussi

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
1arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts
2arXiv cs.RO 

VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts

Des chercheurs ont présenté VE2VF (Vision-Enabled to Vision-Free), un cadre d'apprentissage par renforcement (RL) pour la manipulation robotique en contact riche, publié en préprint sur arXiv (2605.29564). La méthode repose sur une distillation enseignant-élève conduite intégralement sur robot réel, sans simulation ni randomisation de domaine. Un module "enseignant" équipé de vision apprend d'abord la tâche, puis transfère sa politique à un "élève" n'utilisant que la pose, le twist et le wrench (position/orientation, vitesse et couple de force), sans aucun flux caméra. Sur le benchmark NIST d'assemblage, référence standardisée pour les tâches d'insertion de précision, le système atteint 95 % de taux de succès global après environ 50 minutes d'entraînement sur 3 tâches représentatives, et généralise à 8 variantes non vues lors de l'entraînement. Un fine-tuning par distillation permet d'atteindre 100 % de succès sur la variante la plus difficile. Ce résultat adresse un problème structurel en robotique industrielle: les politiques basées sur la vision surapprennent les conditions d'éclairage et de fond vues à l'entraînement, ce qui fragilise leur déploiement en environnement de production variable. En éliminant la vision à l'inférence tout en l'exploitant pendant l'apprentissage, VE2VF produit des politiques robustes aux perturbations visuelles sans coût supplémentaire en données. Plus significatif encore: atteindre cette généralisation en moins d'une heure d'entraînement réel suggère qu'on peut contourner le sim-to-real gap sans simulateur haute-fidélité ni dataset synthétique massif. Pour les intégrateurs déployant des cellules d'assemblage de précision, la combinaison rapidité d'adaptation et robustesse proprioceptive est directement actionnable. Le benchmark NIST Assembly Task Board est utilisé depuis plusieurs années comme terrain de comparaison inter-équipes en manipulation de précision, ce qui confère à ces résultats une lisibilité relative face aux travaux antérieurs. Les approches concurrentes combinent généralement simulation, randomisation de domaine et larges volumes de données synthétiques avant transfert sur robot réel. VE2VF se positionne comme une alternative ancrée dans le réel, avec une boucle human-in-the-loop permettant de superviser l'apprentissage en cours de session. Il s'agit à ce stade d'un préprint de recherche, non d'un système en production ni d'un produit commercialisé. Les suites naturelles incluent des tests sur d'autres plateformes matérielles et des tâches industrielles plus complexes, ainsi qu'une confrontation directe avec les approches de type VLA (Vision-Language-Action) qui ciblent elles aussi la généralisation en manipulation contact-riche à grande échelle.

RecherchePaper
1 source
Data et apprentissage là où ça compte pour la manipulation à contact riche
3arXiv cs.RO 

Data et apprentissage là où ça compte pour la manipulation à contact riche

Des chercheurs proposent une nouvelle méthode de collecte de données pour l'apprentissage de tâches de manipulation robotique à contact riche, où la précision est critique (insertion, assemblage, etc.). Décrite dans un article publié sur arXiv (arXiv:2607.15982v1), l'approche part d'un constat : les politiques apprises de bout en bout sur de larges jeux de données restent fragiles sur les tâches de haute précision et généralisent mal, notamment parce que la collecte de données manque de structure et de ciblage. Les auteurs proposent donc de concentrer la collecte dense de données uniquement sur le segment critique de contact, en s'appuyant sur une planification classique pour les mouvements simples en espace libre. Un schéma de collecte automatisée, combiné à de l'apprentissage par renforcement profond hors ligne, traite spécifiquement la phase de contact, sans dépendre de la dextérité d'un téléopérateur humain ni de mises à jour de politique en ligne. Sur quatre tâches réelles jugées difficiles, seulement 2 à 2,5 heures de collecte de données autonome suffisent pour atteindre un taux de réussite moyen de 96 %, contre 55 % pour la meilleure référence testée. Pour l'industrie robotique, ce résultat s'attaque directement à un problème central de la manipulation fine par apprentissage : le fossé entre démonstration et performance réelle, en particulier en dehors des conditions d'entraînement. Les approches de bout en bout perdent généralement en fiabilité sur des scénarios hors distribution, alors que la méthode proposée conserve un taux de réussite élevé dans ces conditions, ce qui suggère que cibler la collecte de données sur la phase de contact, plutôt que de tout apprendre uniformément, réduit la dépendance à des volumes massifs de démonstrations. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des déploiements de politiques d'assemblage ou d'insertion nécessitant beaucoup moins d'heures d'acquisition de données, et sans mobiliser un opérateur expert pendant tout le processus. Ce travail s'inscrit dans une tendance récente de la recherche en apprentissage par renforcement appliqué à la robotique, qui cherche à réduire le coût et la complexité de la téléopération humaine tout en conservant les gains de robustesse permis par l'apprentissage profond. En combinant planification traditionnelle et RL hors ligne de façon segmentée plutôt que de miser sur un unique modèle bout en bout, les auteurs proposent une piste concrète pour industrialiser les tâches de précision, un domaine où la robotique humanoïde et les bras manipulateurs peinent encore à passer de la démonstration en laboratoire au déploiement fiable en usine.

RecherchePaper
1 source
Apprentissage de priors d'action pour la manipulation robotique multi-morphologies
4arXiv cs.RO 

Apprentissage de priors d'action pour la manipulation robotique multi-morphologies

Des chercheurs ont soumis le 25 juin 2026 sur arXiv (réf. 2606.26095) un cadre d'entraînement en deux étapes pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique cross-embodiment. Le problème est structurel : dans l'architecture dominante, le module d'action est greffé sur un backbone Vision-Language Model (VLM) et co-optimisé dès le départ, ce qui contraint le modèle à découvrir simultanément la dynamique physique du mouvement et l'alignement visuo-linguistique. Les auteurs proposent de préentraîner d'abord le module d'action sur des trajectoires brutes via un encodeur-décodeur léger basé sur le flow-matching, sans aucune entrée visuelle ni linguistique, puis de transférer ce prior moteur à l'entraînement VLA par réutilisation du décodeur et distillation latente en début d'entraînement. La méthode est évaluée sur 13 tâches cross-embodiment en simulation et sur plateformes réelles. Le bénéfice principal est de découpler deux apprentissages que les VLA actuels co-optimisent de front : la structure temporelle du mouvement et la sémantique visuo-linguistique. Selon les résultats présentés, la méthode accélère la convergence, améliore les taux de succès globaux et génère des gains particulièrement nets sur les tâches à faible volume de données réelles, là où les pipelines existants décrochent. Le module encodeur joue par ailleurs le rôle de compresseur d'historique, résumant l'historique état-action en un unique token de contexte temporel à coût négligeable. Fait notable : augmenter le volume de données d'action en étape 1 améliore directement les performances downstream, sans requérir de nouvelles démonstrations robotiques coûteuses à collecter. Ce travail s'inscrit dans la compétition autour des politiques robotiques généralistes capables d'opérer sur des morphologies hétérogènes : Pi-0 (Physical Intelligence), OpenVLA, Octo (UC Berkeley) et RT-2 (Google DeepMind) constituent les références directes. La rareté des données réelles annotées et le sim-to-real gap restent les freins communs à l'ensemble du secteur, et une meilleure initialisation du prior moteur en offre une réponse partielle. Il s'agit d'un preprint non évalué par les pairs, sans déploiement industriel annoncé ; les suites naturelles seraient une intégration dans des frameworks open-source comme LeRobot (Hugging Face) ou une adoption par des équipes développant des humanoïdes généralistes.

UELa méthode pourrait être intégrée à LeRobot (Hugging Face, Paris), ce qui bénéficierait directement à l'écosystème de robotique open-source français.

RechercheOpinion
1 source