Aller au contenu principal
RecherchearXiv cs.RO 

PHASE : récupération de phase tactile pour un apprentissage d'insertion en peu d'exemples, avec compliance

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 28 septembre 2026 sur arXiv (2609.30889) un article décrivant PHASE (Phase-Aware Segmentation and REtrieval), une méthode d'apprentissage par imitation augmentée par récupération de données, appliquée à l'insertion de type peg-in-hole, une tâche d'assemblage à contact riche. Le système exploite un poignet compliant qui maintient le contact tout au long du mouvement, générant des signaux tactiles et de force qui révèlent la structure en phases de l'insertion, de la recherche du trou jusqu'à l'insertion finale. PHASE combine un apprentissage de représentation multimodale sensible au contact, une segmentation en phases de longueur variable à partir des signaux tactiles, et une récupération de données cohérente avec la phase en cours pour entraîner la politique de contrôle. Les auteurs l'ont testé sur un robot réel avec cinq géométries de tige différentes, en le comparant à des stratégies de récupération issues de méthodes de référence sous une architecture de politique partagée. Résultat: un taux de réussite global supérieur de 13 points de pourcentage à la meilleure référence non sensible aux phases, et un gain de 30 points de pourcentage lorsque la position initiale de la pièce est inédite.

L'insertion de précision reste l'un des goulots d'étranglement de l'automatisation flexible en assemblage électronique et mécanique: les tâches à contact riche exigent d'ordinaire des centaines de démonstrations pour généraliser, ce qui freine leur adoption par les intégrateurs souhaitant reconfigurer une cellule robotique pour un nouveau connecteur sans recollecter de données. En montrant qu'aligner la récupération de données antérieures sur les phases physiques de l'interaction, plutôt que sur des découpages temporels arbitraires, améliore fortement la robustesse en apprentissage à faible nombre de démonstrations, notamment face à des positions de départ jamais vues, PHASE apporte un argument concret au débat sur la capacité réelle des politiques apprises par imitation à généraliser au-delà de leurs démonstrations, un point sensible pour les approches génériques de type VLA appliquées à la manipulation fine. Il s'agit néanmoins d'un résultat de recherche évalué en laboratoire sur un nombre limité de géométries, pas d'un système déployé en usine ni d'un produit commercial.

Le travail s'inscrit dans la lignée de l'apprentissage par imitation augmenté par récupération, une piste explorée récemment pour réduire le nombre de démonstrations nécessaires en réutilisant des données antérieures pertinentes, mais jusqu'ici peu testée sur des tâches à contact riche comme l'assemblage. Les auteurs comparent PHASE à plusieurs stratégies de récupération considérées comme état de l'art mais qui ignorent la structure en phases de l'interaction, afin d'isoler l'apport spécifique de leur segmentation tactile. L'article ne précise ni l'institution ni la plateforme robotique commerciale utilisée au-delà du poignet compliant, et ne mentionne aucun partenariat industriel ni pilote programmé: il se présente comme une contribution méthodologique destinée à la communauté de recherche en manipulation robotique, sans calendrier de transfert vers l'industrie annoncé à ce stade.

À lire aussi

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples
1arXiv cs.RO 

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples

Une équipe de chercheurs décrit sur arXiv (arXiv:2509.19696, quatrième version) Diffusion-Based Impedance Learning (DIL), un framework combinant un modèle de diffusion Transformer et un contrôle d'impédance classique pour la manipulation robotique en contact riche. Conditionne par cross-attention sur les forces et couples externes mesures, le modèle reconstruit des trajectoires simulées a force nulle (sZFT), complétées par un ordonnanceur de bruit quaternion SLERP pour les rotations. Un estimateur énergétique adapte ensuite en ligne la raideur et l'amortissement du bras. Entraine sur des démonstrations de franchissement d'obstacles et de robotique thérapeutique collectées via téléopération au casque Apple Vision Pro, avec seulement quelques dizaines de milliers d'échantillons, le modèle atteint une précision sous le millimètre et sous le degré. Deploye en temps réel sur un bras KUKA LBR iiwa, il obtient 100% de réussite sur une tache d'insertion peg-in-hole multi-géométries. La manipulation en contact riche (insertion, assemblage, interaction physique) reste un point faible des politiques robotiques purement apprises, qui peinent a garantir la sécurité lors du contact, tandis que le contrôle d'impédance classique exige un réglage manuel spécifique a chaque tache. En couplant les deux approches, ce travail vise a automatiser ce réglage tout en conservant les garanties de stabilité de l'impédance, un enjeu concret pour les intégrateurs qui déploient des bras collaboratifs sur des lignes d'assemblage ou en assistance thérapeutique. Les résultats restent toutefois ceux d'une démonstration de laboratoire, sur un seul bras et des taches contrôlées, et non d'un déploiement industriel a l'échelle. Le contrôle d'impédance, théorisé il y a plusieurs décennies, reste la référence pour l'interaction physique sure homme-robot, tandis que les modèles de diffusion se sont imposes plus récemment comme méthode d'apprentissage de politiques robotiques, a l'image des travaux sur les diffusion policies, sans toutefois bien couvrir les taches de contact face aux approches VLA généralistes comme Pi-0 ou GR00T N2. Le recours a l'Apple Vision Pro pour la téléopération illustre une tendance croissante a collecter des démonstrations via des casques de réalité mixte plutôt que des combinaisons de capture de mouvement dédiées. Le KUKA LBR iiwa, bras collaboratif a détection de couple du fabricant allemand KUKA, sert de plateforme d'essai. Code et vidéos sont publics, sans annonce de pilote industriel a ce stade.

UELe bras collaboratif utilise pour la demonstration est fabrique par l'entreprise allemande KUKA, mais aucune equipe de recherche europeenne ni pilote industriel europeen n'est mentionne.

RecherchePaper
1 source
Apprentissage par admittance vision-force pour l'insertion de tige dans un trou mobile
2arXiv cs.RO 

Apprentissage par admittance vision-force pour l'insertion de tige dans un trou mobile

Des chercheurs présentent VFAL (Vision-Force Admittance Learning), un cadre robotique pour insérer une pièce (peg) dans un trou en mouvement, une tâche classique d'assemblage industriel rendue instable par un environnement dynamique, comme une base mobile ou une cible dont le déplacement n'est pas connu à l'avance. Le système fusionne un retour visuel asynchrone et basse fréquence avec un modèle d'admittance basé sur la force à haute fréquence, l'estimation de pose visuelle servant de terme de régularisation pour stabiliser l'ensemble. Pour l'estimation de pose, les auteurs s'appuient sur des modèles de fondation en vision de dernière génération plutôt que sur des marqueurs ou capteurs dédiés, et ajoutent des mécanismes de récupération après échec pour renforcer la robustesse. Le papier, publié sous la référence arXiv:2609.14133v1, rapporte des expériences réelles montrant un taux de réussite élevé et une bonne adaptabilité à différents types de pegs et de contextes dynamiques, tout en conservant une précision de l'ordre du millimètre, sans toutefois préciser de chiffres exacts de taux de succès, de temps de cycle ou de charge utile dans le résumé. L'insertion peg-in-hole est un test de référence en robotique de manipulation depuis des décennies car elle exige une précision millimétrique difficilement compatible avec l'incertitude d'un environnement mobile. Pour les intégrateurs industriels, notamment en assemblage automobile ou électronique où les pièces peuvent être portées par un convoyeur ou une plateforme mobile, une solution qui combine vision et force sans dépendre d'une cible fixe ouvre la voie à des lignes d'assemblage plus flexibles, sans immobiliser systématiquement la pièce à insérer. Le recours à des modèles de fondation en vision pour l'estimation de pose, plutôt qu'à des pipelines de vision sur mesure, illustre aussi une tendance plus large du secteur à réutiliser des modèles génériques pré-entraînés pour des sous-tâches de perception, réduisant l'ingénierie spécifique par cas d'usage. Ce travail s'inscrit dans une longue lignée de recherches académiques sur l'admittance control et l'apprentissage par renforcement pour la manipulation fine, un domaine où des laboratoires universitaires et industriels publient régulièrement sur arXiv avant toute commercialisation. Le document ne mentionne ni partenariat industriel, ni déploiement en usine, ni feuille de route de commercialisation : il s'agit d'une contribution de recherche validée par des expériences en laboratoire, à distinguer clairement d'un produit prêt à l'emploi. Les prochaines étapes attendues pour ce type de travaux sont généralement l'extension à d'autres géométries de pièces, l'intégration sur des bras robotiques commerciaux, puis d'éventuels essais pilotes avec des intégrateurs industriels, mais aucun calendrier n'est communiqué dans cette publication.

RecherchePaper
1 source
Touch2Trace : apprentissage par imitation tactile pour le traçage dextérique de câbles
3arXiv cs.RO 

Touch2Trace : apprentissage par imitation tactile pour le traçage dextérique de câbles

Une équipe de recherche présente Touch2Trace, un système d'apprentissage par imitation piloté par le toucher, conçu pour l'une des tâches les plus difficiles de la manipulation dextre : faire glisser un câble à travers la main par des mouvements répétés de pincement et d'enroulement du pouce et de l'index. Le système combine un encodeur tactile pré-entraîné en auto-supervision pour un capteur piézorésistif personnalisé de 32x32 points, baptisé TacV5, avec une politique transformeur légère entraînée par clonage comportemental à partir de démonstrations téléopérées, déployée à 60 Hz sur une main robotique à cinq doigts Tesollo DG-5F. Selon l'article déposé sur arXiv (2609.15921), le retour tactile seul, sans vision ni estimation explicite de l'état du câble, améliore radicalement les performances par rapport à une base proprioceptive seule : la distance moyenne de câble tracée avant échec passe de 0,2 cm à 20,1 cm et le taux de réussite de 0% à 93%, avec un transfert zero-shot vers des câbles et des configurations de routage inédits. Ce travail fournit, d'après les auteurs, la première caractérisation systématique en conditions réelles de l'effet de paramètres clés (pré-entraînement de l'encodeur, fréquence de contrôle, contexte temporel, résolution spatiale) sur la performance d'une politique tactile. L'enjeu dépasse le laboratoire : la démonstration contredit l'hypothèse répandue selon laquelle la manipulation fine d'objets déformables comme les câbles exige une vision ou une modélisation explicite de leur état, un point direct pour l'assemblage de faisceaux électriques, le câblage industriel et l'automatisation en électronique. Elle donne aussi un signal concret aux fabricants de mains robotiques dextres et aux intégrateurs qui arbitrent entre coût et pertinence des modalités de capteurs pour des tâches de préhension fine, en montrant qu'une architecture purement tactile peut suffire là où des pipelines vision plus complexes sont souvent supposés nécessaires. Le projet s'inscrit dans la lignée des recherches sur la manipulation dextre assistée par capteurs tactiles haute résolution, un domaine où les progrès restaient jusqu'ici bridés par le manque de capteurs assez denses et de politiques capables d'exploiter leur signal en temps réel. À la différence des approches vision-langage-action comme Pi-0 ou GR00T N2, qui s'appuient sur des flux visuels et un raisonnement multimodal, Touch2Trace repose entièrement sur le signal brut du TacV5, un capteur développé en interne pour ce cas d'usage. Il s'agit à ce stade d'une préimpression de recherche, sans annonce de déploiement industriel ni de partenariat commercial ; les auteurs la présentent comme une référence quantitative pour la conception future de systèmes tactiles dextres, ouvrant la voie à des essais sur des tâches de manipulation déformable plus variées.

RecherchePaper
1 source
ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels
4arXiv cs.RO 

ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels

Des chercheurs ont publié ReMoBot (arXiv:2408.15919v4), un framework d'apprentissage par imitation à peu d'exemples conçu pour la manipulation mobile sur robots à vision égocentrique. Évalué sur un Boston Dynamics Spot, le système atteint des taux de succès de 70 % sur la tâche "Table Uncover" et 80 % sur "Gap Cover" en environnement réel, avec seulement 20 démonstrations par tâche. Plutôt que de distiller les démonstrations dans une politique paramétrique classique, ReMoBot adopte une stratégie de récupération : à l'inférence, il identifie dans une base de démonstrations d'experts les séquences les plus pertinentes via une combinaison de similarité d'état, d'alignement temporel des trajectoires et de cohérence des séquences d'actions, puis sélectionne directement les commandes motrices sans aucun entraînement supplémentaire. L'ensemble s'appuie sur des vision foundation models pour extraire des représentations robustes depuis la caméra embarquée du robot, en fonctionnement totalement training-free à l'exécution. L'approche retrieval-based présente deux avantages concrets pour les intégrateurs industriels. D'abord, le coût de collecte de données est drastiquement réduit : 20 démonstrations contre plusieurs centaines requises par les méthodes IL standard (ACT, Diffusion Policy), ce qui accélère le déploiement sur de nouvelles tâches ou variantes. Ensuite, l'absence d'entraînement à l'inférence supprime le risque de surapprentissage sur données insuffisantes, problème récurrent avec les objets déformables où la variabilité des états est élevée. ReMoBot surpasse deux baselines entraînées directement sur données réelles sans transfert sim-to-réel sur deux tâches sur trois. La tâche "Curtain Open" reste problématique, signalant que la manipulation d'objets hautement déformables sous occultations partielles constitue encore un verrou non résolu, y compris pour les approches retrieval. ReMoBot s'inscrit dans la tendance à exploiter les vision foundation models (de la famille DINOv2, CLIP, SAM) pour réduire la dépendance aux données propriétaires et améliorer la généralisation. Sur le Spot de Boston Dynamics, plateforme quadrupède commerciale, la manipulation mobile reste un défi structurel : le robot se déplace en même temps qu'il manipule, rendant l'observation égocentrique partielle et bruitée. Face aux VLA de grande taille comme pi-0 (Physical Intelligence) ou RT-2 (Google DeepMind), qui exigent des volumes de données considérables et une infrastructure d'entraînement lourde, ReMoBot se positionne dans le segment "data-efficient, training-free" particulièrement pertinent pour les intégrateurs ou PME industrielles sans capacité de collecte à grande échelle. La prochaine étape logique serait d'enrichir dynamiquement la base de démonstrations et de valider l'approche dans des environnements industriels hors laboratoire contrôlé.

UELes PME et intégrateurs robotiques européens sans capacité de collecte de données à grande échelle pourraient bénéficier directement de cette approche data-efficient (20 démos vs plusieurs centaines), réduisant la barrière d'entrée au déploiement de manipulation mobile intelligente.

RecherchePaper
1 source