Aller au contenu principal
RecherchearXiv cs.RO 

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ReTouch est un modèle vision-langage-action (VLA) conçu pour la manipulation dextre en contact riche, présenté dans un article publié le 1er août 2026 sur arXiv (arXiv:2608.01824v1). Le système s'appuie sur deux innovations principales : un Tactile-Patch Encoder qui représente les signaux tactiles sous forme de patches structurés préservant l'identité de chaque doigt et la structure locale du contact, et un module d'action haute fréquence qui prédit conjointement les états tactiles futurs et des blocs d'actions, en les affinant en continu grâce au retour tactile pendant l'exécution. Les chercheurs ont aussi construit XHT-Dataset, un jeu de données de 900 démonstrations réelles couvrant sept tâches de manipulation en contact riche, collectées sur une plateforme combinant une main robotique XHand et un bras UR7e. Testé en boucle fermée sur robot réel, ReTouch dépasse la meilleure référence existante de 18,4 points de pourcentage en conditions standards et de 23,8 points en conditions difficiles, en taux de réussite moyen.

Ce résultat s'attaque à un angle mort connu des VLA actuels : la plupart des modèles de manipulation s'appuient surtout sur la vision et peinent à intégrer le retour tactile de façon exploitable en temps réel, alors que la manipulation fine (insertion, préhension d'objets déformables, ajustement de prise) dépend justement de ce signal. En démontrant qu'un raffinement tactile en boucle fermée améliore nettement la robustesse face aux erreurs d'exécution et aux changements de contact, les auteurs apportent un argument concret en faveur de l'intégration tactile native dans les architectures VLA, plutôt que comme un module accessoire ajouté après coup. Pour les intégrateurs et équipes de R&D en robotique dextre, cela suggère une voie pour réduire l'écart persistant entre démonstrations en laboratoire et fiabilité en conditions réelles, un problème récurrent pour les mains robotiques multi-doigts.

Le travail s'inscrit dans une lignée de recherche académique sur la fusion tactile pour la manipulation dextre, un domaine resté largement expérimental faute de jeux de données réels standardisés et de méthodes exploitant efficacement le signal tactile à haute fréquence. En publiant à la fois le modèle et XHT-Dataset, les auteurs positionnent ReTouch comme une base de comparaison pour de futurs travaux sur les mains robotiques dextres, sans toutefois annoncer de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, non d'un produit prêt à l'intégration.

À lire aussi

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle
1arXiv cs.RO 

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle

Les modèles Vision-Language-Action (VLA), qui pilotent la nouvelle génération de bras robotiques et d'humanoïdes, souffrent d'un défaut connu quand on y ajoute du tactile : le signal visuel, beaucoup plus riche en données, écrase systématiquement les informations de contact, un phénomène que les chercheurs appellent "l'effondrement de modalité". Une équipe propose ResTacVLA, une architecture publiée le 3 juillet 2026 sur arXiv (2607.03387), qui s'inspire du codage prédictif, un mécanisme neuronal par lequel le cerveau ignore ce qui est prévisible pour se concentrer sur l'inattendu. Au lieu d'injecter les données tactiles brutes dans le modèle, ResTacVLA calcule une "représentation tactile résiduelle" : l'écart entre ce que la vision laissait prévoir et ce que le capteur de contact ressent réellement. Ce résidu est ensuite compressé via un goulot d'étranglement à quantification vectorielle (VQ) en "primitives de contact latentes", puis injecté de façon adaptative dans le modèle, avec un gain renforcé précisément lorsque la vision devient incertaine ou obstruée. L'enjeu dépasse la prouesse technique. Pour les intégrateurs qui visent des tâches à fort contact physique, insertion de précision, assemblage, manipulation d'objets déformables ou glissants, le tactile est le signal qui distingue une démonstration en laboratoire d'un geste fiable en production. Or la plupart des VLA actuels traitent le tactile comme un flux secondaire noyé par la caméra. En démontrant qu'un filtrage inspiré de la neuroscience permet de rendre ce signal rare mais décisif exploitable sans le diluer, les auteurs répondent directement à l'un des angles morts récurrents des architectures multimodales pour la robotique manipulatrice, où l'ajout de capteurs supplémentaires improve rarement les performances sans repenser la fusion des modalités. Le travail reste à ce stade un article de recherche, sans affiliation industrielle citée dans le résumé ni déploiement annoncé : il s'agit d'un préprint arXiv, testé sur un ensemble de tâches de manipulation en contact selon les auteurs, avec une page de projet dédiée mais pas encore de publication en conférence confirmée. Il s'inscrit dans une dynamique plus large de recherche sur l'intégration tactile en apprentissage robotique, un axe que plusieurs laboratoires explorent en parallèle pour combler l'écart entre robots qui voient et robots qui, littéralement, sentent ce qu'ils touchent.

RecherchePaper
1 source
Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche
2arXiv cs.RO 

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche

Le capteur tactile reste le parent pauvre des politiques vision-langage-action (VLA) pour la manipulation robotique, alors que les phases de contact critiques (préhension, insertion, glissement) échappent souvent à la caméra. Une équipe de recherche propose dans un article publié sur arXiv (2607.14609) une méthode pour mieux exploiter le toucher: au lieu de prédire directement le signal tactile brut, souvent bruité, le système apprend à anticiper de futurs états tactiles à partir des représentations internes du modèle. Par une analyse en sonde linéaire (linear probe), les chercheurs montrent que ce sont les caractéristiques intermédiaires de l'expert en action, la partie du réseau qui traduit une décision en mouvement, qui prédisent le mieux l'état tactile futur, bien mieux que les couches de perception vision-langage ou que l'état d'action final. Sur cette base, ils introduisent le Latent Tactile Predictor (LTP), un module léger qui prédit des embeddings tactiles compacts à partir de cette couche intermédiaire plutôt que le signal tactile brut. Des expériences sur des tâches de manipulation réelles à fort contact confirment que cet alignement représentationnel surpasse les approches de prédiction tactile moins ciblées ou multi-interfaces. Cette contribution touche à un point sensible du secteur robotique: la plupart des politiques VLA actuelles (Pi-0, GR00T N2, Helix) reposent presque exclusivement sur la vision et le langage, avec un toucher traité comme un canal secondaire greffé après coup. Montrer qu'il existe un endroit précis, dans l'architecture, où la supervision tactile est réellement utile change la manière de concevoir ces modèles multimodaux: cela suggère que brancher un capteur tactile n'importe où dans le réseau, sans réflexion sur l'alignement des représentations, gaspille l'information. Pour les intégrateurs travaillant sur des tâches à contact fin, assemblage, insertion de connecteurs, manipulation d'objets déformables, c'est un signal que la robustesse ne viendra pas seulement de plus de données mais d'une meilleure architecture de fusion des modalités. Le travail s'inscrit dans la lignée des VLA tactiles apparus ces deux dernières années pour combler l'angle mort de la seule vision. L'article ne détaille pas de déploiement industriel ni de partenariat avec un fabricant de robots, il s'agit d'une contribution de recherche fondamentale destinée à orienter la conception des futures générations de politiques VLA plutôt qu'un produit prêt à l'emploi.

RechercheActu
1 source
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
3arXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée. L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées. L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source
VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches
4arXiv cs.RO 

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches

Des chercheurs présentent VT-WAM, un modèle de manipulation robotique combinant vision et toucher, décrit dans un article déposé sur arXiv (2607.02503v1) et accompagné d'un site dédié (vt-wam.github.io). Le système, un "Visual-Tactile World Action Model", apprend simultanément trois choses dans un même cadre de flow matching : prédire les images visuelles futures, prédire la déformation tactile future, et prédire l'action à exécuter. Deux mécanismes techniques soutiennent cette approche : une attention "Asymmetric Mixture-of-Transformers" (MoT) qui relie une première image de référence à la dynamique tactile dans le temps, et un module nommé AVTAG (Action-Visual-Tactile Attention Guidance) qui force le modèle à s'appuyer davantage sur le signal tactile pendant les phases de contact. Sur six tâches de manipulation en conditions réelles impliquant un contact physique important, VT-WAM atteint un taux de réussite moyen de 71,67%, contre des scores inférieurs de 26,67 points pour Fast-WAM et de 35,84 points pour OmniVTLA, deux modèles de référence utilisés en comparaison. L'enjeu dépasse la simple performance chiffrée : les politiques visuo-tactiles existantes se contentent généralement d'injecter le signal tactile brut dans la prédiction d'action, sans modéliser comment cette déformation évolue dans le temps. Or c'est précisément sur les tâches à fort contact (insertion, préhension d'objets déformables, gestion du glissement) que les modèles purement visuels ou de type VLA (vision-language-action) échouent le plus souvent, malgré des démonstrations impressionnantes en environnement contrôlé. Pour les intégrateurs industriels qui cherchent à automatiser des opérations d'assemblage fin, ce travail illustre une piste concrète pour combler l'écart entre démonstration et fiabilité réelle. Le papier s'inscrit dans la lignée des "world models" appliqués à la robotique, dont Fast-WAM constitue un prédécesseur direct servant de base de comparaison, aux côtés de familles de modèles VLA comme OmniVTLA. Il s'agit toutefois d'une publication académique, sans acteur industriel identifié ni date de déploiement annoncée : les résultats restent circonscrits à six tâches de laboratoire, et les auteurs eux-mêmes soulignent via leurs ablations que la modélisation de la dynamique tactile reste un problème ouvert plutôt qu'une solution définitivement close.

RecherchePaper
1 source