Aller au contenu principal
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
RecherchearXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée.

L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées.

L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

À lire aussi

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
1arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
Un bout dextérique tactile durable pour la manipulation robotique
2arXiv cs.RO 

Un bout dextérique tactile durable pour la manipulation robotique

Une équipe de chercheurs décrit, dans une prépublication arXiv du 26 août 2026, un embout de doigt tactile robotique à vision conçu pour résister à l'usure, point faible connu des capteurs commerciaux. Il associe un gel de silicone souple, un film protecteur en polyuréthane thermoplastique (TPU) texturé et non pigmenté, et une cartouche de détection remplaçable. Deux tests accélérés ont mesuré sa durabilité : un ponçage sur tambour rotatif, et une sonde répétitive appliquant 39,2 N (4,0 kgf) à 45 cycles par minute. Le film protecteur du nouveau capteur a cédé après 2 à 3 heures de ponçage, tandis que les neuf exemplaires testés sous charge répétitive restaient tous fonctionnels à l'arrêt des essais : sept après 5 jours, un après 6 jours, un après 8 jours. Les capteurs commerciaux GelSight Mini et DIGIT, eux, ont vu leur film se rompre après seulement 24 à 30 secondes de ponçage et 25 à 35 minutes de charge répétitive. La dégradation du nouveau capteur restait progressive, sans gêner l'imagerie tactile. Cette amélioration de plus de deux ordres de grandeur, obtenue dans des conditions de vieillissement accéléré définies par les auteurs eux-mêmes, vise un angle mort de la manipulation robotique : les capteurs tactiles à vision comme GelSight ou DIGIT livrent une image de contact riche mais s'usent vite sous charges concentrées et frottements répétés, ce qui freine leur usage hors laboratoire. Pour les intégrateurs qui veulent faire passer la préhension robotisée de la démonstration au déploiement industriel, une cartouche remplaçable plutôt qu'un capteur à jeter pèse autant sur le coût total de possession que la résolution du signal tactile. Ces chiffres restent toutefois issus de protocoles de laboratoire propres à l'étude, et non d'une validation en usage prolongé sur un bras ou une main robotique en production. GelSight, issu de recherches du MIT, et DIGIT, le capteur tactile ouvert développé par Meta AI, sont devenus des références de facto pour la recherche en préhension et en manipulation fine ; l'usure rapide de leur film de silicone freine depuis longtemps leur adoption au-delà des bancs d'essai académiques, notamment pour des tâches répétitives de tri ou d'assemblage visées par les mains robotiques humanoïdes actuellement en développement. La prépublication ne mentionne aucun partenariat industriel ni calendrier de commercialisation : il s'agit à ce stade d'une validation en laboratoire, dont la suite logique serait un essai en conditions réelles sur un bras ou une main robotique en fonctionnement continu, avant toute intégration dans un produit commercial.

RecherchePaper
1 source
DepthWorld : un modèle du monde 3D pour la manipulation robotique
3arXiv cs.RO 

DepthWorld : un modèle du monde 3D pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.08780) DepthWorld, un modèle du monde 3D destiné à la manipulation robotique, accompagné d'un jeu de données calibré, DROID-3D. Le point de départ est un constat : les modèles du monde vidéo actuels, entraînés uniquement sur du RGB, produisent des séquences plausibles image par image, mais qui ne forment pas un monde 3D cohérent. Pour y remédier, l'équipe a conçu un pipeline de calibration qui combine une estimation de profondeur stéréo apprise et un graphe de facteurs joint. Il regroupe tous les épisodes enregistrés avec un même robot physique afin de retrouver ses paramètres cinématiques partagés, en plus des extrinsèques propres à chaque scène. Appliqué à DROID, il produit DROID-3D : une profondeur métrique dense et des extrinsèques multi-vues recalibrées, avec une erreur de reprojection inférieure à 0,7 pixel sur 90 % des épisodes pour les caméras externes. Le modèle DepthWorld, bâti sur Stable Video Diffusion, prédit conjointement le RGB et la profondeur sur plusieurs vues grâce à un « tuilage latent spatial » (spatial latent tiling), qui laisse intact l'autoencodeur variationnel (VAE) pré-entraîné. À budget d'entraînement égal, la supervision par la profondeur améliore la prédiction RGB de 1,48 dB de PSNR par rapport à une base identique entraînée sur RGB seul, tout en fournissant une profondeur métrique exploitable. Ces résultats comptent pour les équipes qui voient dans les modèles du monde une alternative pilotée par les données aux simulateurs classiques, pour l'évaluation, l'amélioration et la planification de politiques. Toutes ces utilisations supposent une géométrie fidèle. Un rollout visuellement convaincant mais géométriquement incohérent peut fausser l'évaluation d'une politique de préhension ou une planification de trajectoire. L'apport de la profondeur à la qualité du RGB lui-même suggère que la supervision 3D ne se limite pas à ajouter une sortie : elle renforce la prédiction visuelle. Le choix de ne pas toucher au VAE préserve les connaissances a priori des modèles vidéo pré-entraînés, ce qui évite de ré-entraîner à grande échelle. Pour les intégrateurs, l'enjeu à terme est de disposer d'un banc d'essai virtuel plus fiable avant de passer sur matériel réel. Il faut toutefois rester prudent : il s'agit d'un préprint, sans évaluation en boucle fermée sur des robots réels dans les éléments communiqués, et un gain de 1,48 dB de PSNR ne prouve pas à lui seul une meilleure réussite des tâches. Le contexte est celui d'une course pour remplacer ou compléter la simulation physique par des modèles génératifs, nourrie par de grands jeux de données de téléopération comme DROID. Ces corpus sont riches en vidéo, mais leur calibration de caméras est souvent approximative et la profondeur métrique y est absente, ce qui a limité jusqu'ici la supervision 3D à grande échelle en manipulation. DROID-3D comble en partie ce manque. L'approche s'inscrit dans le courant des modèles du monde vidéo adaptés à la robotique, qui s'appuient sur des modèles de diffusion vidéo généralistes. La suite logique serait de tester si ces rollouts géométriquement cohérents améliorent réellement l'évaluation et l'amélioration de politiques VLA, puis de les valider sur des plateformes variées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne
4arXiv cs.RO 

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne

ReTouch est un modèle vision-langage-action (VLA) conçu pour la manipulation dextre en contact riche, présenté dans un article publié le 1er août 2026 sur arXiv (arXiv:2608.01824v1). Le système s'appuie sur deux innovations principales : un Tactile-Patch Encoder qui représente les signaux tactiles sous forme de patches structurés préservant l'identité de chaque doigt et la structure locale du contact, et un module d'action haute fréquence qui prédit conjointement les états tactiles futurs et des blocs d'actions, en les affinant en continu grâce au retour tactile pendant l'exécution. Les chercheurs ont aussi construit XHT-Dataset, un jeu de données de 900 démonstrations réelles couvrant sept tâches de manipulation en contact riche, collectées sur une plateforme combinant une main robotique XHand et un bras UR7e. Testé en boucle fermée sur robot réel, ReTouch dépasse la meilleure référence existante de 18,4 points de pourcentage en conditions standards et de 23,8 points en conditions difficiles, en taux de réussite moyen. Ce résultat s'attaque à un angle mort connu des VLA actuels : la plupart des modèles de manipulation s'appuient surtout sur la vision et peinent à intégrer le retour tactile de façon exploitable en temps réel, alors que la manipulation fine (insertion, préhension d'objets déformables, ajustement de prise) dépend justement de ce signal. En démontrant qu'un raffinement tactile en boucle fermée améliore nettement la robustesse face aux erreurs d'exécution et aux changements de contact, les auteurs apportent un argument concret en faveur de l'intégration tactile native dans les architectures VLA, plutôt que comme un module accessoire ajouté après coup. Pour les intégrateurs et équipes de R&D en robotique dextre, cela suggère une voie pour réduire l'écart persistant entre démonstrations en laboratoire et fiabilité en conditions réelles, un problème récurrent pour les mains robotiques multi-doigts. Le travail s'inscrit dans une lignée de recherche académique sur la fusion tactile pour la manipulation dextre, un domaine resté largement expérimental faute de jeux de données réels standardisés et de méthodes exploitant efficacement le signal tactile à haute fréquence. En publiant à la fois le modèle et XHT-Dataset, les auteurs positionnent ReTouch comme une base de comparaison pour de futurs travaux sur les mains robotiques dextres, sans toutefois annoncer de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, non d'un produit prêt à l'intégration.

RechercheActu
1 source