Aller au contenu principal
RecherchearXiv cs.RO 

TACIT : la supervision par contact tactile guide l'attention spatiale en manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie TACIT (Tactile Contact Informs Attention), une méthode qui utilise les contacts tactiles mesurés pendant des démonstrations téléopérées pour superviser l'attention spatiale de politiques visuomotrices de manipulation, sans annotation de points supplémentaire. Décrite dans un article déposé sur arXiv (2609.24507v1), la méthode place des cibles gaussiennes sur les nuages de points de caméra précédant le contact pour entraîner une tête d'attention, dont la sortie agrégée conditionne une politique de diffusion visuotactile ; ces cibles ne servent qu'à l'entraînement, le signal tactile restant une entrée au moment de l'inférence. Sur le banc d'essai principal, avec dix démonstrations par tâche et cinq zones de placement différentes, TACIT atteint 66,7% de réussite sur une tâche de placement de balle et 73,3% sur une tâche d'insertion de goupille, contre respectivement 10,0% et 20,0% pour une fusion visuotactile 3D à entrées équivalentes, et 20,0% et 43,3% pour la politique vision seule DP3. Sur les 30 essais de chaque tâche, TACIT atteint systématiquement la zone d'approche à 150 mm de l'objet en moins de 12 secondes, tous les échecs restants survenant après cette arrivée.

Ce résultat cible un problème connu de l'apprentissage par imitation à partir de peu de démonstrations : les politiques entraînées sur un faible nombre d'exemples ont tendance à rejouer des trajectoires figées plutôt qu'à suivre réellement la position changeante des objets. En s'appuyant sur un signal déjà présent dans les données de téléopération plutôt que sur des annotations humaines ou des modèles de vision externes pour définir les priors spatiaux, TACIT réduit le coût de collecte de données pour les intégrateurs travaillant sur des piles de manipulation few-shot. Le fait que les échecs surviennent après l'arrivée sur zone, et non pendant l'approche, indique que la méthode résout spécifiquement le ciblage spatial, pas la saisie ou la manipulation fine elle-même.

L'étude s'inscrit dans le champ des politiques de diffusion et de l'apprentissage visuomoteur par imitation, confronté à la généralisation à partir de peu de démonstrations. Les comparaisons incluent DP3, une politique de diffusion 3D vision seule, une fusion visuotactile à entrées équivalentes, et un contrôle à architecture identique sans supervision d'attention explicite, afin d'isoler la contribution propre du signal tactile. Les tests, menés sur robot réel pour la tâche de balle et en simulation pour l'insertion de goupille sur trois graines d'entraînement, restent un travail de recherche académique sans déploiement commercial ni plateforme nommée, les auteurs limitant eux-mêmes leurs conclusions à l'espace de travail évalué.

Dans nos dossiers

À lire aussi

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
1arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source
ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne
2arXiv cs.RO 

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne

ReTouch est un modèle vision-langage-action (VLA) conçu pour la manipulation dextre en contact riche, présenté dans un article publié le 1er août 2026 sur arXiv (arXiv:2608.01824v1). Le système s'appuie sur deux innovations principales : un Tactile-Patch Encoder qui représente les signaux tactiles sous forme de patches structurés préservant l'identité de chaque doigt et la structure locale du contact, et un module d'action haute fréquence qui prédit conjointement les états tactiles futurs et des blocs d'actions, en les affinant en continu grâce au retour tactile pendant l'exécution. Les chercheurs ont aussi construit XHT-Dataset, un jeu de données de 900 démonstrations réelles couvrant sept tâches de manipulation en contact riche, collectées sur une plateforme combinant une main robotique XHand et un bras UR7e. Testé en boucle fermée sur robot réel, ReTouch dépasse la meilleure référence existante de 18,4 points de pourcentage en conditions standards et de 23,8 points en conditions difficiles, en taux de réussite moyen. Ce résultat s'attaque à un angle mort connu des VLA actuels : la plupart des modèles de manipulation s'appuient surtout sur la vision et peinent à intégrer le retour tactile de façon exploitable en temps réel, alors que la manipulation fine (insertion, préhension d'objets déformables, ajustement de prise) dépend justement de ce signal. En démontrant qu'un raffinement tactile en boucle fermée améliore nettement la robustesse face aux erreurs d'exécution et aux changements de contact, les auteurs apportent un argument concret en faveur de l'intégration tactile native dans les architectures VLA, plutôt que comme un module accessoire ajouté après coup. Pour les intégrateurs et équipes de R&D en robotique dextre, cela suggère une voie pour réduire l'écart persistant entre démonstrations en laboratoire et fiabilité en conditions réelles, un problème récurrent pour les mains robotiques multi-doigts. Le travail s'inscrit dans une lignée de recherche académique sur la fusion tactile pour la manipulation dextre, un domaine resté largement expérimental faute de jeux de données réels standardisés et de méthodes exploitant efficacement le signal tactile à haute fréquence. En publiant à la fois le modèle et XHT-Dataset, les auteurs positionnent ReTouch comme une base de comparaison pour de futurs travaux sur les mains robotiques dextres, sans toutefois annoncer de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, non d'un produit prêt à l'intégration.

RechercheActu
1 source
ContactExplorer : exploration guidée par contacts pour la manipulation dextérique polyvalente
3arXiv cs.RO 

ContactExplorer : exploration guidée par contacts pour la manipulation dextérique polyvalente

Des chercheurs ont publié sur arXiv (identifiant 2603.10971v2) ContactExplorer, une méthode d'exploration par apprentissage par renforcement conçue pour les tâches de manipulation dextère avec des mains robotiques multi-doigts. Le principe central est de représenter le contact comme l'intersection géométrique entre les points de surface d'un objet et les points-clés de la main, ce qui permet au système de découvrir automatiquement quels doigts interagissent avec quelles régions d'un objet. ContactExplorer maintient un compteur de contacts conditionné sur des états d'objet discrétisés obtenus via des codes de hachage appris (hash codes), traçant la fréquence à laquelle chaque doigt explore chaque région de surface. Ce compteur est exploité selon deux mécanismes complémentaires : une récompense de couverture de contact basée sur le décompte, qui pousse l'agent vers des patterns de contact inédits, et une récompense d'atteinte à base d'énergie (energy-based reaching reward), qui guide la main vers les zones encore sous-explorées. L'intérêt de cette approche réside dans un problème structurel de la manipulation dextère : contrairement à la navigation ou à la locomotion, où l'exploration par nouveauté d'état suffit souvent, la manipulation physique fine exige des interactions contact riches et stables, que les signaux de nouveauté classiques gèrent mal (instabilité du signal de contact, inefficacité des signaux de distance, dépendance aux a priori spécifiques à la tâche). Les résultats expérimentaux sur un ensemble diversifié de tâches montrent que ContactExplorer améliore substantiellement l'efficacité d'échantillonnage et les taux de succès par rapport aux méthodes d'exploration existantes. Surtout, les patterns de contact appris en simulation se transfèrent de manière robuste au monde réel, ce qui est une validation non triviale du sim-to-real dans un domaine où ce gap reste un obstacle majeur. Ce travail s'inscrit dans un effort de recherche plus large visant à rendre l'exploration en RL agnostique aux tâches pour la manipulation dextère, un domaine où des équipes comme DeepMind (OpenAI Dactyl, 2019), Stanford, CMU et Berkeley ont accumulé des travaux fondateurs. ContactExplorer se distingue par son absence de priors spécifiques à la tâche, un point fort pour la généralisation. Publié sous forme de preprint arXiv (version 2, donc révisé), le travail n'a pas encore franchi le stade de la revue par les pairs ; une page projet est disponible à contact-explorer.github.io, mais aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source
ZeroTouch : estimation visuelle du contact supervisée par le tactile pour la manipulation riche en contacts
4arXiv cs.RO 

ZeroTouch : estimation visuelle du contact supervisée par le tactile pour la manipulation riche en contacts

Des chercheurs publient ZeroTouch, un système de préhension robotique qui prédit la déformation de contact, le torseur d'effort à six axes et une cible de compression optimale à partir de la seule vision embarquée au poignet, de l'état de la pince et de la direction de la gravité locale, sans capteur tactile physique au moment de l'exécution. Décrit dans un article déposé sur arXiv (2609.21726v1), le modèle est entraîné avec des mesures tactiles réelles comme supervision privilégiée, puis s'en passe totalement en déploiement. Sur l'ensemble de validation complet, l'erreur moyenne de force normale chute de 2,017 N pour une base de référence n'utilisant que l'état du système à 0,531 N avec l'architecture complète. En évaluation physique, avec vingt essais par condition, ZeroTouch atteint 95% de réussite sur un objet inédit, 80% sur une combinaison objet connu et prise inédite, et 90% en cas de changement de contenu ou de charge. Sous le même protocole, deux modèles génération vision-langage-action de référence, OpenVLA et SmolVLA, plafonnent respectivement à 25%, 40% et 55%, puis 10%, 25% et 35%. L'écart de performance, jusqu'à quatre fois supérieur à OpenVLA sur certaines conditions, pointe une limite concrète des politiques VLA généralistes actuelles: la régulation fine de la force de préhension et de la compression reste un point faible, alors qu'elle conditionne la manipulation d'objets fragiles ou déformables en logistique et en industrie. L'intérêt de ZeroTouch tient surtout à son architecture: transférer l'information tactile en phase d'entraînement seulement supprime la dépendance à un matériel dédié coûteux et fragile au déploiement, ce qui simplifie l'intégration sur des bras ou des mains déjà équipés d'une simple caméra poignet. Ces résultats restent toutefois issus d'un cadre de laboratoire, avec seulement vingt essais par condition et sans validation industrielle annoncée. Le problème de la régulation de force sans capteur tactile dédié touche l'ensemble des approches VLA récentes, de Pi-0 à GR00T N2 en passant par Helix, qui s'appuient historiquement sur des capteurs tactiles embarqués type GelSight pour ce type de retour. ZeroTouch s'inscrit dans une tendance plus large consistant à utiliser le tactile comme professeur à l'entraînement plutôt que comme dépendance matérielle permanente. L'article ne précise ni laboratoire ni feuille de route produit, et reste à ce stade une contribution de recherche publiée sans revue par les pairs.

RecherchePaper
1 source