Aller au contenu principal
Apprentissage visuo-tactile temporel pour la stabilité de la saisie dextérique
RecherchearXiv cs.RO 

Apprentissage visuo-tactile temporel pour la stabilité de la saisie dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire LASR ont publié sur arXiv (2610.10283) une étude sur la prédiction de la stabilité de préhension avec une main robotique multi-doigts équipée de quatre capteurs tactiles Digit 360. Le jeu de données couvre 10 000 essais de préhension sur 200 objets. Chaque essai enregistre en continu la vision externe, la proprioception et les flux tactiles. Sur cette base, l'équipe a entraîné des modèles multimodaux temporels de bout en bout. Ils prédisent si l'objet reste stable après le levage, à partir des seules observations précédant le levage. Plusieurs modalités et plusieurs architectures d'encodage ont été comparées. Le prédicteur a ensuite servi de filtre de stabilité en ligne sur le robot réel : il autorise ou refuse le levage, et déclenche une nouvelle préhension si besoin. Avec ce filtre visuo-tactile, le taux de réussite parmi les levages exécutés progresse de 10,5 points de pourcentage par rapport à un filtre sans toucher. Le jeu de données est publié en accès libre.

Ce travail documente quantitativement un point que le secteur admet souvent sans le mesurer : pour les mains dextres, la vision seule ne suffit pas à juger une prise. Les ablations contrôlées indiquent que le gain vient surtout de la haute résolution et de la dynamique du signal tactile, et pas seulement de la présence d'un capteur. Les modèles n'utilisent aucune modélisation explicite des contacts ni des forces. Cela suggère une voie pilotée par les données, plus simple à étendre que les approches analytiques, y compris pour les intégrateurs qui doivent manipuler des objets variés. Il faut toutefois relativiser. Le gain de 10,5 points est mesuré parmi les levages effectivement exécutés, donc après filtrage, ce qui n'est pas équivalent à un taux de réussite global. L'expérience est menée en laboratoire, sur un seul type de main et de capteur, sans temps de cycle ni coût communiqués. Les capteurs Digit 360 restent des dispositifs de recherche, loin d'une industrialisation. Un jeu de données de 10 000 essais reste modeste face aux corpus des modèles VLA généralistes.

Le contexte est celui d'une littérature de préhension dominée par la sélection de prises par vision avec des pinces parallèles, alors que l'humain atteint des taux de réussite proches de 100 % grâce au toucher des bouts de doigts. Le Digit 360 est un capteur tactile à haute résolution issu de l'écosystème de recherche de Meta, dans la lignée des capteurs optiques de type GelSight. Il est ici testé sur une main multi-doigts. La suite logique serait d'intégrer ces signaux tactiles temporels dans des politiques de manipulation complètes, y compris des modèles VLA, et pas seulement dans un filtre de stabilité. L'ouverture du jeu de données devrait permettre à d'autres équipes de comparer leurs architectures et leurs capteurs. Aucun pilote industriel ni calendrier de transfert n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action
1arXiv cs.RO 

STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action

Des chercheurs ont publié le 12 septembre 2026 sur arXiv (2609.12549) STAR, un système d'apprentissage pour modèles vision-tactile-langage-action destinés à la manipulation dextre bimanuelle. L'équipe a construit une plateforme robotique et un dispositif de téléopération pour collecter 200 heures de données, soit 10 576 trajectoires réparties sur 65 tâches, dont 69,5 % impliquent une manipulation multi-doigts fine, chaque séquence étant annotée simultanément en vision, tactile et langage. STAR combine trois mécanismes pour compenser la rareté spatiale, temporelle et informationnelle des signaux tactiles : un pré-entraînement conjoint visuel-tactile, une représentation par jetons tactiles globaux épars, et une prédiction tactile future éparse. Après entraînement sur ce corpus, puis un post-entraînement léger de seulement 100 trajectoires par tâche, le modèle atteint un taux de réussite moyen de 61 % sur quatre tâches réelles. Ce résultat s'attaque à un goulot d'étranglement connu des modèles vision-langage-action (VLA) : le signal tactile, clairsemé par nature, est souvent négligé au profit de la seule combinaison vision-langage, ce qui limite la finesse de manipulation. Démontrer qu'un post-entraînement de 100 démonstrations par tâche suffit à dépasser 60 % de réussite renforce l'idée qu'une intégration tactile native, plutôt qu'ajoutée après coup, améliore la généralisation des politiques robotiques. Pour les intégrateurs en robotique humanoïde et en préhension industrielle, cela ouvre une piste concrète pour réduire le coût de collecte de données réelles, souvent le vrai frein au passage du laboratoire au terrain. Le chiffre de 61 % reste toutefois à confirmer sur des objets et environnements non vus, les quatre tâches testées ayant été sélectionnées par les auteurs eux-mêmes. STAR s'inscrit dans une recherche croissante visant à doter les modèles VLA d'un véritable retour tactile, alors que des systèmes de référence du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, reposent surtout sur la coordination vision-langage sans exploiter systématiquement le toucher. La rareté des jeux de données vision-tactile-langage synchronisés à grande échelle explique en partie pourquoi peu d'acteurs disposent d'un corpus comparable aux 10 576 trajectoires réunies ici. Publié comme préprint sans affiliation industrielle revendiquée ni calendrier de déploiement, STAR reste à ce stade une contribution de recherche. La communauté attendra probablement la publication du code et du jeu de données, ainsi que des comparaisons directes avec d'autres architectures tactiles en cours de développement.

RechercheActu
1 source
Préhension dextérique sans vision par apprentissage tactile Real2Sim2Real
2arXiv cs.RO 

Préhension dextérique sans vision par apprentissage tactile Real2Sim2Real

Des chercheurs ont publié en juin 2026 sur arXiv (réf. 2606.11767) un framework Real2Sim2Real pour la saisie aveugle par main dextre, sans aucune entrée visuelle, en s'appuyant exclusivement sur des capteurs tactiles distribués. Déployé sur une LEAP Hand quatre-doigts équipée de capteurs tactiles sur chaque phalange, le système atteint 27 % de taux de succès en conditions réelles sur 20 objets (10 vus à l'entraînement, 10 inédits), sans démonstration humaine ni caméra. L'architecture combine trois composants : un pipeline de calibration Real2Sim construisant un simulateur jumeau numérique fidèle aux signaux tactiles physiques ; un encodeur tactile layout-aware intégrant la géométrie des capteurs via préentraînement auto-supervisé, pour compenser la faible expressivité des signaux épars ; et une Diffusion Policy agrégant les trajectoires réussies d'experts en apprentissage par renforcement, spécialisés par objet dans le simulateur calibré. Le 27 % de taux de succès reste modeste opérationnellement, mais l'enjeu réel est la fermeture du tactile sim-to-real gap, l'un des obstacles les plus tenaces à la généralisation des mains dextres hors laboratoire. La plupart des systèmes antérieurs substituent la vision au toucher ou se limitent à des capteurs de force simples. Ici, la calibration contact-level du simulateur permet d'entraîner des politiques qui transfèrent sur le hardware sans fine-tuning en monde réel, résultat que les ablations confirment sur la cohérence des événements de contact sim-à-hardware. Pour un intégrateur ou un responsable industriel, c'est une preuve de concept que la manipulation en environnement occlus ou non éclairé devient accessible via simulation, sans collecter de données réelles coûteuses. Ce travail s'inscrit dans un écosystème en rapide structuration autour de la manipulation tactile dextre. La LEAP Hand, développée à Carnegie Mellon et commercialisée à bas coût pour la recherche, est devenu un banc de test de référence dans ce domaine. La Diffusion Policy, popularisée par Columbia University dès 2023, continue de s'imposer comme backbone standard pour l'imitation learning dextre. L'écosystème de capteurs reste fragmenté entre XELA Robotics, GelSight et diverses peaux tactiles propriétaires. Aucun partenaire industriel ni déploiement en production n'est annoncé, positionnant clairement ce preprint comme contribution académique ; les prochaines étapes probables passent par une taxonomie d'objets plus large et une densité de capteurs accrue pour dépasser ce premier seuil de 27 %.

RecherchePaper
1 source
ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile
3arXiv cs.RO 

ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile

Une équipe de chercheurs a publié en juin 2025 ViTacFormer, une architecture d'apprentissage de représentations multi-modales pour la manipulation dextre robotique. Le système couple un encodeur cross-attention fusionnant vision haute résolution et données tactiles avec une tête de prédiction autoregressive des signaux de contact futurs, entraîné selon un curriculum progressif allant des tâches simples aux plus complexes. La représentation apprise pilote un module d'imitation learning pour des mains anthropomorphes multi-doigts. Sur des benchmarks réels en laboratoire, ViTacFormer dépasse les systèmes état de l'art précédents d'environ 50 %, enchaîne jusqu'à 11 étapes séquentielles sans intervention humaine et maintient une opération continue de 2,5 minutes sur des tâches de manipulation de précision. L'architecture répond à un verrou concret de la manipulation fine : les occlusions visuelles rendent la vision seule insuffisante lorsque la main cache l'objet, un problème que les capteurs tactiles résolvent mais que peu de systèmes intègrent de façon apprenante. La prédiction anticipée des contacts plutôt que leur simple détection réactive réduit la latence de contrôle, décisive pour les gestes de précision. La capacité à enchaîner 11 sous-tâches ouvre une voie pour l'assemblage multi-étapes industriel, où les robots classiques nécessitent actuellement une programmation explicite à chaque étape. Ces résultats restent cependant des benchmarks de laboratoire contrôlés ; la distance avec un déploiement en ligne de production réelle, où la variabilité des pièces et la robustesse du capteur tactile dans le temps sont critiques, demeure entière. ViTacFormer s'inscrit dans une vague de travaux combinant modèles VLA (Vision-Language-Action) et retour haptique, explorée également par Google DeepMind (Robotic Transformer), Physical Intelligence (Pi-0) et des startups comme Dexterous AI. Côté matériel, la dépendance aux mains anthropomorphes multi-doigts reste un frein à la commercialisation : Shadow Robot (UK) et Inspire-Robots (CN) dominent ce segment, mais à des coûts et avec une fiabilité mécanique qui limitent encore les déploiements industriels à grande échelle. Le travail est publié sous forme de preprint arXiv (arXiv:2506.15953), sans code ni dataset public annoncé à ce stade ; la transition vers des résultats reproductibles et des pilotes hors laboratoire constitue l'étape critique à surveiller.

RechercheOpinion
1 source
Touch2Trace : apprentissage par imitation tactile pour le traçage dextérique de câbles
4arXiv cs.RO 

Touch2Trace : apprentissage par imitation tactile pour le traçage dextérique de câbles

Une équipe de recherche présente Touch2Trace, un système d'apprentissage par imitation piloté par le toucher, conçu pour l'une des tâches les plus difficiles de la manipulation dextre : faire glisser un câble à travers la main par des mouvements répétés de pincement et d'enroulement du pouce et de l'index. Le système combine un encodeur tactile pré-entraîné en auto-supervision pour un capteur piézorésistif personnalisé de 32x32 points, baptisé TacV5, avec une politique transformeur légère entraînée par clonage comportemental à partir de démonstrations téléopérées, déployée à 60 Hz sur une main robotique à cinq doigts Tesollo DG-5F. Selon l'article déposé sur arXiv (2609.15921), le retour tactile seul, sans vision ni estimation explicite de l'état du câble, améliore radicalement les performances par rapport à une base proprioceptive seule : la distance moyenne de câble tracée avant échec passe de 0,2 cm à 20,1 cm et le taux de réussite de 0% à 93%, avec un transfert zero-shot vers des câbles et des configurations de routage inédits. Ce travail fournit, d'après les auteurs, la première caractérisation systématique en conditions réelles de l'effet de paramètres clés (pré-entraînement de l'encodeur, fréquence de contrôle, contexte temporel, résolution spatiale) sur la performance d'une politique tactile. L'enjeu dépasse le laboratoire : la démonstration contredit l'hypothèse répandue selon laquelle la manipulation fine d'objets déformables comme les câbles exige une vision ou une modélisation explicite de leur état, un point direct pour l'assemblage de faisceaux électriques, le câblage industriel et l'automatisation en électronique. Elle donne aussi un signal concret aux fabricants de mains robotiques dextres et aux intégrateurs qui arbitrent entre coût et pertinence des modalités de capteurs pour des tâches de préhension fine, en montrant qu'une architecture purement tactile peut suffire là où des pipelines vision plus complexes sont souvent supposés nécessaires. Le projet s'inscrit dans la lignée des recherches sur la manipulation dextre assistée par capteurs tactiles haute résolution, un domaine où les progrès restaient jusqu'ici bridés par le manque de capteurs assez denses et de politiques capables d'exploiter leur signal en temps réel. À la différence des approches vision-langage-action comme Pi-0 ou GR00T N2, qui s'appuient sur des flux visuels et un raisonnement multimodal, Touch2Trace repose entièrement sur le signal brut du TacV5, un capteur développé en interne pour ce cas d'usage. Il s'agit à ce stade d'une préimpression de recherche, sans annonce de déploiement industriel ni de partenariat commercial ; les auteurs la présentent comme une référence quantitative pour la conception future de systèmes tactiles dextres, ouvrant la voie à des essais sur des tâches de manipulation déformable plus variées.

RecherchePaper
1 source