Aller au contenu principal
LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation
RecherchearXiv cs.RO 

LightTact : un capteur tactile-visuel de bout de doigt pour la détection de contact sans déformation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

LightTact est un capteur tactile-visuel de bout de doigt conçu pour détecter les contacts sans déformation mécanique de surface. Là où les capteurs conventionnels (GelSight du MIT, DIGIT de Meta, Tactip) s'appuient sur la déformation d'un élastomère pour inférer un contact, LightTact exploite une configuration optique à blocage de lumière ambiante: seule la lumière diffusée aux points de véritables contacts traverse le système, laissant les pixels non-contactés à une valeur de gris moyenne inférieure à 3 sur 255. Les images brutes produites sont à fort contraste, chaque zone de contact préservant l'apparence naturelle de la surface touchée. La robustesse annoncée couvre les variations de propriétés matérielles, de force de contact, d'apparence de surface et d'éclairage ambiant, sans calibration spécifique au matériau.

Ce verrou adresse un angle mort structurant de la manipulation robotique fine: les contacts dits "légers" avec des liquides, semi-liquides ou matériaux ultra-mous ne génèrent pas de déformation macroscopique et restent donc invisibles pour la plupart des capteurs actuels. LightTact démontre des comportements jusque-là difficiles à automatiser: étalement d'eau sur une surface, prélèvement de crème cosmétique, interaction avec des films minces souples. Pour les intégrateurs ciblant la cosmétique, l'agroalimentaire ou la manutention de produits fragiles, c'est un point de blocage technique levé. Fait significatif: les images visuelles et tactiles, spatialement alignées, sont directement interprétables par des vision-language models (VLMs), ce qui abaisse la barrière d'intégration avec les pipelines d'IA multimodaux sans couche de traitement intermédiaire dédiée.

Le travail est publié en préprint sur arXiv (référence 2512.20591, troisième version), ce qui le situe au stade de la recherche académique: aucun produit commercial ni déploiement industriel n'est annoncé. Dans le panorama des capteurs tactiles visuels, LightTact occupe une niche distincte de celle de GelSight et ses dérivés, ou des solutions capacitives comme Xela Robotics, qui ciblent des régimes de contact avec déformation mesurable. Du côté européen, Pollen Robotics ou Wandercraft ne proposent pas de capteur tactile propre à ce niveau de spécificité. Les prochaines étapes logiques incluent une validation en boucle fermée sur plateforme robotique réelle et un test de durabilité de la surface optique face à des matériaux agressifs en usage répété.

Impact France/UE

Aucun impact direct documenté à ce stade de préprint, mais les acteurs FR/EU ciblant la manipulation fine (Pollen Robotics, intégrateurs agroalimentaire/cosmétique) pourraient bénéficier de cette approche pour des contacts légers avec matériaux mous ou liquides.

À lire aussi

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
1arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
VTAP : combiner détection au bout des doigts et paume active visuo-tactile pour la manipulation dextérique en main
2arXiv cs.RO 

VTAP : combiner détection au bout des doigts et paume active visuo-tactile pour la manipulation dextérique en main

Une équipe de recherche présente le VTAP, un gripper robotique à trois doigts doté d'une paume visuo-tactile active combinée à des doigts compliants et reconfigurables équipés de capteurs tactiles matriciels. La paume actionnée associe localisation visuelle longue portée et retour tactile riche en contacts, ce qui étend nettement les capacités de manipulation par rapport aux pinces classiques. Pour piloter cette structure à trois doigts, différente de la main humaine, les chercheurs proposent un cadre de retargeting téléopérationnel par étapes, conditionné par gestes, traduisant les mouvements de la main d'un opérateur vers le gripper. Les expériences couvrent plusieurs tâches exigeantes : saisie réactive d'objets du jeu YCB et d'objets fragiles, réorientation en main d'une seringue avec actionnement du piston, séparation d'objets agglomérés jusqu'à 3 mm de diamètre, et insertion de type peg-in-hole guidée par vision et tact. Le papier est publié sur arXiv (2607.15448) avec une page projet dédiée. Cette démonstration intéresse directement les équipes de R&D en manipulation dextre, car elle contredit l'hypothèse selon laquelle une manipulation fine exige des mains anthropomorphiques à haut nombre de degrés de liberté. En combinant seulement trois doigts compliants et une paume active multimodale, l'équipe montre qu'une synergie structurée doigts-paume peut suffire pour des tâches de précision comme la manipulation d'objets millimétriques ou l'insertion guidée. Pour les industriels, l'architecture proposée sert surtout de référence pratique pour la conception de grippers et la collecte de données riches en contacts, un enjeu central pour entraîner des politiques de manipulation par apprentissage, qui manquent aujourd'hui de jeux de données tactiles à grande échelle. Ce travail s'inscrit dans la continuité des recherches sur les capteurs tactiles matriciels et la fusion vision-tact, un axe exploré par des laboratoires travaillant sur des mains tactiles ainsi que par des fabricants de mains anthropomorphiques à haut DOF comme Shadow Robot ou les mains humanoïdes de Tesla et Figure. Contrairement à ces approches privilégiant le nombre d'articulations, le VTAP mise sur la coordination doigts-paume et la perception multimodale plutôt que sur la complexité mécanique. Le projet ne mentionne pour l'instant aucun partenariat industriel ni calendrier de transfert commercial : il s'agit d'une preuve de concept en laboratoire destinée à informer la conception future de préhenseurs dextres et la collecte de données pour l'apprentissage robotique.

RecherchePaper
1 source
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
3arXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé. Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie. Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

RecherchePaper
1 source
Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile
4arXiv cs.RO 

Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile

Une équipe de recherche publie sur arXiv (réf. 2606.28899) YOTO, pour "You Only Touch Once", un système d'estimation de pose 6-DoF fondé exclusivement sur le toucher. Contrairement aux approches visuelles classiques, YOTO reconstruit la position et l'orientation complète d'un objet à partir d'une seule paire de contacts tactiles simultanés, sans nécessiter d'historique de manipulation. Chaque contact est modélisé comme un nuage de points 3D local, puis localisé sur la surface de l'objet par un réseau coarse-to-fine. Les deux contacts localisés, combinés aux poses calibrées des capteurs, alimentent un solveur SVD en forme fermée, conscient des normales de surface, qui restitue la pose 6-DoF en une seule passe. Le réseau est préentraîné sur des patches tactiles virtuels générés depuis le modèle 3D de l'objet, puis affiné avec un petit nombre de contacts réels, réduisant significativement les besoins en données terrain. Les expériences portent sur quatre objets aux géométries variées avec des capteurs GelSight, et incluent une évaluation comparative entre reconstructions issues de scans mobiles grand public et modèles CAO de référence. Ce travail s'attaque à un angle mort bien documenté de la manipulation robotique : les méthodes visuelles de pose estimation échouent systématiquement en cas d'occlusion, d'éclairage défavorable, ou face à des surfaces réfléchissantes et transparentes, conditions courantes en environnement industriel réel. L'approche à contact unique sans historique constitue un avantage pratique majeur, car elle élimine les séquences d'exploration multi-contacts et s'intègre dans des boucles de manipulation courtes. YOTO surpasse les baselines visuelles et géométriques testées dans les scénarios où la perception visuelle est dégradée. La compatibilité avec des scans mobiles plutôt que des modèles CAO précis abaisse la barrière d'intégration pour des objets non catalogués, un point non négligeable pour les intégrateurs industriels. L'estimation de pose par capteurs tactiles de type GelSight est un axe de recherche actif depuis les travaux pionniers du MIT et de l'entreprise éponyme GelSight Inc. Les méthodes antérieures nécessitaient généralement plusieurs contacts successifs ou un historique de manipulation pour converger ; YOTO rompt avec cette contrainte. Sur le plan compétitif, les pipelines visuels basés sur des modèles de fondation (MegaPose, FoundPose, benchmarks BOP) restent dominants en conditions nominales, mais leur robustesse aux surfaces dégradées est limitée, c'est précisément là que le toucher devient complémentaire. Le code, les modèles entraînés et le jeu de données GelSight seront publiés à l'acceptation de l'article. À ce stade, il s'agit d'un preprint arXiv sans déploiement annoncé ni partenaire industriel identifié.

RecherchePaper
1 source