Aller au contenu principal
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
RecherchearXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé.

Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie.

Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

Dans nos dossiers

À lire aussi

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables
1arXiv cs.RO 

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables

SoftVTBench, jeu de données visuo-tactile pour la manipulation d'objets déformables, a été publié le 20 août 2026 sur arXiv (2608.18701). Il réunit 4 000 démonstrations expertes sur plus de 50 objets, dont des objets déformables volumétriques et leurs jumeaux rigides visuellement identiques. À 20 Hz, chaque épisode synchronise RGB multi-vues, capteurs tactiles RGB, suivi de marqueurs sur les deux doigts du gripper, proprioception, instructions en langage naturel, actions de préhension, et des états de référence par éléments finis (FEM) réservés à l'évaluation. Le benchmark associé introduit le Deformation-aware Success Rate (DSR), qui ne valide un essai que si la tâche réussit sans dépasser une tolérance de déformation calibrée par objet. Sur Diffusion Policy, π0.5 et FastWAM, les 12 configurations testées comptent toutes des succès classiques qui violent en réalité cette tolérance, dans 0,7% à 24% des cas. Sous changement de distribution, les versions avec toucher font mieux en réussite (six comparaisons sur six) et en DSR (cinq sur six), un avantage plus incertain en distribution. Le message clé pour l'industrie: un taux de réussite binaire masque des comportements physiquement problématiques, glissement ou compression excessive, un enjeu direct pour les intégrateurs manipulant des produits fragiles (agroalimentaire, textile, emballage, médical). Plus notable, ajouter des capteurs tactiles n'améliore pas automatiquement la manipulation: le gain n'est net que sous changement de distribution, signe que la fusion visuo-tactile reste un problème d'ingénierie non résolu plutôt qu'un simple avantage matériel. Cela nuance le discours courant sur les architectures vision-langage-action, où le toucher est souvent présenté comme un bonus de robustesse automatique. L'absence de jeux de données associant observations exploitables par une politique et vérité terrain physique indépendante était jusque-là le principal obstacle à une évaluation fine de l'interaction, la plupart des benchmarks existants se limitant à un succès binaire de tâche. SoftVTBench se positionne comme ressource commune pour étudier non seulement si une politique réussit, mais comment elle interagit physiquement avec un objet mou et quand le toucher améliore réellement cette interaction. Il s'agit d'une publication de recherche, sans annonce de déploiement industriel ni partenariat constructeur, et sans acteur français ou européen identifié dans cette étude.

RecherchePaper
1 source
DARP : un jeu de données bimanuel calibré RGB-D-IR pour la perception robotique multi-vues
2arXiv cs.RO 

DARP : un jeu de données bimanuel calibré RGB-D-IR pour la perception robotique multi-vues

Le dataset publié sur arXiv (2608.31002v1) présente DARP (Dual-Arm Robotic Perception), un jeu de données calibré RGB-D-infrarouge issu de deux bras manipulateurs indépendants, chacun équipé d'une caméra Intel RealSense en configuration eye-in-hand, placés de part et d'autre d'un même plan de travail. Dix objets de table, sans pose fixe ni marqueur, ont été capturés via un protocole entièrement automatisé : localisation automatique, confirmation croisée entre les deux bras, génération adaptative de points de vue et enregistrement continu RGB, profondeur et infrarouge stéréo synchronisé avec les états articulaires des robots. Un pipeline de fusion multi-vues déterministe, sans complétion apprise ni générative, convertit ces observations calibrées en nuages de points et maillages de surface mesurés ; sur 224 images-clés de test et 1,56 million de points 3D, la distance médiane point-maillage atteint 2,13 mm (RMSE de 4,04 mm), avec 96,56% des points situés à moins de 10 mm de la surface mesurée. Le jeu de données est publié en libre accès sur IEEE DataPort, sous le DOI 10.21227/rmv3-be47. La perception à partir d'un point de vue unique souffre d'auto-occlusions et d'une visibilité incomplète des surfaces, un frein connu pour la manipulation fine, le bin-picking ou l'assemblage collaboratif. En combinant deux bras mobiles plutôt qu'un rig de caméras fixes, DARP fournit un cadre calibré permettant d'évaluer objectivement des algorithmes de fusion multi-vues, de perception active et de raisonnement sur des observations partielles, sans recourir à des vidéos sélectionnées ou des métriques qualitatives. Les résultats millimétriques annoncés valident surtout la précision du pipeline de calibration et de reconstruction géométrique lui-même, et non une capacité de manipulation en conditions réelles : il s'agit d'une brique d'infrastructure de recherche reproductible, utile aux laboratoires travaillant sur la perception bi-manuelle ou collaborative, un terrain encore dominé par des configurations mono-bras. Les caméras montées au poignet sont courantes en robotique manipulatrice, mais la plupart des jeux de données existants, qu'il s'agisse de rigs fixes ou de capteurs mono-bras, ne capturent pas la complémentarité géométrique d'une observation bi-manuelle synchronisée et libre de toute contrainte de pose. DARP se positionne comme une alternative en ciblant spécifiquement la reconstruction collaborative par deux agents mobiles indépendants, sans marqueurs ni positions imposées aux objets. Aucun acteur industriel n'est associé à cette publication, de nature purement académique ; les auteurs présentent DARP comme une ressource réutilisable pour de futurs travaux de reconstruction multi-vues, de fusion multimodale et d'apprentissage sur des observations partielles d'objets, sans calendrier de suivi ni déploiement industriel annoncé à ce stade.

RecherchePaper
1 source
Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles
3arXiv cs.RO 

Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles

Des chercheurs ont publié sur arXiv (arXiv:2606.25886, juin 2026) un jeu de données ouvert de textures imprimables en 3D, conçu spécifiquement pour évaluer et comparer les capteurs tactiles de manière reproductible. Le dataset comprend six motifs de surface générés paramétriquement à partir de combinaisons de fonctions sinusoïdales et de séries de Fourier, offrant une variation contrôlée en fréquence spatiale, amplitude et structure directionnelle. Ces textures ont été évaluées sur trois imprimantes 3D grand public et plusieurs types de filaments, en mesurant la variance des empreintes capturées par un capteur optique TacTip sous conditions de contact contrôlées. Des expériences de classification ont ensuite été menées avec des réseaux de neurones et des modèles PCA. Le problème que ce travail cherche à résoudre est fondamental pour la communauté de la robotique haptique : jusqu'ici, les benchmarks de perception tactile dépendaient des lectures d'un capteur spécifique interagissant avec des surfaces disponibles en laboratoire, rendant toute comparaison inter-capteurs structurellement biaisée. Ce dataset brise ce verrou en définissant les textures de manière mathématique plutôt que physique, ce qui permet leur fabrication indépendante dans n'importe quel laboratoire équipé d'une imprimante FDM. Les résultats montrent toutefois une limite importante : la généralisation intra-imprimante est robuste, mais la généralisation inter-imprimantes reste difficile en raison d'inconsistances géométriques liées à la qualité d'impression, notamment la netteté des pics et le phénomène de "stringing". Les imprimantes haut de gamme produisent des signatures tactiles significativement plus cohérentes. La perception tactile reste l'un des sens les moins standardisés en robotique, contrairement à la vision où des benchmarks comme YCB ou LINEMOD sont devenus des références universelles. Des plateformes comme le TacTip (Bristol Robotics Lab) ou le GelSight (MIT) ont chacune développé leurs propres protocoles d'évaluation, sans base commune. Ce dataset constitue, selon les auteurs, le premier benchmark tactile physiquement reproductible et ouvertement disponible. Les prochaines étapes naturelles concernent l'extension à des matériaux aux propriétés mécaniques variées (rigidité, élasticité) et l'intégration à des pipelines de manipulation robotique où la discrimination de texture conditionne la stratégie de saisie.

UELes laboratoires français et européens travaillant sur la perception haptique (INRIA, CEA-List, laboratoires universitaires) peuvent adopter ce benchmark ouvert pour standardiser leurs évaluations de capteurs tactiles, mais aucun acteur européen n'est directement impliqué dans ce travail.

RecherchePaper
1 source
TiROD : petit jeu de données et benchmark de robotique pour la détection d'objets en continu
4arXiv cs.RO 

TiROD : petit jeu de données et benchmark de robotique pour la détection d'objets en continu

Une équipe de recherche présente TiROD (Tiny Robotics Object Detection), un nouveau jeu de données vidéo destiné à évaluer la détection d'objets sur des robots mobiles de petite taille. Les images ont été capturées directement par la caméra embarquée d'un petit robot mobile, dans plusieurs environnements et avec des catégories d'objets variées, afin de reproduire les changements de domaine auxquels ces plateformes sont confrontées en conditions réelles. Sur cette base, les chercheurs ont construit un benchmark comparant plusieurs stratégies d'apprentissage continu, appliquées à NanoDet, un détecteur d'objets léger et temps réel conçu pour tourner sur du matériel à ressources limitées. L'article, publié sur arXiv, en est à sa quatrième révision depuis 2024, signe d'un travail approfondi retravaillé au fil des retours de la communauté. L'enjeu dépasse le simple exercice académique. Les robots miniatures, contraints en taille, en autonomie énergétique et en puissance de calcul, doivent malgré tout détecter des objets sur des images basse résolution et bruitées, tout en s'adaptant à des environnements changeants sans réentraînement complet ni intervention humaine. C'est précisément cette capacité d'adaptation, l'apprentissage continu embarqué, qui conditionne le déploiement réel de flottes de robots low-cost dans l'inspection, la logistique ou la navigation autonome. Les résultats du benchmark montrent que les stratégies existantes peinent encore à concilier efficacité computationnelle et robustesse face à l'oubli catastrophique, un signal utile pour les intégrateurs qui évaluent la maturité réelle de ces approches avant tout déploiement industriel. Ce travail s'inscrit dans une tendance de fond de la robotique embarquée: développer des modèles de vision suffisamment légers pour tourner sur des microcontrôleurs ou des puces à faible consommation, tout en conservant une capacité d'apprentissage en continu. Contrairement aux grands modèles de perception utilisés sur des robots industriels ou humanoïdes, ce créneau cible spécifiquement les plateformes tiny robotics, moins médiatisées mais représentant un volume potentiellement massif de déploiements à bas coût. Les auteurs positionnent TiROD comme une base commune permettant à la communauté de comparer objectivement de futures méthodes sur ce terrain encore peu standardisé.

RecherchePaper
1 source