Aller au contenu principal
Deform360 : un vaste jeu de données visuotactile multi-vues pour les modèles du monde déformables
RecherchearXiv cs.RO 

Deform360 : un vaste jeu de données visuotactile multi-vues pour les modèles du monde déformables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie Deform360, un jeu de données visuotactile de très grande échelle dédié à la modélisation du monde pour les objets déformables, disponible sur arXiv (2607.05390) et sur le site du projet deform360.lhy.xyz. Le dataset couvre 198 objets du quotidien et 1 980 séquences d'interaction, totalisant plus de 215 heures d'observations. La capture repose sur 41 caméras en vue périphérique combinées à des pinces bimanuelles équipées de capteurs tactiles, afin d'enregistrer à la fois le mouvement global des objets et les déformations locales induites par le contact. Les chercheurs ont développé un pipeline de suivi 3D visuotactile sans marqueurs pour extraire une géométrie et un mouvement denses, puis ont évalué plusieurs modèles du monde de référence, comparant les approches vidéo en 2D aux modèles de particules en 3D. Une démonstration préliminaire de planification robotique sur des objets déformables valide l'applicabilité pratique du jeu de données.

Cette publication comble un vide méthodologique important pour la robotique de manipulation : la modélisation des objets déformables (tissus, aliments, câbles) reste l'un des angles morts des systèmes actuels, faute de données réelles diversifiées et à grande échelle pour comparer objectivement les paradigmes concurrents. En confrontant directement les modèles 2D pixel et 3D géométrique sur un même benchmark, l'étude apporte des éléments concrets sur l'arbitrage entre a priori structurels et scalabilité, une question centrale pour les intégrateurs qui cherchent des architectures de perception-action robustes face à des matières non rigides, un défi encore largement non résolu comparé à la manipulation d'objets rigides.

Les modèles du monde se sont imposés ces dernières années comme brique clé pour la planification robotique, portés par des architectures vidéo génératives d'un côté et des représentations particulaires ou géométriques de l'autre, à l'image des travaux sur les modèles VLA à grande échelle. Jusqu'ici, l'essentiel des jeux de données disponibles restait limité en taille ou en diversité d'objets, freinant les comparaisons rigoureuses entre approches. Deform360 se positionne comme un benchmark de référence pour la communauté et ouvre la voie à des travaux futurs sur la généralisation des modèles du monde centrés objets déformables, un domaine encore émergent où l'écart entre démonstrations en laboratoire et déploiement industriel reste à combler.

Dans nos dossiers

À lire aussi

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables
1arXiv cs.RO 

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables

SoftVTBench, jeu de données visuo-tactile pour la manipulation d'objets déformables, a été publié le 20 août 2026 sur arXiv (2608.18701). Il réunit 4 000 démonstrations expertes sur plus de 50 objets, dont des objets déformables volumétriques et leurs jumeaux rigides visuellement identiques. À 20 Hz, chaque épisode synchronise RGB multi-vues, capteurs tactiles RGB, suivi de marqueurs sur les deux doigts du gripper, proprioception, instructions en langage naturel, actions de préhension, et des états de référence par éléments finis (FEM) réservés à l'évaluation. Le benchmark associé introduit le Deformation-aware Success Rate (DSR), qui ne valide un essai que si la tâche réussit sans dépasser une tolérance de déformation calibrée par objet. Sur Diffusion Policy, π0.5 et FastWAM, les 12 configurations testées comptent toutes des succès classiques qui violent en réalité cette tolérance, dans 0,7% à 24% des cas. Sous changement de distribution, les versions avec toucher font mieux en réussite (six comparaisons sur six) et en DSR (cinq sur six), un avantage plus incertain en distribution. Le message clé pour l'industrie: un taux de réussite binaire masque des comportements physiquement problématiques, glissement ou compression excessive, un enjeu direct pour les intégrateurs manipulant des produits fragiles (agroalimentaire, textile, emballage, médical). Plus notable, ajouter des capteurs tactiles n'améliore pas automatiquement la manipulation: le gain n'est net que sous changement de distribution, signe que la fusion visuo-tactile reste un problème d'ingénierie non résolu plutôt qu'un simple avantage matériel. Cela nuance le discours courant sur les architectures vision-langage-action, où le toucher est souvent présenté comme un bonus de robustesse automatique. L'absence de jeux de données associant observations exploitables par une politique et vérité terrain physique indépendante était jusque-là le principal obstacle à une évaluation fine de l'interaction, la plupart des benchmarks existants se limitant à un succès binaire de tâche. SoftVTBench se positionne comme ressource commune pour étudier non seulement si une politique réussit, mais comment elle interagit physiquement avec un objet mou et quand le toucher améliore réellement cette interaction. Il s'agit d'une publication de recherche, sans annonce de déploiement industriel ni partenariat constructeur, et sans acteur français ou européen identifié dans cette étude.

RecherchePaper
1 source
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
2arXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé. Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie. Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

RecherchePaper
1 source
« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »
3arXiv cs.RO 

« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »

Une équipe de chercheurs en robot learning publie RoboTacDex, un jeu de données de manipulation dextre construit sur le robot humanoïde Unitree G1, accessible publiquement. L'ensemble comprend 6 000 trajectoires couvrant 19 tâches, 23 compétences distinctes et des interactions avec 22 objets différents. Chaque trajectoire embarque des flux RGB et de profondeur multi-vues, un retour tactile et des annotations sémantiques détaillées. Pour garantir la qualité de la collecte, les auteurs ont développé un système de synchronisation multi-caméras capable d'aligner les différentes modalités à la milliseconde près. Le jeu de données cible volontairement des tâches complexes, réalisables uniquement avec deux bras et des mains dextres, pour se rapprocher de la logique opérationnelle humaine. Trois modèles d'apprentissage par imitation ont été testés dessus, avec des résultats jugés positifs et une capacité de généralisation modérée sur l'ensemble des tâches. Le dataset sera open-source prochainement. L'enjeu dépasse la simple publication académique : l'apprentissage par imitation pour la manipulation bimanuelle dextre souffre d'un manque chronique de démonstrations diversifiées et multimodales, la plupart des jeux de données existants se limitant à la vision RGB seule. L'ajout systématique du tactile et d'une synchronisation précise entre capteurs comble un vide identifié par plusieurs laboratoires travaillant sur des modèles vision-langage-action (VLA). Pour les équipes qui entraînent ce type de modèles, disposer de données ouvertes et denses sur une plateforme humanoïde standardisée réduit la dépendance aux jeux de données propriétaires des grands acteurs américains. Le choix du Unitree G1, plateforme humanoïde relativement abordable et largement diffusée dans les laboratoires de recherche, s'inscrit dans une dynamique d'ouverture des données robotiques comparable à des initiatives comme Open X-Embodiment. Ce positionnement contraste avec les approches propriétaires de Physical Intelligence (Pi-0) ou NVIDIA (GR00T), qui restreignent l'accès à leurs corpus d'entraînement. La mise en open source, annoncée mais pas encore effective à la date de publication du prépublication arXiv, déterminera l'impact réel de RoboTacDex sur la communauté.

RecherchePaper
1 source
Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue
4arXiv cs.RO 

Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue

Des chercheurs ont publié sur arXiv (2304.11193v2) une étude portant sur l'intégration du retour tactile dans les modèles prédictifs de perception pour la manipulation robotique. L'approche, baptisée "visuo-tactile prediction", consiste à entraîner un modèle de monde capable de générer simultanément des prédictions visuelles et tactiles à partir d'observations de poussée d'objets. Pour alimenter ces travaux, deux jeux de données inédits ont été constitués à l'aide d'un capteur tactile à base magnétique : le premier contient des objets visuellement identiques mais aux propriétés physiques différentes (masse, rigidité), isolant explicitement l'ambiguïté physique ; le second reproduit les benchmarks classiques de robot-pushing avec des regroupements d'objets du quotidien. Le code source et les données sont mis à disposition publiquement. Le résultat central de cette recherche remet en question un postulat implicite de nombreux systèmes de world models robotiques : la vision seule ne suffit pas pour prédire fidèlement les interactions physiques dès lors que les objets sont visuellement indiscernables. Dans ces régimes ambigus, l'intégration tactile améliore significativement la précision et la robustesse des prédictions. En revanche, lorsque la dynamique est visuellement déductible, les gains tactiles restent limités. Pour les intégrateurs et équipes de R&D en manipulation, cela signifie que le retour tactile n'est pas un luxe mais une nécessité sélective : son déploiement est justifié précisément là où la vision échoue, typiquement lors de la manipulation d'objets déformables, transparents ou de densité variable. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour dépasser les modèles de monde purement visuels, qui montrent leurs limites dans les tâches de contact. Des travaux concurrents comme ceux de Meta AI (v-jepa), de Google DeepMind (RT-2) ou de Physical Intelligence (Pi-0) explorent également les représentations multimodales, mais restent majoritairement centrés sur la vision et le langage. L'usage d'un capteur magnétique plutôt que optique (comme ceux de GelSight/Digit popularisés par Meta) constitue un choix technique notable, potentiellement plus robuste en conditions industrielles. La mise à disposition des données en accès libre ouvre la voie à des évaluations comparatives plus rigoureuses, un manque criant dans le domaine de la manipulation tactile.

RecherchePaper
1 source