Aller au contenu principal
RCT : un jeu de données tactiles vision-langage collecté par robot pour la généralisation du toucher
RecherchearXiv cs.RO 

RCT : un jeu de données tactiles vision-langage collecté par robot pour la généralisation du toucher

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du Faerber Lab publient RCT (Robotic Contact Tactile), un jeu de données touch-vision-language collecté par robot pour évaluer la généralisation tactile des systèmes robotiques. Le dataset comprend 29 279 frames tactiles issues de pressions complètes effectuées par un bras robotique sur 122 matériaux de référence industriels répartis en 7 catégories, enregistrées à l'aide de trois capteurs DIGIT positionnés à plusieurs points de contact. Particularité méthodologique : RCT conserve chaque pression comme une séquence de contact continue plutôt que comme des frames isolées, ce qui permet des évaluations "held-out" rigoureuses par matériau, catégorie, capteur, position de contact ou séquence entière. Les auteurs démontrent que les frames issues d'une même pression sont fortement corrélées entre elles : un découpage aléatoire des frames (frame-random split), pratique courante dans le domaine, place des observations quasi-identiques de la même interaction physique à la fois dans les jeux d'entraînement et de test. En supprimant ce chevauchement de séquences, le score de Recall@1 en correspondance tactile-texte chute de 17,7 points de pourcentage à encodeur fixe. Lorsque les matériaux sont également exclus à l'entraînement, la performance s'effondre davantage, avec un Recall@1 de seulement 25,1 % (± 6,1 %) en moyenne sur trois tirages de matériaux non vus. Le jeu de données est open source, disponible sur faerber-lab.github.io/RCT.

Cette étude expose un biais méthodologique qui gonflait artificiellement les résultats publiés sur la perception tactile robotique. En analysant le split public TVL/HCT, référence largement utilisée dans le domaine, les auteurs montrent que chaque séquence de contact du jeu de test apparaît déjà dans l'entraînement : une simple recherche du plus proche voisin en pixels bruts, sans aucun apprentissage, retrouve la bonne séquence dans 98,3 % des cas. Autrement dit, les benchmarks existants mesurent en grande partie de la mémorisation plutôt que de la généralisation réelle. Pour les équipes qui développent des systèmes de manipulation tactile destinés à des environnements ouverts (tri de déchets, logistique, inspection de pièces), cela signifie que des modèles annoncés comme performants pourraient largement sous-performer face à des matériaux jamais rencontrés. L'étude montre aussi une piste corrective concrète : échantillonner uniformément les frames au sein d'une pression, plutôt que de façon aléatoire, améliore l'entraînement contrastif, et les embeddings entraînés sur RCT améliorent les probes de catégorisation sur des matériaux inédits.

Le travail s'inscrit dans la lignée des jeux de données touch-vision-language existants comme TVL (Touch-Vision-Language) et HCT, dont RCT réutilise la structure de split pour illustrer le problème de fuite de données. Le choix des capteurs DIGIT, développés initialement par Meta AI et largement adoptés en recherche tactile académique, ancre RCT dans l'écosystème matériel dominant du secteur plutôt que dans des capteurs propriétaires. Aucun acteur français ou européen n'est mentionné dans cette publication, qui reste un travail de recherche fondamentale plutôt qu'une annonce produit. Les prochaines étapes attendues pour le domaine concernent l'adoption de protocoles d'évaluation "contact-sequence-aware" par les équipes travaillant sur la manipulation tactile, ainsi que l'extension de ce type de benchmark held-out-material à d'autres modalités sensorielles combinées, à mesure que les architectures VLA (vision-language-action) intègrent de plus en plus le retour tactile comme signal de contrôle.

À lire aussi

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source
MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle
2arXiv cs.RO 

MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle

La recherche en robotique manipulative s'attaque à un problème précis: coordonner plusieurs bras robotiques qui doivent collaborer sur une même tâche sans être limités aux schémas de coopération vus pendant l'entraînement. Un article publié sur arXiv (identifiant 2608.25864v1) présente MA-VLA, un modèle vision-langage-action (VLA) conçu pour la collaboration multi-bras. Contrairement aux VLA récents qui traitent l'instruction comme une consigne globale unique appliquée à l'ensemble du système, MA-VLA découpe le comportement coopératif en "prompts atomiques" de niveau intermédiaire, chacun assigné à un bras spécifique. L'équipe introduit aussi une technique d'entraînement baptisée Arm Shuffle: elle permute aléatoirement, pour chaque bras, les observations, les états et les prompts atomiques assignés, ce qui force le modèle à suivre les instructions indépendamment du rôle fixe attribué à un bras donné. Les auteurs ont construit un benchmark dédié où les configurations de collaboration testées sont absentes de l'ensemble d'entraînement, et ont évalué le système en simulation comme en conditions réelles. Le code, les modèles et les données sont publiés sur GitHub (zhangzaibin/future-robots). Ce travail cible un angle mort connu des VLA actuels: leur capacité de généralisation s'effondre dès que la répartition des rôles entre bras change par rapport aux schémas mémorisés à l'entraînement. Selon les résultats rapportés, les VLA de référence échouent largement sur ces collaborations inédites, alors que MA-VLA maintient des performances stables. Pour les intégrateurs travaillant sur des cellules robotiques multi-bras ou des plateformes bimanuelles, c'est un signal utile: la généralisation compositionnelle, plutôt que la simple mémorisation de trajectoires coopératives, pourrait devenir un critère de sélection des architectures VLA pour des lignes de production où la configuration des tâches varie. Cette contribution s'inscrit dans la vague plus large des modèles VLA qui cherchent à unifier perception, langage et contrôle pour la manipulation robotique, un axe de recherche porté ces dernières années par plusieurs laboratoires académiques et industriels. MA-VLA se positionne explicitement contre les architectures à instruction globale unique, en misant sur une assignation explicite et recomposable de sous-objectifs par bras. Il s'agit à ce stade d'une publication de recherche avec code ouvert, sans annonce de déploiement industriel ni de partenaire commercial identifié.

RechercheActu
1 source
« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »
3arXiv cs.RO 

« RoboTacDex : un jeu de données visuo-tactile-action dextérique pour la manipulation humanoïde »

Une équipe de chercheurs en robot learning publie RoboTacDex, un jeu de données de manipulation dextre construit sur le robot humanoïde Unitree G1, accessible publiquement. L'ensemble comprend 6 000 trajectoires couvrant 19 tâches, 23 compétences distinctes et des interactions avec 22 objets différents. Chaque trajectoire embarque des flux RGB et de profondeur multi-vues, un retour tactile et des annotations sémantiques détaillées. Pour garantir la qualité de la collecte, les auteurs ont développé un système de synchronisation multi-caméras capable d'aligner les différentes modalités à la milliseconde près. Le jeu de données cible volontairement des tâches complexes, réalisables uniquement avec deux bras et des mains dextres, pour se rapprocher de la logique opérationnelle humaine. Trois modèles d'apprentissage par imitation ont été testés dessus, avec des résultats jugés positifs et une capacité de généralisation modérée sur l'ensemble des tâches. Le dataset sera open-source prochainement. L'enjeu dépasse la simple publication académique : l'apprentissage par imitation pour la manipulation bimanuelle dextre souffre d'un manque chronique de démonstrations diversifiées et multimodales, la plupart des jeux de données existants se limitant à la vision RGB seule. L'ajout systématique du tactile et d'une synchronisation précise entre capteurs comble un vide identifié par plusieurs laboratoires travaillant sur des modèles vision-langage-action (VLA). Pour les équipes qui entraînent ce type de modèles, disposer de données ouvertes et denses sur une plateforme humanoïde standardisée réduit la dépendance aux jeux de données propriétaires des grands acteurs américains. Le choix du Unitree G1, plateforme humanoïde relativement abordable et largement diffusée dans les laboratoires de recherche, s'inscrit dans une dynamique d'ouverture des données robotiques comparable à des initiatives comme Open X-Embodiment. Ce positionnement contraste avec les approches propriétaires de Physical Intelligence (Pi-0) ou NVIDIA (GR00T), qui restreignent l'accès à leurs corpus d'entraînement. La mise en open source, annoncée mais pas encore effective à la date de publication du prépublication arXiv, déterminera l'impact réel de RoboTacDex sur la communauté.

RecherchePaper
1 source
DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues
4arXiv cs.RO 

DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues

Un article de recherche publié sur arXiv (2608.11901) présente DaViNCi (Dynamic Vision-and-Language Navigation in Continuous Environment), premier jeu de données de navigation vision-langage (VLN) en extérieur combinant actions continues et éléments dynamiques imprévisibles, avec six cartes distinctes et 6 933 trajectoires au total. Contrairement aux datasets VLN outdoor existants, construits sur des graphes topologiques fixes et discrets, DaViNCi impose à l'agent de se déplacer avec des commandes continues tout en réagissant à des éléments mobiles qui modifient l'environnement en temps réel. Les expériences comparatives montrent que le taux de réussite chute de plus de 10 % en configuration discrète par rapport aux jeux de données précédents, et la baisse est encore plus marquée en configuration continue. Les auteurs isolent également l'impact respectif de la granularité des actions et de la présence d'éléments dynamiques sur la performance des agents. Le dataset et les ressources associées sont disponibles sur le site du projet. Ce résultat contredit l'idée que les agents VLN actuels, entraînés et évalués sur des graphes topologiques figés, seraient prêts pour un déploiement réel en extérieur, et expose l'écart persistant entre bancs d'essai simulés et conditions réelles rencontrées par les robots mobiles et les AMR devant naviguer parmi piétons, véhicules ou obstacles temporaires. Pour les équipes qui développent des agents de navigation autonome guidés par le langage, qu'il s'agisse de robots de livraison, d'inspection ou de plateformes humanoïdes mobiles, ce benchmark offre un cadre d'évaluation plus exigeant que les datasets discrets utilisés jusqu'ici. Il souligne surtout que le passage à des actions continues, plus proches du contrôle moteur réel, reste un facteur de fragilité majeur pour les modèles de navigation, un enjeu direct pour le transfert sim-to-real que l'industrie robotique cherche à valider avant tout déploiement commercial. DaViNCi s'inscrit dans l'évolution du champ VLN, d'abord développé en environnement intérieur avant de s'étendre progressivement à l'extérieur ces dernières années via des jeux de données construits sur des graphes topologiques discrets, qui simplifiaient la tâche d'entraînement mais s'éloignaient des conditions réelles de terrain où les trajectoires ne sont pas prédéfinies. En introduisant simultanément mouvement continu et dynamique environnementale, DaViNCi se positionne comme un nouveau standard d'évaluation, plus difficile que les benchmarks VLN outdoor précédents. Les auteurs présentent ce travail comme une étape vers des agents de navigation capables d'opérer dans des environnements urbains réalistes, et mettent le jeu de données à disposition de la communauté de recherche pour mesurer les progrès futurs sur ce terrain plus exigeant.

RecherchePaper
1 source