Aller au contenu principal
RecherchearXiv cs.RO 

SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient SimpleTouch, une extension du modèle vision-langage-action (VLA) π0.5 qui lui ajoute un « expert tactile ». Cet expert exploite tous les tokens d'un encodeur tactile préentraîné et gelé. Il apprend à partir de la supervision des actions et de la prédiction à plusieurs horizons de représentations latentes tactiles futures. L'entraînement tient en une seule étape et n'utilise que les démonstrations de la tâche, sans préentraînement tactile de la politique ni alignement visuotactile séparé. Avec 50 démonstrations par tâche, SimpleTouch obtient le meilleur taux de succès parmi les méthodes évaluées sur les six tâches du benchmark UniVTAC, avec une moyenne de 77,5 %. FTP-π0.5 atteint 45,2 % et FTP-1 66,7 %, soit des écarts de 32,3 et 10,8 points de pourcentage. Sur quatre tâches réelles, la moyenne est de 71,3 %, soit 8,8 points au-dessus de FTP-1. Le papier, disponible sur arXiv avec une page projet, ne précise pas dans cet extrait le capteur tactile utilisé, le robot ni le nombre d'essais par tâche.

L'enjeu est la chaîne d'entraînement de la manipulation riche en contacts. Beaucoup d'équipes partent du principe que greffer le toucher sur un VLA préentraîné uniquement sur la vision et le langage, au moment du réglage fin, creuse un écart intermodal et donne peu de gains, voire dégrade les résultats. Elles ajoutent donc des corpus tactiles à grande échelle ou une étape d'alignement dédiée, ce qui alourdit la collecte de données et le pipeline. SimpleTouch suggère que, si l'on dispose déjà d'un VLA et d'un encodeur tactile solides, ces étapes ne sont pas indispensables pour ces tâches. Pour un intégrateur, cela abaisse le coût d'entrée : une cinquantaine de démonstrations par tâche suffiraient pour doter une politique existante de sensibilité tactile. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par les pairs, d'un nombre limité de tâches (six en simulation, quatre en réel), et la comparaison porte sur des références choisies par les auteurs. Rien n'indique une généralisation à d'autres capteurs, morphologies ou tâches.

Ce travail s'inscrit dans la montée des VLA fondés sur la famille π de Physical Intelligence, qui servent de base à de nombreuses extensions de recherche. La question de la modalité tactile y reste ouverte : les approches concurrentes, comme FTP-1, misent sur un préentraînement tactile de la politique, tandis que SimpleTouch teste l'hypothèse inverse, celle de la simplicité. Le benchmark UniVTAC fournit un terrain commun de comparaison, mais les résultats en conditions industrielles, avec cadences, variabilité des pièces et usure des capteurs, restent à démontrer. Les prochaines étapes probables sont des réplications par d'autres laboratoires, des tests sur davantage de tâches et de capteurs, et une confrontation directe avec des modèles préentraînés sur de grands volumes de données tactiles.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

Politique de diffusion équivariante visuo-tactile pour la manipulation riche en contacts

Des chercheurs proposent VISTA, une politique de diffusion visuo-tactile équivariante conçue pour l'apprentissage par imitation de tâches de manipulation riches en contacts (arXiv 2610.03333, première version). Le système projette les observations visuelles et tactiles dans des « jetons sphériques », puis injecte les indices de contact tactile dans les directions sphériques visuelles grâce à une fusion sphérique équivariante aux permutations. La représentation harmonique ainsi fusionnée est ensuite tournée selon l'orientation de l'effecteur terminal. Elle conditionne une politique de diffusion équivariante, chargée de prédire des actions cohérentes dans l'espace de travail. Les auteurs affirment, à partir d'expériences en simulation et sur robot réel, que VISTA améliore nettement l'efficacité en données par rapport à de solides références d'apprentissage par imitation visuo-tactile. Le résumé publié ne donne ni chiffres, ni nombre de démonstrations, ni liste des tâches ou des capteurs tactiles utilisés. Un site de projet accompagne le travail. L'enjeu est économique avant d'être académique. Les démonstrations expertes pour les tâches de contact (insertion, assemblage, manipulation fine) sont coûteuses : elles exigent de la téléopération qualifiée, du temps machine et, de plus en plus, des capteurs tactiles. Les politiques de diffusion et les VLA (modèles vision-langage-action) fonctionnent, mais au prix de volumes de données qui freinent leur déploiement chez les intégrateurs. Intégrer des symétries géométriques directement dans l'architecture, plutôt que de les faire apprendre par des données supplémentaires, est une piste crédible pour réduire ce coût. Le travail suggère aussi que le toucher gagne à être fusionné de façon structurée avec la vision, et non simplement concaténé. Il faut toutefois rester prudent : il s'agit d'un préprint sans relecture par les pairs, dont l'ampleur réelle du gain n'est pas vérifiable à ce stade. Aucun déploiement industriel n'est annoncé. VISTA s'inscrit dans la lignée des politiques de diffusion (Diffusion Policy) et de leurs variantes équivariantes, qui exploitent les symétries SE(3) ou SO(3) pour gagner en efficacité. Les recherches récentes sur le visuo-tactile cherchent à compenser les limites de la vision en cas d'occlusion ou d'ambiguïté de contact. En face, les grands modèles généralistes (Pi-0, GR00T, Helix) misent plutôt sur l'échelle des données que sur les biais inductifs géométriques. Les prochaines étapes à surveiller sont la publication du code et des chiffres détaillés, les comparaisons sur des benchmarks communs, et l'éventuelle combinaison de ces biais équivariants avec des modèles préentraînés à grande échelle.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts

Des chercheurs proposent SARI (Simulated Approach, Real Interaction), un cadre de co-entraînement simulation-réel « à phases séparées » destiné à adapter des modèles vision-langage-action (VLA) à des tâches de manipulation riches en contacts. Le principe : générer les trajectoires d'approche, en espace libre, dans un jumeau numérique photoréaliste, et ne collecter en conditions réelles que les phases de contact, sur un petit nombre de positions d'objets. Une seule politique est ensuite post-entraînée sur ces démonstrations segmentées par phase. Elle enchaîne approche simulée et interaction réelle grâce à un alignement de l'apparence visuelle et à une représentation d'action partagée, exprimée par rapport à la caméra. Elle n'utilise ni étiquettes de phase explicites ni commutateurs codés à la main. Testé sur cinq tâches de manipulation réelles, SARI réduit de 34,3 % le temps de collecte de données réelles et atteint 27,5 % de réussite sur des positions jamais vues, là où toutes les approches de référence sim-réel entraînées sur la tâche complète échouent totalement (0 %). Le travail est publié sur arXiv (2610.02804). Ces résultats comptent pour les équipes qui adaptent des VLA à des tâches d'assemblage ou d'insertion, où le coût des démonstrations téléopérées est le principal frein. L'intérêt tient à la répartition du travail : la diversité spatiale, gourmande en données mais tolérante aux écarts de simulation, est confiée à la synthèse. La physique du contact, sensible aux erreurs de modèle mais peu dépendante de la position de l'objet, reste réelle. Cela nuance l'idée d'un transfert sim-vers-réel de bout en bout et suggère qu'un découpage par phase est plus rentable. Il faut toutefois relativiser les chiffres. Un taux de 27,5 % sur positions inédites reste très loin d'un seuil industriel, et un gain de 34,3 % sur le temps de collecte est modeste. Les résultats portent sur cinq tâches, avec un échantillon et des conditions de laboratoire dont l'article ne détaille pas ici la variabilité. Le contraste avec les références à 0 % est parlant, mais il dépend du choix de ces références. L'article s'inscrit dans la série de travaux sur le co-entraînement sim-réel pour les politiques VLA, qui cherchent à réduire la dépendance aux démonstrations réelles, aujourd'hui l'un des principaux postes de coût du déploiement de modèles généralistes. Les approches concurrentes, qui mélangent simulation et réel sur la tâche entière, se heurtent à l'écart de réalité dès que le contact intervient, ce que SARI cherche à contourner. Il s'agit ici d'un résultat de recherche et non d'un produit ni d'un déploiement : aucun partenaire industriel, calendrier de pilote ni code disponible n'est mentionné dans le résumé. Les suites probables sont des validations sur davantage de tâches, de robots et de géométries d'objets, ainsi que des comparaisons avec les VLA généralistes actuels, afin de vérifier si le gain tient hors du cadre expérimental initial.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts
3arXiv cs.RO 

ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts

Des chercheurs présentent ViTacWorld, un modèle de monde visuo-tactile conditionné par l'action, conçu pour la manipulation robotique riche en contacts, décrit dans une prépublication arXiv (2607.22530v1). Le système s'appuie sur des jeux de données tactiles réels publics combinés à un environnement de simulation construit spécifiquement pour l'occasion, afin de générer à grande échelle des trajectoires visuo-tactiles-actions. Le modèle est d'abord préentraîné sur de larges volumes de trajectoires réelles et simulées, puis affiné avec des rollouts de politiques collectés en conditions réelles pour mieux coller aux comportements de manipulation visés. À partir d'une séquence d'actions du robot, ViTacWorld prédit conjointement les observations visuelles et le retour tactile correspondants, permettant de générer des rollouts visuo-tactiles-actions complets. Les auteurs présentent cela comme le premier cadre exploitant un modèle de monde pour la génération de trajectoires visuo-tactiles-actions et l'évaluation de politiques robotiques. L'enjeu central est le coût et la rareté des données tactiles réelles, qui freinent l'apprentissage robotique basé sur le toucher : matériel spécifique, collecte coûteuse, diversité de tâches et de scènes limitée. En misant sur le fait que le signal tactile, directement ancré dans le contact physique, souffre d'un écart simulation-vers-réel plus faible que la seule vision, ViTacWorld propose une voie pour combler ce manque de données sans multiplier les campagnes de collecte sur robot réel. Pour les équipes de recherche en manipulation fine (assemblage, insertion, préhension d'objets déformables), cela ouvre deux usages concrets : générer des données synthétiques pour améliorer des politiques tactiles en aval, et évaluer des politiques existantes en prédisant leurs résultats visuo-tactiles sous des séquences d'actions contrôlées, sans passer systématiquement par des essais physiques. C'est un signal de plus que les modèles de monde, déjà répandus en vision, commencent à s'étendre à d'autres modalités sensorielles pour la robotique de contact. Ce travail s'inscrit dans la lignée des modèles de monde appliqués à la robotique, jusqu'ici centrés presque exclusivement sur la modalité visuelle, et dans la continuité des efforts pour réduire la dépendance de l'apprentissage tactile aux capteurs propriétaires et aux collectes sur site. Les expériences menées par les auteurs sur des tâches de manipulation riches en contacts montrent que ViTacWorld génère des rollouts physiquement cohérents, améliore les performances de politiques via une augmentation de données scalable, et permet une évaluation de politiques conditionnée par l'action. Le projet est documenté sur vitacworld.github.io. L'article ne mentionne aucun partenariat industriel ni déploiement commercial à ce stade : il s'agit d'une contribution de recherche dont la portée réelle dépendra de sa reproduction sur des plateformes robotiques variées et de son adoption par des équipes travaillant sur l'assemblage ou la manipulation fine en environnement industriel.

RecherchePaper
1 source
TACTIC : comprendre les encodeurs tactiles et le conditionnement pour les politiques de manipulation robotique en contact riche
4arXiv cs.RO 

TACTIC : comprendre les encodeurs tactiles et le conditionnement pour les politiques de manipulation robotique en contact riche

Une équipe de recherche en robotique publie une étude comparative à grande échelle sur les encodeurs tactiles utilisés dans les politiques de manipulation robotique riches en contacts, dans un article intitulé « TACTIC: Understanding Tactile Encoders and Conditioning for Contact-rich Robot Manipulation Policies », mis en ligne sur arXiv sous la référence 2609.30969v1. Les auteurs comparent plusieurs architectures d'encodeurs tactiles fondées sur des capteurs tactiles à vision (des capteurs qui traduisent la déformation au contact en image, permettant de réutiliser directement les encodeurs de vision par ordinateur existants), ainsi que différentes stratégies de fusion entre signal visuel et signal tactile. Pour garantir une comparaison rigoureuse, tous les modèles sont entraînés et évalués avec le même pipeline et le même protocole expérimental, sur plus de 2000 essais réels effectués sur robot, couvrant plusieurs tâches de manipulation impliquant un contact physique important avec l'environnement. Le résultat principal contredit l'idée d'une solution universelle : il n'existe pas de représentation ni de stratégie de fusion optimale de manière générale pour encoder conjointement l'information tactile et visuelle, le meilleur choix d'architecture et de schéma de fusion dépendant fortement de la tâche à accomplir. Pour les intégrateurs et les équipes qui développent des politiques de manipulation fondées sur des modèles vision-langage-action ou de l'apprentissage par imitation, ce constat signifie qu'aucune recette standard ne peut être copiée d'un projet à l'autre : le choix de l'encodeur tactile doit être réévalué selon l'application, qu'il s'agisse d'insertion de précision, de manipulation d'objets déformables ou de préhension en aveugle. L'étude rappelle aussi un point méthodologique pour le secteur : les comparaisons menées uniquement en simulation, fréquentes dans la littérature, ne se transposent pas nécessairement au monde réel, où des évaluations à grande échelle restent nécessaires pour obtenir des statistiques fiables. Ce travail s'inscrit dans un contexte où les capteurs tactiles à vision se sont largement diffusés en recherche robotique, justement parce qu'ils permettent de réutiliser des encodeurs de vision déjà matures, ce qui a entraîné une prolifération d'architectures, de jeux de données d'entraînement et de protocoles d'évaluation différents d'un laboratoire à l'autre, rendant les résultats difficiles à comparer. En proposant un protocole commun et une base de plus de 2000 essais réels, les auteurs visent à établir un point de référence partagé pour le domaine, dans la lignée des efforts récents autour des politiques généralistes de manipulation qui cherchent à combiner vision, langage et désormais toucher. L'article ne mentionne ni calendrier de déploiement ni partenaire industriel : il s'agit d'une contribution de recherche destinée à orienter les choix de conception futurs, pas d'un produit prêt à déployer.

RecherchePaper
1 source