SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?
Des chercheurs publient SimpleTouch, une extension du modèle vision-langage-action (VLA) π0.5 qui lui ajoute un « expert tactile ». Cet expert exploite tous les tokens d'un encodeur tactile préentraîné et gelé. Il apprend à partir de la supervision des actions et de la prédiction à plusieurs horizons de représentations latentes tactiles futures. L'entraînement tient en une seule étape et n'utilise que les démonstrations de la tâche, sans préentraînement tactile de la politique ni alignement visuotactile séparé. Avec 50 démonstrations par tâche, SimpleTouch obtient le meilleur taux de succès parmi les méthodes évaluées sur les six tâches du benchmark UniVTAC, avec une moyenne de 77,5 %. FTP-π0.5 atteint 45,2 % et FTP-1 66,7 %, soit des écarts de 32,3 et 10,8 points de pourcentage. Sur quatre tâches réelles, la moyenne est de 71,3 %, soit 8,8 points au-dessus de FTP-1. Le papier, disponible sur arXiv avec une page projet, ne précise pas dans cet extrait le capteur tactile utilisé, le robot ni le nombre d'essais par tâche.
L'enjeu est la chaîne d'entraînement de la manipulation riche en contacts. Beaucoup d'équipes partent du principe que greffer le toucher sur un VLA préentraîné uniquement sur la vision et le langage, au moment du réglage fin, creuse un écart intermodal et donne peu de gains, voire dégrade les résultats. Elles ajoutent donc des corpus tactiles à grande échelle ou une étape d'alignement dédiée, ce qui alourdit la collecte de données et le pipeline. SimpleTouch suggère que, si l'on dispose déjà d'un VLA et d'un encodeur tactile solides, ces étapes ne sont pas indispensables pour ces tâches. Pour un intégrateur, cela abaisse le coût d'entrée : une cinquantaine de démonstrations par tâche suffiraient pour doter une politique existante de sensibilité tactile. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par les pairs, d'un nombre limité de tâches (six en simulation, quatre en réel), et la comparaison porte sur des références choisies par les auteurs. Rien n'indique une généralisation à d'autres capteurs, morphologies ou tâches.
Ce travail s'inscrit dans la montée des VLA fondés sur la famille π de Physical Intelligence, qui servent de base à de nombreuses extensions de recherche. La question de la modalité tactile y reste ouverte : les approches concurrentes, comme FTP-1, misent sur un préentraînement tactile de la politique, tandis que SimpleTouch teste l'hypothèse inverse, celle de la simplicité. Le benchmark UniVTAC fournit un terrain commun de comparaison, mais les résultats en conditions industrielles, avec cadences, variabilité des pièces et usure des capteurs, restent à démontrer. Les prochaines étapes probables sont des réplications par d'autres laboratoires, des tests sur davantage de tâches et de capteurs, et une confrontation directe avec des modèles préentraînés sur de grands volumes de données tactiles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers


