VT-Bridge : relier les VLA fondation préentraînés aux VTLA par adaptation résiduelle légère
Un article publié sur arXiv (identifiant 2609.22606v1) présente VT-Bridge, une méthode d'adaptation résiduelle légère permettant de transformer des modèles Vision-Language-Action (VLA) déjà entraînés en modèles Vision-Tactile-Language-Action (VTLA), sans réentraînement complet ni modification de l'architecture d'origine. Plutôt que d'entraîner un VTLA à partir de zéro, ce qui exige d'énormes volumes de données vision-tactile et une puissance de calcul importante, VT-Bridge ajoute un adaptateur résiduel identique sur différents socles VLA, avec des poids spécifiques à chaque backbone, pour affiner les actions à la fréquence d'exécution du robot. Concrètement, la méthode ne nécessite que 50 démonstrations vision-tactile maximum par tâche pour ajuster le socle VLA et entraîner un adaptateur de seulement 0,98 million de paramètres. Testée sur trois backbones VLA représentatifs, π0, π0.5 et SmolVLA, sur quatre tâches de manipulation à fort contact physique, la méthode fait passer le taux de réussite moyen de 11,7% (avec un simple ajustement du VLA au niveau de la tâche) à 62,9%. Le code et les démonstrations sont disponibles sur une page projet dédiée.
Ce résultat s'adresse directement aux intégrateurs et laboratoires qui ont déjà déployé des piles logicielles VLA mais butent sur les tâches de manipulation fine nécessitant un retour tactile, comme l'insertion de pièces ou la préhension d'objets fragiles, un angle mort connu des modèles vision-langage seuls. En évitant l'entraînement d'un VTLA complet, VT-Bridge réduit fortement la barrière de données et de calcul pour ajouter la perception tactile à des systèmes existants, et sa généralisation sur trois architectures différentes suggère qu'une telle approche d'adaptateur pourrait devenir une pratique standard plutôt qu'une démonstration isolée. Il s'agit toutefois d'un résultat de recherche non encore validé par relecture par les pairs, obtenu sur quatre tâches en environnement contrôlé, et non d'un produit commercial ou d'un déploiement industriel.
Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que π0 ou SmolVLA, conçus pour ancrer perception visuelle et langage dans l'action robotique, mais historiquement peu adaptés aux tâches à contact riche faute de retour tactile intégré. Les approches VTLA existantes imposaient jusqu'ici un réentraînement lourd, réservé aux acteurs disposant de grands jeux de données tactiles. En proposant un pont léger et réutilisable entre VLA et VTLA, les auteurs visent à démocratiser l'accès à la manipulation tactile augmentée, les prochaines étapes annoncées portant sur l'extension des benchmarks et la publication du code associé à la page projet.
Dans nos dossiers




