Aller au contenu principal
RecherchearXiv cs.RO 

VT-Bridge : relier les VLA fondation préentraînés aux VTLA par adaptation résiduelle légère

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (identifiant 2609.22606v1) présente VT-Bridge, une méthode d'adaptation résiduelle légère permettant de transformer des modèles Vision-Language-Action (VLA) déjà entraînés en modèles Vision-Tactile-Language-Action (VTLA), sans réentraînement complet ni modification de l'architecture d'origine. Plutôt que d'entraîner un VTLA à partir de zéro, ce qui exige d'énormes volumes de données vision-tactile et une puissance de calcul importante, VT-Bridge ajoute un adaptateur résiduel identique sur différents socles VLA, avec des poids spécifiques à chaque backbone, pour affiner les actions à la fréquence d'exécution du robot. Concrètement, la méthode ne nécessite que 50 démonstrations vision-tactile maximum par tâche pour ajuster le socle VLA et entraîner un adaptateur de seulement 0,98 million de paramètres. Testée sur trois backbones VLA représentatifs, π0, π0.5 et SmolVLA, sur quatre tâches de manipulation à fort contact physique, la méthode fait passer le taux de réussite moyen de 11,7% (avec un simple ajustement du VLA au niveau de la tâche) à 62,9%. Le code et les démonstrations sont disponibles sur une page projet dédiée.

Ce résultat s'adresse directement aux intégrateurs et laboratoires qui ont déjà déployé des piles logicielles VLA mais butent sur les tâches de manipulation fine nécessitant un retour tactile, comme l'insertion de pièces ou la préhension d'objets fragiles, un angle mort connu des modèles vision-langage seuls. En évitant l'entraînement d'un VTLA complet, VT-Bridge réduit fortement la barrière de données et de calcul pour ajouter la perception tactile à des systèmes existants, et sa généralisation sur trois architectures différentes suggère qu'une telle approche d'adaptateur pourrait devenir une pratique standard plutôt qu'une démonstration isolée. Il s'agit toutefois d'un résultat de recherche non encore validé par relecture par les pairs, obtenu sur quatre tâches en environnement contrôlé, et non d'un produit commercial ou d'un déploiement industriel.

Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que π0 ou SmolVLA, conçus pour ancrer perception visuelle et langage dans l'action robotique, mais historiquement peu adaptés aux tâches à contact riche faute de retour tactile intégré. Les approches VTLA existantes imposaient jusqu'ici un réentraînement lourd, réservé aux acteurs disposant de grands jeux de données tactiles. En proposant un pont léger et réutilisable entre VLA et VTLA, les auteurs visent à démocratiser l'accès à la manipulation tactile augmentée, les prochaines étapes annoncées portant sur l'extension des benchmarks et la publication du code associé à la page projet.

À lire aussi

ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA
1arXiv cs.RO 

ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA

Une équipe publie sur arXiv (2608.15816v1) ViTaR (Visuo-Tactile Residual Adaptation), qui comble un angle mort des modèles Vision-Language-Action (VLA) : entraînés sur de vastes a priori visuels, ils produisent la même action que le contact avec l'objet soit établi, perdu ou déstabilisé. Plutôt que de modifier l'intérieur du VLA, au risque d'un oubli catastrophique, ou de recourir à du renforcement en ligne près des conditions d'échec, ViTaR garde le modèle gelé et traite le tactile comme un modulateur d'exécution plutôt que comme une entrée génératrice d'action. Une première étape détermine si une correction résiduelle est localement justifiée à partir des résultats observés, une seconde la convertit en un gain continu calculé en temps réel. Sur le benchmark UniVTAC, sept tâches de manipulation à fort contact, ViTaR atteint 61,3% de réussite moyenne, soit 30,6 points de plus que le VLA gelé de base, devançant aussi des méthodes tactiles spécialisées ; des essais sur robot physique confirment le transfert au bruit et à la dynamique réels des capteurs. Ce résultat cible un point critique pour l'industrialisation des VLA, de plus en plus déployés sur bras manipulateurs et humanoïdes : ces modèles excellent sur des tâches visuelles généralistes mais restent fragiles dès qu'il faut saisir, insérer ou assembler avec un contact fin, un scénario omniprésent en logistique et en assemblage industriel. En montrant qu'une correction résiduelle bornée, greffée sur un VLA figé, suffit à gagner plus de 30 points de réussite sans réentraîner le modèle de base, ViTaR ouvre une voie pour ajouter de la robustesse tactile aux piles VLA existantes sans dégrader leurs capacités généralistes. Les approches précédentes laissaient au contraire au tactile une influence non bornée sur l'action générée, au risque de contredire les a priori qui font la généralisabilité de ces modèles. Le travail s'inscrit dans les efforts pour doter les modèles VLA de fondation, dans la lignée de familles comme Pi-0, GR00T ou Helix, d'une perception multimodale plus fine que la seule vision. Publié comme soumission arXiv nouvelle, ViTaR reste à ce stade une contribution de recherche validée sur un benchmark simulé et par des essais robot physique limités, sans annonce de déploiement industriel ni de partenariat commercial. Les auteurs ne donnent pas de calendrier pour une intégration dans des piles VLA commerciales existantes.

RecherchePaper
1 source
BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques
2arXiv cs.RO 

BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques

Des chercheurs ont publié sur arXiv (arXiv:2605.30226) BORA, un cadre de post-entraînement mêlant apprentissage par renforcement hors ligne et adaptation résiduelle en ligne, conçu pour les modèles VLA (Vision-Language-Action) appliqués à la manipulation dextre. Le système fonctionne en deux phases: hors ligne, un réseau critique est entraîné en prenant comme entrées les tokens cognitifs du modèle de langage-vision et les chunks d'actions, ce qui lui permet d'évaluer les mouvements de main au-delà du seul contexte visuel. En ligne, le modèle VLA de base est gelé et une couche d'adaptation résiduelle légère de type chunk-wise est introduite, guidée par un mécanisme Human-in-the-Loop (HiL) générant des récompenses à partir d'interventions humaines. Évalué sur cinq tâches réelles de manipulation dextre complexe, BORA affiche une hausse absolue de 33 points de pourcentage du taux de succès moyen face aux baselines standards, et jusqu'à +43 points sur des objets non vus lors de l'entraînement. Ces résultats s'attaquent à l'un des verrous persistants de la robotique dextre: les mains à haute dimensionnalité amplifient les erreurs d'exécution cumulées, rendant l'exploration RL en conditions réelles à la fois inefficace et risquée pour le matériel. L'approche de BORA, qui préserve le modèle pré-entraîné comme prior stable et n'ajoute qu'une couche corrective légère, circonscrit l'espace d'exploration plutôt que de le réouvrir entièrement. Le gain de 43% sur objets non vus suggère une généralisation réelle plutôt qu'un surapprentissage des démonstrations, ce qui distingue ce travail des pipelines d'imitation learning classiques. Pour un intégrateur ou un décideur B2B, cela valide une trajectoire concrète: spécialiser un VLA généraliste pour une tâche dextre sans repartir d'un entraînement complet. Les VLA ont connu une accélération notable depuis Pi-0 de Physical Intelligence, OpenVLA (Berkeley) ou RoboVLMs (Google DeepMind), mais la manipulation fine multi-doigts reste leur point faible documenté. BORA s'inscrit dans un mouvement offline-to-online concurrent d'approches comme RLPD ou Cal-QL, qui cherchent à rendre le RL online moins destructif pour les politiques pré-apprises. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans la publication; il s'agit pour l'instant d'un résultat de recherche sans annonce de commercialisation. La dépendance au HiL en phase online reste par ailleurs une limite pratique non résolue pour un passage à l'échelle industrielle.

RechercheOpinion
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
3arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
OmniTacTune : RL réel, agnostique, pour l'adaptation résiduelle tactile des politiques visuelles
4arXiv cs.RO 

OmniTacTune : RL réel, agnostique, pour l'adaptation résiduelle tactile des politiques visuelles

Des chercheurs présentent OmniTacTune, un pipeline d'apprentissage par renforcement en conditions réelles capable de s'adapter à n'importe quelle politique visuelle préentraînée, quelle que soit son architecture. Le système fonctionne en deux temps : il amorce d'abord un apprentissage sensible au toucher à partir de déploiements autonomes de la politique visuelle de base, puis entraîne une politique résiduelle tactile légère par interaction en ligne directement sur le robot. Testé sur quatre tâches de manipulation à contact riche en conditions réelles, OmniTacTune fait grimper le taux de réussite des politiques visuelles de base de 5-40% à 85-100%, en seulement 40 à 80 minutes d'entraînement supplémentaire. Ce résultat s'attaque à un problème connu des politiques visuelles apprises à partir de vidéos humaines, de téléopération ou de démonstrations robotiques : ces a priori moteurs généralisent bien pour les mouvements macroscopiques mais échouent souvent dès que la tâche exige un contrôle fin de la force et de la géométrie de contact, comme l'insertion de pièces ou la manipulation d'objets déformables. En ajoutant une correction résiduelle tactile plutôt qu'en réentraînant une politique multimodale complète, la méthode propose une voie peu coûteuse pour combler ce fossé, sans exiger de collecter de larges jeux de données tactiles, historiquement chers et peu transférables d'un capteur, d'un robot ou d'une tâche à l'autre. Pour les intégrateurs et les équipes de R&D en manipulation robotique, cela ouvre la possibilité d'améliorer des politiques déjà déployées sans repartir de zéro, un enjeu important alors que la manipulation à contact riche reste l'un des principaux points de friction entre démonstrations en laboratoire et déploiements industriels réels. L'approche s'inscrit dans la tendance des politiques vision-langage-action et de leurs limites en manipulation fine, sujet déjà soulevé autour de modèles comme Pi-0 ou GR00T N2, où l'écart entre démonstrations impressionnantes et robustesse réelle reste surveillé de près par le secteur. En se voulant agnostique vis-à-vis de la politique visuelle de base et de la représentation tactile employée, OmniTacTune vise la généralisation plutôt qu'une solution ad hoc liée à un capteur ou un robot précis, ce qui le distingue des approches tactiles propres à une seule plateforme. Les auteurs proposent une page projet avec démonstrations, sans préciser à ce stade de calendrier de portage vers des plateformes commerciales, laissant ouverte la question du délai avant qu'une telle méthode résiduelle ne soit reprise par des acteurs de la manipulation industrielle ou humanoïde.

RecherchePaper
1 source