Aller au contenu principal
τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future
RecherchearXiv cs.RO 

τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2607.24485v1, catégorie "new") présente τ (tau), un framework qui enrichit les modèles Vision-Language-Action (VLA) avec une représentation tactile spatio-temporelle conditionnée par l'action. La méthode s'inspire du JEPA (Joint-Embedding Predictive Architecture) : elle apprend cette représentation en prédisant les futures observations visuelles à partir du signal tactile, puis fusionne cette information avec les caractéristiques vision-langage pour générer les actions du robot. Cette supervision opère uniquement dans l'espace latent et pendant l'entraînement, sans surcoût au moment du déploiement. Les auteurs publient également TacAura, un jeu de données synchronisant vision, proprioception et signaux tactiles à base de capteurs visuels, collecté sur quatre tâches de manipulation impliquant des contacts riches.

L'enjeu est la sous-exploitation du toucher dans les modèles VLA actuels, qui reposent majoritairement sur la vision et le langage, ou au mieux sur une détection binaire de contact ou des séquences de torseurs 6D, insuffisantes pour exploiter des signaux tactiles haute dimension. Le papier s'attaque frontalement au problème de rareté des données : les démonstrations spécifiques à une tâche sont limitées, tandis qu'un pré-entraînement tactile à grande échelle reste coûteux. En montrant qu'une supervision auto-supervisée de type JEPA permet d'extraire une représentation tactile exploitable avec peu de données, l'étude touche à un débat central du secteur, celui de l'efficacité des données pour des tâches de manipulation fine (insertion, préhension d'objets déformables) où la seule vision atteint ses limites, un enjeu direct pour les intégrateurs industriels visant l'assemblage de précision.

Ce travail s'inscrit dans la lignée des modèles VLA généralistes (Pi-0, GR00T N2, Helix) qui combinent perception et langage pour piloter des robots, mais qui ont historiquement négligé le tactile faute de capteurs standardisés et à cause du coût de collecte. Les auteurs comparent τ à des approches existantes centrées sur les états de contact instantanés, et démontrent une meilleure généralisation à des objets et scènes inédits. Il s'agit à ce stade d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenariat commercial.

À lire aussi

Modèles vision-langage-action : superviser les VLA au-delà des actions physiques
1arXiv cs.RO 

Modèles vision-langage-action : superviser les VLA au-delà des actions physiques

Une équipe de recherche propose UVT (Unified Visuomotor Target), une méthode d'entraînement pour les modèles vision-langage-action (VLA), détaillée dans un article déposé sur arXiv en août 2026 (2608.03563v1). Le point de départ : les VLA sont entraînés à prédire directement des commandes moteur bas niveau à partir d'observations visuelles et de langage, alors que les modèles vision-langage sous-jacents encodent des représentations riches et de haut niveau des scènes et des objectifs, un décalage qui freine l'apprentissage. UVT introduit une cible latente unique encodant conjointement le contrôle moteur et la transition visuelle de la scène, sans modifier l'architecture ni ajouter de données. Testée sur deux systèmes VLA représentatifs, en simulation comme sur des tâches réelles de manipulation bimanuelle, elle améliore l'efficacité d'entraînement, la performance finale et la robustesse de la politique, avec des gains marqués sous budget d'entraînement limité ou en conditions difficiles. Pour l'industrie robotique, ce travail touche un point de friction bien identifié : la difficulté à obtenir des politiques VLA robustes sans volumes massifs de démonstrations téléopérées, coûteuses à collecter. En montrant qu'un simple changement de cible d'entraînement, sans toucher à l'architecture ni au volume de données, améliore l'efficacité et la robustesse, UVT s'inscrit dans une tendance cherchant à mieux exploiter l'information déjà présente dans les modèles vision-langage préentraînés plutôt que d'empiler paramètres ou données. Pour les équipes qui entraînent leurs propres politiques (laboratoires, intégrateurs, startups humanoïdes), c'est un levier peu coûteux à tester. Les résultats restent toutefois obtenus sur benchmarks et tâches de manipulation en conditions contrôlées ; leur généralisation à des environnements industriels variés et à d'autres familles de VLA n'est pas démontrée. L'article s'inscrit dans la vague de recherche VLA ouverte par des systèmes comme RT-2, OpenVLA, Pi-0 ou GR00T, qui adaptent des modèles vision-langage préentraînés à la prédiction d'actions robotiques. L'essentiel des travaux récents porte sur l'échelle des données ou sur l'architecture (tokenisation des actions, diffusion, mélange d'experts) ; UVT prend le contre-pied en questionnant la cible de supervision elle-même, tout en restant compatible avec les architectures VLA existantes, ce qui facilite en théorie son adoption. La publication ne mentionne aucun partenariat industriel ni déploiement au-delà des tests de laboratoire. Il s'agit pour l'instant d'une contribution méthodologique dont l'impact dépendra de sa reproduction sur d'autres jeux de données et d'autres plateformes robotiques, humanoïdes comprises.

RecherchePaper
1 source
Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels
2arXiv cs.RO 

Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels

Des chercheurs ont publié sur arXiv une version révisée d'un article intitulé "Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching" (identifiant arXiv:2602.00686v2), qui reformule l'accélération de l'inférence des modèles Vision-Language-Action (VLA) en robotique manipulatrice comme un problème d'apprentissage de politique plutôt qu'une règle fixe. Le système repose sur deux modules légers entraînés conjointement avec le modèle: un Cached Token Selector, qui choisit quels tokens visuels réutiliser d'une étape à l'autre, et un Cache Ratio Predictor, qui détermine la proportion de tokens à mettre en cache selon l'évolution de la scène. Ces décisions étant discrètes par nature, les auteurs les rendent différentiables pour permettre un entraînement de bout en bout par descente de gradient. Évaluée sur les bancs d'essai LIBERO et SIMPLER ainsi que sur un robot réel, la méthode atteint une accélération de 1,76x du temps d'inférence en conditions réelles, tout en améliorant le taux de réussite moyen de 1,9 point sur LIBERO (de 75,0% à 76,9%) et de 5,0 points sur les tâches en environnement physique, devançant les méthodes de référence existantes. L'enjeu pour les intégrateurs et concepteurs de systèmes robotiques tient au goulot d'étranglement bien connu des modèles VLA: leur coût de calcul freine le déploiement embarqué, notamment sur des contrôleurs à ressources limitées. Les approches actuelles de mise en cache ou d'élagage de tokens sont généralement statiques et fondées sur des heuristiques, donc mal adaptées aux changements dynamiques de scène. Montrer qu'une politique apprise peut à la fois accélérer l'inférence et améliorer légèrement la précision, plutôt que la dégrader comme c'est souvent le cas avec les techniques de compression, va à l'encontre de l'hypothèse répandue d'un compromis strict entre vitesse et fiabilité pour les architectures VLA. Ce travail s'inscrit dans la lignée des recherches sur l'efficacité des modèles VLA à grande échelle, un axe jugé aussi critique que la généralisation elle-même pour leur adoption industrielle. Les auteurs comparent explicitement leur approche aux méthodes existantes de cache par règles, sans toutefois nommer de modèles VLA commerciaux précis dans le résumé fourni. Il s'agit à ce stade d'une contribution académique publiée en preprint, testée en laboratoire et sur un nombre limité de tâches réelles, et non d'un produit ou d'un déploiement industriel; les suites annoncées concernent l'extension de ces politiques d'allocation de calcul apprises à d'autres familles de modèles VLA.

RecherchePaper
1 source
N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents
3arXiv cs.RO 

N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents

Une équipe de recherche présente N0-VTLA, un modèle fondation vision-tactile-langage-action (VTLA) conçu pour la manipulation fine en contact avec des objets, combinant perception tactile et contrôle par retour tactile. Décrit dans un article publié sur arXiv (2607.23782), le système repose sur trois étapes d'entraînement : un pré-entraînement visuo-tactile sur NeoData, un vaste jeu de données robotiques propriétaire combinant vision et toucher, une intégration progressive d'un canal tactile dédié, puis une amélioration de politique hors ligne baptisée ALTER. Les auteurs revendiquent le premier modèle VTLA pré-entraîné sur des données tactiles à cette échelle. Sur les neuf tâches du benchmark réel NeoReal, N0-VTLA l'emporte face à toutes les méthodes concurrentes testées. Sur une suite de vingt tâches en simulation, il atteint 63,8% de réussite moyenne, contre 44,0% pour la meilleure référence. Les politiques entraînées avec ALTER atteignent 75 à 95% de réussite sur trois tâches réelles à horizon long. Ces résultats ciblent un point de friction connu de la robotique manipulatrice : les modèles vision-langage-action actuels gèrent mal les tâches nécessitant un contact fin et continu, comme la manipulation d'objets déformables, faute d'un signal tactile correctement intégré. En démontrant qu'un canal tactile prédictif, distillé à partir de priors appris à grande échelle, améliore significativement la réussite sur des tâches de préhension délicate, l'étude apporte un argument concret pour l'intégration systématique du toucher dans les futures architectures VLA, un sujet jusqu'ici moins mature que la seule perception visuelle. La méthode ALTER, qui transforme des comparaisons de progression et d'événements de trajectoire en étiquettes d'avantage binaires, offre aussi une piste pour exploiter des corpus de déploiement déjà collectés sans reconstruire un pipeline de reward complexe. Le travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0, GR00T N2, Helix) qui cherchent à généraliser la manipulation robotique au-delà de tâches scriptées, mais reste à ce stade une contribution académique évaluée sur des benchmarks internes aux auteurs plutôt qu'un produit ou un déploiement industriel documenté. Aucune date de disponibilité, aucun partenariat commercial ni acteur français ou européen n'est mentionné dans l'article ; les prochaines étapes annoncées concernent l'extension du jeu de données NeoData et l'application d'ALTER à d'autres familles de tâches de manipulation contact-riches.

RechercheActu
1 source
Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

Des pixels aux tokens : étude systématique de la supervision par actions latentes pour les modèles vision-langage-action (VLA)

Des chercheurs de l'Université Renmin de Chine (RUC) ont publié le 7 mai 2026 une étude systématique sur la supervision par actions latentes dans les modèles VLA (Vision-Language-Action), une architecture clé pour les robots capables de comprendre des instructions en langage naturel et d'agir dans le monde physique. L'article, référencé arXiv:2605.04678, pose une question concrète : comment entraîner efficacement un VLA sur des datasets hétérogènes, issus de robots différents avec des espaces d'action incompatibles ? La réponse explorée est l'action latente, une représentation intermédiaire abstraite qui sert de pivot commun entre perception visuelle, langage et commande motrice. Les auteurs comparent quatre stratégies d'intégration sous une baseline VLA unifiée, en distinguant deux familles : les actions latentes basées sur l'image (qui encodent les transitions visuelles entre frames) et celles basées sur l'action (qui compressent directement les commandes moteurs dans un espace latent). Les résultats révèlent une correspondance formulation-tâche claire, ce qui est utile pour tout intégrateur qui choisit une architecture : les actions latentes image-based sont plus efficaces sur les tâches longues nécessitant un raisonnement multi-étapes et une généralisation au niveau de la scène, tandis que les actions latentes action-based surperforment sur la coordination motrice fine et complexe. La découverte la plus opérationnelle est que superviser directement le modèle de langage vision (VLM) avec des tokens discrets d'actions latentes donne les meilleures performances globales, devançant les approches de supervision continue ou indirecte. L'étude apporte également des premières preuves que la supervision par actions latentes améliore l'entraînement en données mixtes (multi-robot, multi-tâche), un verrou majeur pour passer du lab au déploiement à grande échelle. Ce travail s'inscrit dans une course effrénée à la généralisation des VLA, après les succès récents de Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA), qui ont tous démontré des capacités cross-embodiment limitées mais prometteuses. La contribution de RUC est moins un nouveau modèle qu'un benchmark de design choices, un type de contribution rare et précieux dans un domaine encore dominé par les démonstrations spectaculaires. La prochaine étape naturelle serait de valider ces résultats sur du matériel réel au-delà des benchmarks simulés, notamment sur des plateformes comme ALOHA 2 ou des manipulateurs industriels, pour confirmer que le gap sim-to-real ne neutralise pas les gains observés en simulation. Le code est disponible sur GitHub (RUCKBReasoning/FromPixelsto_Tokens).

RechercheOpinion
1 source