Aller au contenu principal
Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels
RecherchearXiv cs.RO 

Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv une version révisée d'un article intitulé "Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching" (identifiant arXiv:2602.00686v2), qui reformule l'accélération de l'inférence des modèles Vision-Language-Action (VLA) en robotique manipulatrice comme un problème d'apprentissage de politique plutôt qu'une règle fixe. Le système repose sur deux modules légers entraînés conjointement avec le modèle: un Cached Token Selector, qui choisit quels tokens visuels réutiliser d'une étape à l'autre, et un Cache Ratio Predictor, qui détermine la proportion de tokens à mettre en cache selon l'évolution de la scène. Ces décisions étant discrètes par nature, les auteurs les rendent différentiables pour permettre un entraînement de bout en bout par descente de gradient. Évaluée sur les bancs d'essai LIBERO et SIMPLER ainsi que sur un robot réel, la méthode atteint une accélération de 1,76x du temps d'inférence en conditions réelles, tout en améliorant le taux de réussite moyen de 1,9 point sur LIBERO (de 75,0% à 76,9%) et de 5,0 points sur les tâches en environnement physique, devançant les méthodes de référence existantes.

L'enjeu pour les intégrateurs et concepteurs de systèmes robotiques tient au goulot d'étranglement bien connu des modèles VLA: leur coût de calcul freine le déploiement embarqué, notamment sur des contrôleurs à ressources limitées. Les approches actuelles de mise en cache ou d'élagage de tokens sont généralement statiques et fondées sur des heuristiques, donc mal adaptées aux changements dynamiques de scène. Montrer qu'une politique apprise peut à la fois accélérer l'inférence et améliorer légèrement la précision, plutôt que la dégrader comme c'est souvent le cas avec les techniques de compression, va à l'encontre de l'hypothèse répandue d'un compromis strict entre vitesse et fiabilité pour les architectures VLA.

Ce travail s'inscrit dans la lignée des recherches sur l'efficacité des modèles VLA à grande échelle, un axe jugé aussi critique que la généralisation elle-même pour leur adoption industrielle. Les auteurs comparent explicitement leur approche aux méthodes existantes de cache par règles, sans toutefois nommer de modèles VLA commerciaux précis dans le résumé fourni. Il s'agit à ce stade d'une contribution académique publiée en preprint, testée en laboratoire et sur un nombre limité de tâches réelles, et non d'un produit ou d'un déploiement industriel; les suites annoncées concernent l'extension de ces politiques d'allocation de calcul apprises à d'autres familles de modèles VLA.

À lire aussi

N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents
1arXiv cs.RO 

N₀-VTLA : passage à l'échelle du modèle vision-tactile-langage-action grâce à des tokens tactiles latents

Une équipe de recherche présente N0-VTLA, un modèle fondation vision-tactile-langage-action (VTLA) conçu pour la manipulation fine en contact avec des objets, combinant perception tactile et contrôle par retour tactile. Décrit dans un article publié sur arXiv (2607.23782), le système repose sur trois étapes d'entraînement : un pré-entraînement visuo-tactile sur NeoData, un vaste jeu de données robotiques propriétaire combinant vision et toucher, une intégration progressive d'un canal tactile dédié, puis une amélioration de politique hors ligne baptisée ALTER. Les auteurs revendiquent le premier modèle VTLA pré-entraîné sur des données tactiles à cette échelle. Sur les neuf tâches du benchmark réel NeoReal, N0-VTLA l'emporte face à toutes les méthodes concurrentes testées. Sur une suite de vingt tâches en simulation, il atteint 63,8% de réussite moyenne, contre 44,0% pour la meilleure référence. Les politiques entraînées avec ALTER atteignent 75 à 95% de réussite sur trois tâches réelles à horizon long. Ces résultats ciblent un point de friction connu de la robotique manipulatrice : les modèles vision-langage-action actuels gèrent mal les tâches nécessitant un contact fin et continu, comme la manipulation d'objets déformables, faute d'un signal tactile correctement intégré. En démontrant qu'un canal tactile prédictif, distillé à partir de priors appris à grande échelle, améliore significativement la réussite sur des tâches de préhension délicate, l'étude apporte un argument concret pour l'intégration systématique du toucher dans les futures architectures VLA, un sujet jusqu'ici moins mature que la seule perception visuelle. La méthode ALTER, qui transforme des comparaisons de progression et d'événements de trajectoire en étiquettes d'avantage binaires, offre aussi une piste pour exploiter des corpus de déploiement déjà collectés sans reconstruire un pipeline de reward complexe. Le travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0, GR00T N2, Helix) qui cherchent à généraliser la manipulation robotique au-delà de tâches scriptées, mais reste à ce stade une contribution académique évaluée sur des benchmarks internes aux auteurs plutôt qu'un produit ou un déploiement industriel documenté. Aucune date de disponibilité, aucun partenariat commercial ni acteur français ou européen n'est mentionné dans l'article ; les prochaines étapes annoncées concernent l'extension du jeu de données NeoData et l'application d'ALTER à d'autres familles de tâches de manipulation contact-riches.

RechercheActu
1 source
Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution
2arXiv cs.RO 

Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution

Des chercheurs proposent SALT (Self-supervised Adaptation from Leftover Trajectories), une méthode d'adaptation au moment du test pour les modèles vision-langage-action (VLA), publiée sur arXiv (2610.07946). Elle cible un problème précis : une perturbation visuelle (corruption d'image, obstruction physique de la caméra) survient en cours d'exécution, sans que la politique connaisse son type ni son moment d'apparition. SALT exploite la « trajectoire résiduelle », c'est-à-dire la partie non exécutée du chunk d'actions précédent. Les chunks consécutifs se recouvrant dans le temps, ce résidu fournit une cible alignée sur le même intervalle de contrôle que la prédiction courante. Aucune annotation de perturbation, aucune action d'expert et aucune démonstration du domaine cible ne sont requises. Une porte d'adaptation légère, calibrée uniquement sur des trajectoires nominales, déclenche les mises à jour. Sur LIBERO-10, le taux de succès moyen sur cinq corruptions visuelles persistantes passe de 43,9 % à 53,2 % avec SmolVLA, et de 58,7 % à 66,0 % avec GR00T N1.7, avec une performance nominale largement préservée. Sur robot réel, la progression de tâche moyenne, perturbations numériques et physiques confondues, passe de 0,49 à 0,61. L'intérêt tient à la nature du problème traité. La plupart des travaux de robustesse des VLA supposent un entraînement avec augmentation de données ou une connaissance du décalage de domaine. Or en production, caméras salies, éclairage changeant ou occultations partielles arrivent sans préavis. SALT suggère qu'on peut gagner entre 7 et 9 points de succès sans données supplémentaires, en recyclant les prédictions déjà produites par le modèle. Deux mécanismes expliquent l'effet : à l'apparition du décalage, le résidu garde un plan formé avant la corruption et sert d'ancre (Transition Anchoring), puis la correction se propage d'un replanning à l'autre (Sequential Correction Propagation). Les limites sont nettes : le gain reste modeste en valeur absolue, les taux de succès restent sous les 70 %, et le test sur robot réel, mesuré par un score de progression et non un taux de réussite, offre peu de détails sur le nombre d'essais ou les tâches. Le benchmark LIBERO reste de plus de la simulation. Ce travail s'inscrit dans l'effort de fiabilisation des VLA après la vague de modèles généralistes comme Pi-0, GR00T ou SmolVLA, dont l'écart entre démonstration et déploiement tient souvent à la sensibilité aux conditions visuelles. L'approche rejoint l'adaptation au moment du test, déjà explorée en vision par ordinateur, mais l'applique ici à la structure par chunks d'actions propre aux politiques modernes. Elle reste un résultat de recherche, sans produit ni déploiement annoncé. Les prochaines étapes probables sont des validations sur d'autres architectures, des perturbations plus variées et des tâches longues, ainsi qu'une évaluation du coût de calcul des mises à jour en ligne sur du matériel embarqué, point que le résumé ne chiffre pas.

RecherchePaper
1 source
τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future
3arXiv cs.RO 

τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future

Un article publié sur arXiv (référence 2607.24485v1, catégorie "new") présente τ (tau), un framework qui enrichit les modèles Vision-Language-Action (VLA) avec une représentation tactile spatio-temporelle conditionnée par l'action. La méthode s'inspire du JEPA (Joint-Embedding Predictive Architecture) : elle apprend cette représentation en prédisant les futures observations visuelles à partir du signal tactile, puis fusionne cette information avec les caractéristiques vision-langage pour générer les actions du robot. Cette supervision opère uniquement dans l'espace latent et pendant l'entraînement, sans surcoût au moment du déploiement. Les auteurs publient également TacAura, un jeu de données synchronisant vision, proprioception et signaux tactiles à base de capteurs visuels, collecté sur quatre tâches de manipulation impliquant des contacts riches. L'enjeu est la sous-exploitation du toucher dans les modèles VLA actuels, qui reposent majoritairement sur la vision et le langage, ou au mieux sur une détection binaire de contact ou des séquences de torseurs 6D, insuffisantes pour exploiter des signaux tactiles haute dimension. Le papier s'attaque frontalement au problème de rareté des données : les démonstrations spécifiques à une tâche sont limitées, tandis qu'un pré-entraînement tactile à grande échelle reste coûteux. En montrant qu'une supervision auto-supervisée de type JEPA permet d'extraire une représentation tactile exploitable avec peu de données, l'étude touche à un débat central du secteur, celui de l'efficacité des données pour des tâches de manipulation fine (insertion, préhension d'objets déformables) où la seule vision atteint ses limites, un enjeu direct pour les intégrateurs industriels visant l'assemblage de précision. Ce travail s'inscrit dans la lignée des modèles VLA généralistes (Pi-0, GR00T N2, Helix) qui combinent perception et langage pour piloter des robots, mais qui ont historiquement négligé le tactile faute de capteurs standardisés et à cause du coût de collecte. Les auteurs comparent τ à des approches existantes centrées sur les états de contact instantanés, et démontrent une meilleure généralisation à des objets et scènes inédits. Il s'agit à ce stade d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenariat commercial.

RecherchePaper
1 source
Mise en cache adaptative par blocs pour accélérer les politiques de diffusion
4arXiv cs.RO 

Mise en cache adaptative par blocs pour accélérer les politiques de diffusion

Une équipe de chercheurs a publié sur arXiv (2506.13456) BAC, pour Block-wise Adaptive Caching, une méthode d'accélération de l'inférence pour Diffusion Policy. Le principe : mettre en cache les features d'action intermédiaires générées lors des étapes répétitives de débruitage (denoising), puis les réutiliser sélectivement selon un schéma adaptatif au niveau de chaque bloc du transformeur. Résultat annoncé : jusqu'à 3x de speedup à l'inférence, sans dégradation des performances en génération d'action. BAC est training-free et compatible avec les architectures Diffusion Policy à base de transformeur ainsi qu'avec les modèles vision-language-action (VLA). Les expériences couvrent plusieurs benchmarks robotiques standards, sans déploiement matériel réel annoncé dans ce papier. L'enjeu est direct pour le déploiement industriel : Diffusion Policy est l'une des approches les plus solides pour le contrôle visuomoteur de robots manipulateurs, mais son coût computationnel élevé la rend impraticable en contrôle temps-réel embarqué. Un facteur 3x sans re-training représente un gain opérationnel concret, il suffit d'intégrer BAC sur un modèle existant déjà entraîné. Deux mécanismes y contribuent : un Adaptive Caching Scheduler qui identifie les pas de temps optimaux pour rafraîchir le cache en maximisant la similarité globale des features, et un Bubbling Union Algorithm qui corrige la propagation d'erreurs entre blocs FFN (Feed-Forward Network), principale limite des approches naïves de caching. Diffusion Policy, introduite par Chi et al. en 2023, s'est imposée comme référence pour la manipulation précise, mais son inférence multi-step la pénalise face aux politiques autorégressives ou MLP sur les contraintes de latence. Les techniques d'accélération des modèles de diffusion conçues pour la génération d'images (DDIM, DeepCache) ne se transfèrent pas directement à la robotique en raison de divergences architecturales et de la nature séquentielle des données d'action, c'est précisément le gap que BAC prétend combler. La méthode est compatible avec les VLA récents comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), ce qui lui confère un périmètre d'application large sur l'écosystème actuel. La validation reste cependant limitée aux benchmarks simulés ; une confirmation sur hardware réel en conditions d'inférence embarquée sera nécessaire pour évaluer l'impact opérationnel réel.

RecherchePaper
1 source