Aller au contenu principal
RecherchearXiv cs.RO 

Au-delà de l'importance des tokens : préserver les échafaudages spatiaux pour une inférence VLA efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose GeoScaffold, une méthode d'élagage (pruning) des tokens visuels pour les modèles vision-langage-action (VLA), qui ne demande aucun réentraînement. Le travail, publié sur arXiv (2609.36967), part d'un constat : les stratégies existantes retiennent des tokens visuels individuels selon leur pertinence sémantique pour la tâche, sans tenir compte de l'information spatiale que la manipulation exige. Pour tester cette limite, les auteurs construisent une référence volontairement simple, « Stride », qui échantillonne uniformément les tokens sur la séquence visuelle aplatie en une dimension, soit un élagage purement géométrique. Sur pi 0.5 et le benchmark de simulation LIBERO, GeoScaffold conserve seulement 20 % des tokens visuels tout en maintenant un taux de succès moyen de 93,2 %, avec une accélération de 1,78 fois de la phase de prefill par rapport au modèle non élagué.

Le résultat le plus instructif tient au comportement de Stride. À certains taux d'élagage, cette méthode naïve dépasse l'élagage sémantique et l'élagage aléatoire, mais elle s'effondre dès que le budget de tokens baisse légèrement. Les auteurs l'expliquent par le « rayon de couverture spatiale », c'est-à-dire le plus grand angle mort créé dans l'image par l'ensemble des tokens conservés, et ils observent une forte corrélation entre ce rayon et le succès des tâches. Pour les équipes qui cherchent à faire tourner des VLA sur du calcul embarqué, le message est clair : choisir les tokens « importants » ne suffit pas, il faut aussi préserver l'échafaudage géométrique de la scène. Cela remet en cause l'idée, héritée de la vision par ordinateur généraliste, que la pertinence sémantique suffit à guider la compression pour le contrôle robotique. Le gain reste modeste sur le prefill, et il est mesuré uniquement en simulation. Aucune validation sur robot réel, latence de bout en bout ou consommation n'est annoncée dans le résumé.

GeoScaffold découpe chaque image en régions spatiales, répartit le budget de tokens entre régions selon des poids de pertinence pour la tâche, puis choisit à l'intérieur de chaque région des tokens « d'échafaudage » par échantillonnage du point le plus éloigné (farthest point sampling), afin de réduire le rayon de couverture local. Il s'inscrit dans une série de travaux sur l'accélération des VLA, dont pi 0.5 de Physical Intelligence est ici le modèle de référence, et qui cherchent à réduire le coût d'inférence sans repasser par l'entraînement. LIBERO reste un banc d'essai en simulation, dont les scènes sont plus régulières que celles d'un site industriel, ce qui limite la portée des 93,2 % annoncés. La suite logique serait un test sur d'autres architectures VLA et sur matériel réel, mais aucun calendrier n'est communiqué.

À lire aussi

Réduction de la redondance temporelle pour une inférence VLA efficace
1arXiv cs.RO 

Réduction de la redondance temporelle pour une inférence VLA efficace

Des chercheurs publient sur arXiv (arXiv:2607.12287v1) une méthode d'accélération pour les modèles Vision-Language-Action (VLA), utilisés en manipulation robotique, dont la latence d'inférence freine aujourd'hui le déploiement en temps réel. Ils identifient deux sources de redondance temporelle dans les pipelines VLA existants : le réencodage visuel complet de trames vidéo consécutives quasi identiques, et l'échantillonnage itératif multi-étapes propre aux politiques d'action basées sur la diffusion. Leur réponse combine deux optimisations système. Côté perception, seuls les tokens correspondant aux régions dynamiques de la scène sont mis à jour de façon incrémentale, au lieu de réencoder l'image entière à chaque frame. Côté génération d'action, le calendrier de diffusion est compressé à seulement deux étapes grâce à un entraînement spécifiquement optimisé pour l'efficacité, sans sacrifier la précision des gestes. Testée sur les bancs d'essai simulés Libero et RobotWin ainsi que sur des plateformes robotiques réelles, la méthode obtient un gain de vitesse supérieur à 2x, avec un taux de réussite allant jusqu'à 98% sur des benchmarks de manipulation générale. Le code doit être publié sur GitHub, mais n'est pas encore disponible : il s'agit pour l'instant d'un preprint académique, pas d'un produit livré. Pour les intégrateurs et les équipes robotique, ce travail s'attaque à un goulot d'étranglement bien réel : les politiques de diffusion, très précises, restent lentes à cause du débruitage itératif, ce qui complique leur usage sur du matériel embarqué à budget de calcul limité. Réduire ce coût sans perte de performance rapproche les VLA d'un fonctionnement temps réel sur GPU embarqué plutôt que sur infrastructure cloud dédiée, un enjeu central pour la commercialisation des bras manipulateurs et des humanoïdes. Cette publication s'inscrit dans une vague plus large de travaux visant l'efficacité d'inférence des VLA, alors que des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) ont démontré de fortes capacités de généralisation mais souffrent des mêmes limites de latence. La méthode reste pour l'instant validée en simulation et sur bancs de test restreints ; sa robustesse à grande échelle, en environnement industriel réel, reste à démontrer une fois le code effectivement publié.

RechercheActu
1 source
Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots
2arXiv cs.RO 

Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots

Une équipe de recherche a publié sur arXiv (arXiv:2609.04893v1, soumis début septembre 2026) une méthode nommée Latent Semantic Scaffolding (LSS), conçue pour les modèles vision-langage-action (VLA) qui pilotent des robots manipulateurs. Le constat de départ : les VLA actuels apprennent par imitation à partir de démonstrations humaines et retiennent quelle action exécuter, mais pas pourquoi ; ajouter un raisonnement causal améliore la manipulation, mais les méthodes existantes le paient cher à l'inférence, en générant des tokens de raisonnement ou en simulant des états futurs à chaque pas de contrôle, un surcoût qui s'accumule sur les séquences longues. LSS introduit à la place une perte auxiliaire appliquée uniquement pendant le pré-entraînement sur démonstrations humaines : une petite tête de projection aligne les représentations des tokens d'action du VLA avec des embeddings textuels de justifications physiques du geste. Cette tête est ensuite supprimée à l'inférence, laissant la politique de base intacte et donc sans coût additionnel au déploiement. La découverte centrale concerne la granularité de cet alignement : une version « Dense », qui relie chaque token d'action au raisonnement propre à sa phase de manipulation, transfère nettement mieux vers des tâches inédites qu'une version « Pooled » fondée sur un embedding unique pour tout l'épisode, laquelle se sur-spécialise à la tâche d'entraînement. Une sonde représentationnelle montre que Dense LSS induit environ deux fois plus de séparabilité par phase dans le réseau de base. Le résultat intéresse directement les concepteurs de politiques VLA de type Pi-0, GR00T N2 ou Helix, confrontés à un arbitrage classique entre qualité du raisonnement et fréquence de contrôle en temps réel. En déplaçant le bénéfice du raisonnement causal vers la phase d'entraînement, LSS suggère qu'il est possible d'obtenir un gain de généralisation sans dégrader le temps de cycle ni la charge de calcul embarquée, un point critique pour les intégrateurs qui évaluent le ROI de bras manipulateurs ou d'humanoïdes en production. Il faut toutefois noter qu'il s'agit d'un article de recherche non encore relu par les pairs, avec des résultats obtenus sur un jeu de tâches et d'architectures limité, pas d'une validation à grande échelle industrielle. Ces travaux s'inscrivent dans la lignée des VLA de type fondation qui dominent la robotique de manipulation depuis l'essor de modèles comme RT-2, Pi-0 ou GR00T N2, et dans le prolongement d'une autre famille de méthodes qui injectent du raisonnement explicite via chaînes de pensée ou modèles du monde, au prix d'un calcul supplémentaire à chaque étape. LSS se positionne comme une alternative à ce compromis en traitant l'alignement sémantique comme un mécanisme d'entraînement jetable plutôt que comme un module permanent. L'abstract ne mentionne ni laboratoire ni entreprise nommément, ni acteur français ou européen ; les auteurs annoncent vouloir approfondir l'effet de la granularité de l'alignement sur d'autres tâches et vérifier si Dense LSS se généralise à des architectures VLA de plus grande échelle.

RechercheActu
1 source
rMuscle : mémoire musculaire robotique pour une inférence efficace des modèles vision-langage-action
3arXiv cs.RO 

rMuscle : mémoire musculaire robotique pour une inférence efficace des modèles vision-langage-action

Un preprint arXiv (2609.19104v1, septembre 2026) présente rMuscle, un framework d'inférence en temps réel pour les modèles Vision-Language-Action (VLA) qui pilotent des robots. Le système part d'un constat : dans un poste de travail structuré, les exécutions robotiques répétées montrent une forte similarité, non seulement dans les observations et les trajectoires d'action, mais aussi dans les états internes du modèle. rMuscle exploite cette redondance via un cache à double phase inspiré de la mémoire musculaire humaine : un Context Cache qui réutilise les tokens visuels déjà calculés, et un Action Cache qui réutilise les motifs d'activation des neurones pour réduire les accès aux poids du modèle, son coût restant limité par recalcul en ligne et récupération par fenêtre glissante. Testé sur GPU RTX 4090 et cartes embarquées Jetson Thor, sur les benchmarks de simulation LIBERO et RoboTwin ainsi que sur des tâches de manipulation physique réelle, il affiche une accélération de 1,29 à 1,42 fois sans dégrader les taux de réussite du modèle original. L'enjeu est concret : la latence d'inférence détermine directement la réactivité et la fluidité des mouvements d'un robot, un facteur critique alors que les VLA s'imposent comme le paradigme dominant du contrôle robotique en usine. Les frameworks d'inférence généralistes ignorent pourtant la répétitivité propre aux tâches industrielles structurées, un angle mort que rMuscle attaque directement plutôt que de viser une accélération générique du calcul, ce qui concerne au premier chef les intégrateurs qui déploient des VLA sur du matériel embarqué à ressources limitées comme le Jetson Thor. Le point le plus significatif pour le secteur est que ce gain de vitesse ne dégrade pas le taux de réussite sur robot réel, une réponse directe au doute récurrent sur l'écart entre démonstrations en simulation et performance en conditions réelles. Il s'agit néanmoins d'un résultat de recherche publié en preprint, sans validation par les pairs ni intégration annoncée dans un produit commercial identifié. Ce travail s'inscrit dans la course actuelle à l'optimisation de l'inférence des VLA, devenus le paradigme dominant à mesure que les tâches manuelles répétitives en usine s'imposent comme le scénario de déploiement le plus rentable pour l'IA incarnée. rMuscle se distingue des méthodes génériques de compression ou de quantification de modèles en misant sur la structure même du travail industriel répété poste par poste, sans que les auteurs précisent quels VLA spécifiques ont servi de base expérimentale ni de calendrier de publication du code. La suite logique, non confirmée par l'article, serait une adoption par des frameworks d'inférence robotique plus larges ou des tests sur d'autres plateformes matérielles au-delà du RTX 4090 et du Jetson Thor.

RechercheActu
1 source
Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)
4arXiv cs.RO 

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)

Des chercheurs proposent T³VF (Test-Time Training Visual Foresight VLA), une méthode d'adaptation à l'inférence publiée sur arXiv en mai 2025 (réf. 2605.08215). Les architectures Visual Foresight VLA, qui figurent parmi les plus performantes pour le contrôle de robots manipulateurs, fonctionnent en deux temps : elles prédisent d'abord une image future représentant l'état visuel attendu après l'action, puis génèrent la commande motrice à partir de cette prédiction. Cette dépendance en cascade crée une vulnérabilité double aux situations hors-distribution (OOD) : une prédiction visuelle dégradée corrompt directement la décision motrice en aval. T³VF exploite l'écart entre l'image future prédite et l'observation réellement reçue comme signal de supervision naturel, permettant au modèle de s'ajuster en continu pendant l'exécution, sans modification architecturale ni modules auxiliaires. Un mécanisme de filtrage adaptatif sélectionne les mises à jour pertinentes pour éviter la dérive par accumulation d'erreurs indiscriminée. Pour les équipes de déploiement, l'enjeu est direct : les VLA sont benchmarkés en laboratoire mais confrontés en production à des variations de scène (éclairage, textures, disposition des objets) rarement couvertes par les données d'entraînement. T³VF propose une adaptation sans annotation humaine ni nouvelle session d'entraînement, le robot se corrigeant à partir de ses propres observations, avec un surcoût d'inférence qualifié de modeste par les auteurs, une affirmation à vérifier selon les environnements cibles. Si les résultats se confirment à plus grande échelle, la méthode pourrait réduire les cycles de re-fine-tuning lors du passage en production, un poste de coût opérationnel significatif pour les intégrateurs industriels. Les VLA s'imposent depuis 2023 comme architecture dominante en manipulation robotique, portés par des modèles comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 de Physical Intelligence. Les variantes Visual Foresight, qui ajoutent une prédiction d'état futur avant l'action, ont montré des gains sur les tâches de précision, mais leur fragilité face aux shifts de distribution restait peu adressée dans la littérature. Ce travail s'inscrit dans un courant croissant de Test-Time Training (TTT) appliqué à la robotique, distinct du fine-tuning classique en ce qu'il n'exige aucune supervision externe. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné : ce pré-print académique ne décrit pas de produit ou de déploiement commercialisé associé.

RechercheOpinion
1 source