Au-delà de l'importance des tokens : préserver les échafaudages spatiaux pour une inférence VLA efficace
Une équipe de chercheurs propose GeoScaffold, une méthode d'élagage (pruning) des tokens visuels pour les modèles vision-langage-action (VLA), qui ne demande aucun réentraînement. Le travail, publié sur arXiv (2609.36967), part d'un constat : les stratégies existantes retiennent des tokens visuels individuels selon leur pertinence sémantique pour la tâche, sans tenir compte de l'information spatiale que la manipulation exige. Pour tester cette limite, les auteurs construisent une référence volontairement simple, « Stride », qui échantillonne uniformément les tokens sur la séquence visuelle aplatie en une dimension, soit un élagage purement géométrique. Sur pi 0.5 et le benchmark de simulation LIBERO, GeoScaffold conserve seulement 20 % des tokens visuels tout en maintenant un taux de succès moyen de 93,2 %, avec une accélération de 1,78 fois de la phase de prefill par rapport au modèle non élagué.
Le résultat le plus instructif tient au comportement de Stride. À certains taux d'élagage, cette méthode naïve dépasse l'élagage sémantique et l'élagage aléatoire, mais elle s'effondre dès que le budget de tokens baisse légèrement. Les auteurs l'expliquent par le « rayon de couverture spatiale », c'est-à-dire le plus grand angle mort créé dans l'image par l'ensemble des tokens conservés, et ils observent une forte corrélation entre ce rayon et le succès des tâches. Pour les équipes qui cherchent à faire tourner des VLA sur du calcul embarqué, le message est clair : choisir les tokens « importants » ne suffit pas, il faut aussi préserver l'échafaudage géométrique de la scène. Cela remet en cause l'idée, héritée de la vision par ordinateur généraliste, que la pertinence sémantique suffit à guider la compression pour le contrôle robotique. Le gain reste modeste sur le prefill, et il est mesuré uniquement en simulation. Aucune validation sur robot réel, latence de bout en bout ou consommation n'est annoncée dans le résumé.
GeoScaffold découpe chaque image en régions spatiales, répartit le budget de tokens entre régions selon des poids de pertinence pour la tâche, puis choisit à l'intérieur de chaque région des tokens « d'échafaudage » par échantillonnage du point le plus éloigné (farthest point sampling), afin de réduire le rayon de couverture local. Il s'inscrit dans une série de travaux sur l'accélération des VLA, dont pi 0.5 de Physical Intelligence est ici le modèle de référence, et qui cherchent à réduire le coût d'inférence sans repasser par l'entraînement. LIBERO reste un banc d'essai en simulation, dont les scènes sont plus régulières que celles d'un site industriel, ce qui limite la portée des 93,2 % annoncés. La suite logique serait un test sur d'autres architectures VLA et sur matériel réel, mais aucun calendrier n'est communiqué.
Dans nos dossiers




