VLA-ACL : élagage de jetons visuels cohérent avec les actions pour des modèles vision-langage-action (VLA) efficaces
Des chercheurs publient sur arXiv VLA-ACL (Action Consistency Learning), une méthode d'élagage de tokens visuels pour les modèles Vision-Language-Action (VLA), dont le code est disponible sur GitHub. Le système apprend une politique d'élagage légère tout en laissant le modèle VLA de base entièrement gelé. L'entraînement vise à ce que les actions produites à partir d'un contexte visuel élagué restent cohérentes avec celles d'un modèle enseignant qui voit le contexte complet. Les actions de référence (ground truth) ne servent que de supervision auxiliaire. Les tests portent sur le benchmark de simulation LIBERO et sur des tâches de manipulation en conditions réelles. La méthode élimine jusqu'à 87,5 % des tokens visuels tout en gardant des performances jugées compétitives. Elle réduit le calcul jusqu'à 75 % et accélère l'inférence d'un facteur 1,5.
Ces chiffres comptent pour le déploiement. Un VLA doit traiter de longues séquences de tokens à chaque pas de contrôle, et les patchs visuels dominent cette séquence. Cette charge limite le temps réel sur le matériel embarqué. Le gain d'inférence de 1,5x reste nettement inférieur à la réduction de calcul de 75 %. Cet écart suggère que les coûts hors visuel, comme le décodage des actions, plafonnent l'accélération réelle. Les résultats viennent de l'article seul, sans reproduction indépendante. La notion de « performance compétitive » n'est pas chiffrée dans le résumé, et on ignore sur quels modèles de base et quels robots les tests réels ont été faits. La méthode gèle le modèle de base, donc un intégrateur peut l'ajouter à un VLA existant sans le réentraîner. Elle illustre aussi un changement d'approche : choisir les tokens selon leur effet sur la commande finale plutôt que selon des scores d'attention.
Les travaux antérieurs d'élagage pour VLA se répartissent en deux familles. La première regroupe des heuristiques sans entraînement, fondées sur les scores d'attention ou des seuils de mouvement, jugées indirectes par les auteurs. La seconde exige un réglage fin coûteux du modèle de base. VLA-ACL se place entre les deux : une supervision au niveau de l'action, sans toucher aux poids du VLA. Les auteurs affirment un meilleur compromis performance-efficacité que les méthodes d'élagage existantes pour VLA gelés. La suite dépendra de la généralisation à d'autres architectures (Pi-0, GR00T, Helix et leurs équivalents) et de tests sur plus de tâches réelles. Le code étant public, la communauté pourra vérifier ces résultats rapidement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




