LexiconVLA : apprentissage de codebooks d'actions atomiques réutilisables pour des tâches inédites
Des chercheurs proposent LexiconVLA, une méthode qui construit un « lexique » d'actions atomiques réutilisables pour aider les modèles vision-langage-action (VLA) à généraliser à des tâches jamais vues. Le travail, publié sur arXiv, s'appuie sur un jeu de données maison, AtomAction, qui compte 57 803 segments issus de 69 tâches. Deux codebooks sont appris : l'un, global, capture la structure d'interaction partagée entre tâches (saisir, pousser, insérer), l'autre, de détail, conserve les variations fines d'exécution. Un module d'alignement visuel-action couple la reconstruction de trajectoire à partir des changements d'état visuels et la prédiction du résultat visuel à partir des codes d'action. Un planificateur et un adaptateur sensible à la scène traduisent un nouvel objectif en sous-tâches conditionnées par ces codes, exécutées par une politique unique. Aucun expert spécialisé par compétence ni mise à jour de paramètres au déploiement n'est nécessaire. Sur 26 tâches du benchmark RLBench et cinq architectures de politique, la performance est globalement maintenue sur les 18 tâches vues, et progresse sur les 8 tâches exclues de l'entraînement de la politique. Avec BridgeVLA, le taux de succès sur tâches inédites passe de 16,67 % à 34,17 % (+17,50 points), pour un succès global de 71,08 %, le plus élevé parmi les méthodes ayant publié des résultats.
L'intérêt tient d'abord au diagnostic : les auteurs montrent qu'un VLA peut réussir une tâche sans exécuter de manière cohérente les actions atomiques qui la composent d'un contexte à l'autre. Autrement dit, un taux de succès élevé sur des tâches connues masque une compétence fragmentée, difficile à recomposer face à un objectif nouveau. Pour un intégrateur, c'est un rappel que la généralisation zéro-shot des VLA reste faible : même avec l'amélioration annoncée, deux tâches inédites sur trois échouent encore. L'approche a néanmoins un atout pratique, celle d'ajouter une couche de réutilisation sans réentraîner la politique ni multiplier les experts, ce qui limite le coût de mise à jour en production.
Il faut toutefois relativiser. Les résultats proviennent d'un benchmark simulé, RLBench, sur un échantillon restreint de 8 tâches tenues à l'écart, et la comparaison « meilleur parmi les méthodes rapportant des résultats » exclut celles qui ne publient pas leurs chiffres. Les expériences sur robot réel sont décrites comme démontrant l'exécution pas à pas et la reprise sur échec, sans métriques chiffrées dans le résumé. Le travail s'inscrit dans la course à la composabilité des VLA, aux côtés des approches de type Pi-0, GR00T ou Helix, qui misent plutôt sur l'échelle des données et la couverture. Il s'agit d'une publication de recherche, sans produit ni déploiement annoncé. La suite dépendra de la validation sur davantage de tâches réelles et de la disponibilité du jeu de données et du code.
Dans nos dossiers




