ViDAL : un espace latent d'actions fondé sur la dynamique visuelle pour les modèles vision-langage-action (VLA)
Des chercheurs ont publié sur arXiv (2610.08150) ViDAL, un espace latent d'actions ancré dans la dynamique visuelle pour les modèles vision-langage-action (VLA). Ces modèles prédisent les actions d'un robot sous trois formes : segments d'actions bruts (action chunks), jetons d'action discrets ou latents d'action continus. ViDAL relève de la troisième famille. Un autoencodeur variationnel d'actions (Action VAE) est entraîné à reconstruire des segments d'actions tout en alignant son espace latent sur la dynamique future de la scène. Une fois entraîné, il sert d'interface d'action « plug-in » compatible avec plusieurs architectures VLA, et permet en option de prédire la vidéo future. Sur LIBERO, la méthode atteint 98,1 % de succès moyen. Sur RoboTwin 2.0, elle fait passer une politique multitâche π0.5 de 54,3 % à 65,5 % en configuration Clean et de 33,2 % à 43,1 % en configuration Random, sur 50 tâches bimanuelles. Sur robots réels, les gains absolus atteignent 20,0 % sur un bras Franka et 23,4 % sur une plateforme bimanuelle ARX.
L'intérêt tient au point de départ du travail : la plupart des représentations d'actions modélisent uniquement des trajectoires, sans tenir compte de ce que ces actions produisent dans l'image. En liant le latent aux conséquences visuelles, ViDAL traite l'action comme une cause observable plutôt que comme une simple séquence de commandes. Le fait que le même module améliore une politique existante (π0.5) suggère qu'il s'agit d'un gain portable, sans refonte du modèle, ce qui intéresse les équipes qui itèrent sur des VLA du commerce ou open source. Les gains sur RoboTwin, de l'ordre de 10 points, sont plus parlants que le score LIBERO, déjà proche de la saturation (98,1 %). Des réserves s'imposent toutefois : il s'agit d'une préimpression non évaluée par des pairs. Le nombre d'essais, les tâches réelles testées et la variance ne sont pas précisés dans le résumé, et deux robots ne suffisent pas à conclure à une généralisation. Le gain réel dépend aussi du niveau de départ de chaque politique.
Le travail s'inscrit dans la course à la meilleure représentation d'actions pour les VLA. Les segments bruts dominent des modèles comme π0 et π0.5, tandis que d'autres approches ont misé sur la tokenisation discrète des actions ou sur des latents appris. En parallèle, les modèles du monde et la prédiction vidéo gagnent du terrain pour la planification robotique, et ViDAL cherche à combiner ces deux courants. Les suites logiques sont la publication du code et des poids, des comparaisons avec d'autres interfaces d'action sur davantage d'architectures, et des tests sur des tâches longues ou des manipulations plus fines, là où l'écart entre démonstration et déploiement reste le plus net.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




