
Veo-Act : améliorer les politiques VLA grâce aux modèles vidéo de pointe
Des chercheurs présentent Veo-Act, un système hiérarchique associant le modèle de génération vidéo Veo-3.1 de Google DeepMind à une politique vision-language-action (VLA) pour la manipulation robotique, décrit dans un article déposé sur arXiv (identifiant 2604.04502, version révisée). Veo-3.1 y joue le rôle de planificateur de haut niveau : il génère des séquences vidéo montrant le mouvement attendu de la main et des objets pour réaliser une instruction. Un modèle de dynamique inverse à têtes multiples convertit ces paires d'images générées en commandes motrices, tandis qu'une «porte d'interaction» décide du moment où basculer vers la politique VLA pour l'exécution réactive et précise au niveau bas. Les auteurs ont testé le système en simulation et sur un robot réel, sans préciser charge utile, degrés de liberté ni temps de cycle, ce qui relève de la recherche méthodologique plutôt que de l'annonce produit.
L'enjeu visé est bien connu du secteur : l'adaptation orientée action des politiques VLA à partir de modèles vision-langage pré-entraînés dégrade souvent leur généralisation sémantique, fragilisant leur robustesse face à des scènes ambiguës ou hors distribution. Les modèles vidéo généralisent mieux sur des scènes complexes et encodent des a priori sur les mouvements de la main, mais manquent de précision et de réactivité pour une manipulation dextre bas niveau. Veo-Act cherche à combiner ces deux forces : selon les auteurs, l'approche améliore le suivi d'instructions et le taux de réussite par rapport à une politique VLA seule, notamment dans des situations nouvelles et sémantiquement complexes, un résultat qui alimente le débat sur le rôle des modèles vidéo comme planificateurs visuels pour la robotique généraliste, aux côtés d'approches comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure).
Ce travail s'inscrit dans la montée en puissance des politiques VLA comme paradigme dominant de l'apprentissage robotique généraliste, et dans celle des modèles de génération vidéo dont les progrès en cohérence temporelle poussent plusieurs équipes à les détourner en planificateurs pour la robotique. Aucune entreprise, aucun laboratoire ni acteur français ou européen n'est cité, et le travail reste une contribution académique publiée en version révisée sur arXiv, sans calendrier de déploiement industriel annoncé.




