World Action Agent : exploiter les modèles vision-langage pour la manipulation robotique via répétition d'actions simulées
World Action Agent (WAA) est un système multi-agents qui fait piloter des robots manipulateurs par des modèles vision-langage dans un espace de travail visuel, plutôt que via des contraintes déduites ou du code généré. Le système combine des vues de contact choisies automatiquement autour du point d'interaction, une « répétition d'action » qui rend chaque geste modifiable avant exécution, et une correction en vue qui élimine les décalages résiduels ; il apprend aussi des compétences via des vidéos d'experts et des démonstrations humaines validées. Sur le benchmark LIBERO-Pro, avec des compétences apprises uniquement sur LIBERO-90, WAA atteint 75,6 % de réussite moyenne, devançant les VLA de bout en bout et les agents « code-as-policy » ; le fine-tuning de Qwen3.5-9B sur ses traces d'interaction porte sa réussite hors domaine de 1,7 % à 43,3 %.
Cette approche cible un angle mort du secteur : les VLM sont utilisés indirectement, pour déduire des contraintes ou écrire du code, sans agir dans une représentation modifiable de la scène. En rendant chaque geste corrigeable avant exécution, WAA répond à l'écart persistant entre démonstrations impressionnantes et fiabilité réelle en manipulation, un enjeu central pour les intégrateurs hésitant à déployer des VLA en production. Le résultat le plus parlant pour les décideurs B2B reste la distillation : entraîner un modèle plus petit sur les traces du système fait bondir sa réussite hors domaine de 1,7 % à 43,3 %, ouvrant une voie économique vers des politiques robotiques déployables à grande échelle sans VLM massif en boucle d'inférence.
Le travail est publié comme prépublication arXiv non encore relue par les pairs, évalué uniquement en simulation sur les bancs d'essai LIBERO-Pro, LIBERO-90 et robosuite, sans déploiement sur robot physique ni site industriel mentionné. Aucune entreprise ni plateforme robotique n'est citée dans l'étude, WAA se positionnant comme une alternative architecturale aux VLA entraînés de bout en bout et aux approches « code-as-policy » qui dominent la recherche récente sur le pilotage de robots par modèles de fondation. Les auteurs ne précisent aucun calendrier de transfert vers du matériel réel, la validation sur capteurs bruités et environnements non contrôlés restant l'étape déterminante avant tout déploiement industriel.
Dans nos dossiers




