
VA-Bench de Dalian University of Technology : les meilleurs modèles multimodaux ne réussissent que la moitié des tâches robotiques
Une équipe de recherche pilotée par la Dalian University of Technology a publié VA-Bench, un banc d'essai qui mesure si des modèles de langage multimodaux généralistes savent transformer ce qu'ils voient en actions réussies sur un bras robotique. Décrit dans un article arXiv (2609.19554) et relayé par Sina Tech, il évalue toute la boucle observer, raisonner, agir et corriger. Avant chaque test, le modèle visionne une démonstration réussie, mais ne reçoit ni coordonnées d'objets, ni trajectoires expertes, ni paramètres d'action précis. Il peut changer de point de vue caméra, au prix de pas d'interaction, puis doit émettre des commandes concrètes : translations en millimètres par axe, angles de rotation, ouverture ou fermeture de la pince. Un contrôleur fixe n'exécute que ce qui est spécifié. Le benchmark couvre 14 types de tâches (11 à un bras, 3 à deux bras), chacun avec 20 scènes validées physiquement en simulation, soit 280 scènes de base, plus des variantes de géométrie et d'agencement inédites et une piste longue de cinq objets. Chaque condition a été jouée trois fois. Sur 12 configurations, la meilleure, Qwen3.8-max d'Alibaba, réussit en moyenne 53,93 % des tâches, devant Opus-5 (52,86 %) et GPT-5.6-sol (51,55 %). Les auteurs précisent que ces trois modèles sont séparés de 2,38 points et ne revendiquent aucun classement fiable. Toutes les autres conditions plafonnent à 23,10 %.
Le résultat éclaire un écart central : les modèles localisent les cibles à 100 % et comprennent la manipulation requise à 99,6-100 %, mais la réussite complète reste autour de la moitié. Les sous-tâches aboutissent à 65,9-68,6 %, donc beaucoup d'échecs surviennent après une progression partielle. Qwen3.8-max détecte ses erreurs dans 73,6 % des cas mais ne les corrige en ligne que dans 46,7 %. Il atteint 65,61 % sur les tâches à un bras contre 11,11 % à deux bras, où il faut répartir les objets et coordonner les positions relatives. L'observation active pèse plus que le nombre de caméras : 57,50 % de réussite quand Qwen3.8-max choisit ses vues, contre 27,86 % avec cinq vues fixes, et les quatre modèles testés se dégradent sans observation active. La généralisation reste fragile : changer formes, contenants ou agencements fait chuter un modèle de référence de 80,00 % à 47,86 %, Qwen3.8-max passant de 77,86 % à 67,86 %. Sur la piste longue, il place 61 objets sur 100, mais aucun modèle ne termine un épisode au sens strict. Pour les intégrateurs, cela rappelle que la compréhension visuelle ne garantit pas l'exécution, et que les résultats sont obtenus en simulation, sans bruit de capteur ni contact réel.
Le benchmark complète le classement « cerveau incarné » de SuperCLUE publié cette semaine, qui note perception, raisonnement et planification, là où VA-Bench vérifie si ces jugements deviennent des gestes réussis. Il s'inscrit dans la montée des évaluations des modèles généralistes comme contrôleurs de robots, face aux approches VLA (vision-langage-action) entraînées spécifiquement, qui ne sont pas comparées ici. Qwen3.8-max, récemment sorti en version officielle, partage par ailleurs la première place chinoise du classement SuperCLUE avec le Nebula de ZTE. Aucun déploiement ni produit n'est annoncé : il s'agit d'un outil de recherche. Les prochaines étapes probables sont l'évaluation de nouveaux modèles, notamment sur la coordination bimanuelle, et une validation sur robots physiques pour mesurer l'écart entre simulation et réalité.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




