Aller au contenu principal
VA-Bench de Dalian University of Technology : les meilleurs modèles multimodaux ne réussissent que la moitié des tâches robotiques
RecherchePandaily 

VA-Bench de Dalian University of Technology : les meilleurs modèles multimodaux ne réussissent que la moitié des tâches robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche pilotée par la Dalian University of Technology a publié VA-Bench, un banc d'essai qui mesure si des modèles de langage multimodaux généralistes savent transformer ce qu'ils voient en actions réussies sur un bras robotique. Décrit dans un article arXiv (2609.19554) et relayé par Sina Tech, il évalue toute la boucle observer, raisonner, agir et corriger. Avant chaque test, le modèle visionne une démonstration réussie, mais ne reçoit ni coordonnées d'objets, ni trajectoires expertes, ni paramètres d'action précis. Il peut changer de point de vue caméra, au prix de pas d'interaction, puis doit émettre des commandes concrètes : translations en millimètres par axe, angles de rotation, ouverture ou fermeture de la pince. Un contrôleur fixe n'exécute que ce qui est spécifié. Le benchmark couvre 14 types de tâches (11 à un bras, 3 à deux bras), chacun avec 20 scènes validées physiquement en simulation, soit 280 scènes de base, plus des variantes de géométrie et d'agencement inédites et une piste longue de cinq objets. Chaque condition a été jouée trois fois. Sur 12 configurations, la meilleure, Qwen3.8-max d'Alibaba, réussit en moyenne 53,93 % des tâches, devant Opus-5 (52,86 %) et GPT-5.6-sol (51,55 %). Les auteurs précisent que ces trois modèles sont séparés de 2,38 points et ne revendiquent aucun classement fiable. Toutes les autres conditions plafonnent à 23,10 %.

Le résultat éclaire un écart central : les modèles localisent les cibles à 100 % et comprennent la manipulation requise à 99,6-100 %, mais la réussite complète reste autour de la moitié. Les sous-tâches aboutissent à 65,9-68,6 %, donc beaucoup d'échecs surviennent après une progression partielle. Qwen3.8-max détecte ses erreurs dans 73,6 % des cas mais ne les corrige en ligne que dans 46,7 %. Il atteint 65,61 % sur les tâches à un bras contre 11,11 % à deux bras, où il faut répartir les objets et coordonner les positions relatives. L'observation active pèse plus que le nombre de caméras : 57,50 % de réussite quand Qwen3.8-max choisit ses vues, contre 27,86 % avec cinq vues fixes, et les quatre modèles testés se dégradent sans observation active. La généralisation reste fragile : changer formes, contenants ou agencements fait chuter un modèle de référence de 80,00 % à 47,86 %, Qwen3.8-max passant de 77,86 % à 67,86 %. Sur la piste longue, il place 61 objets sur 100, mais aucun modèle ne termine un épisode au sens strict. Pour les intégrateurs, cela rappelle que la compréhension visuelle ne garantit pas l'exécution, et que les résultats sont obtenus en simulation, sans bruit de capteur ni contact réel.

Le benchmark complète le classement « cerveau incarné » de SuperCLUE publié cette semaine, qui note perception, raisonnement et planification, là où VA-Bench vérifie si ces jugements deviennent des gestes réussis. Il s'inscrit dans la montée des évaluations des modèles généralistes comme contrôleurs de robots, face aux approches VLA (vision-langage-action) entraînées spécifiquement, qui ne sont pas comparées ici. Qwen3.8-max, récemment sorti en version officielle, partage par ailleurs la première place chinoise du classement SuperCLUE avec le Nebula de ZTE. Aucun déploiement ni produit n'est annoncé : il s'agit d'un outil de recherche. Les prochaines étapes probables sont l'évaluation de nouveaux modèles, notamment sur la coordination bimanuelle, et une validation sur robots physiques pour mesurer l'écart entre simulation et réalité.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

FailBench : les modèles vision-langage sont-ils fiables pour juger la réussite des tâches robotiques ?
1arXiv cs.RO 

FailBench : les modèles vision-langage sont-ils fiables pour juger la réussite des tâches robotiques ?

Des chercheurs présentent FailBench, un benchmark conçu pour mesurer la fiabilité des modèles vision-langage (VLM) lorsqu'ils sont utilisés comme juges automatiques du succès ou de l'échec des tâches de manipulation robotique. L'ensemble compile 2 197 tentatives de manipulation issues de 14 sources publiques, dont 12 jeux de données réels et 2 simulés ; 75% des échecs y surviennent naturellement, sans être provoqués pour les besoins du test, et six des sources réelles ne sont pas conçues à l'origine pour la détection d'échec. Les auteurs évaluent 13 détecteurs basés sur des VLM : le meilleur modèle plafonne à seulement 0,77 de précision équilibrée moyenne, un score modeste pour une tâche de classification binaire réussite/échec. Fait notable, les modèles spécifiquement affinés (fine-tunes) pour la détection d'échec obtiennent des résultats systématiquement inférieurs à ceux des VLM généralistes et même à leurs propres versions pré-entraînées non spécialisées. Ce résultat questionne directement une hypothèse répandue dans l'écosystème des VLA (vision-language-action) et de la supervision automatisée de robots : que des modèles de fondation généralistes, une fois affinés sur des données spécialisées, deviennent mécaniquement de meilleurs juges de tâche. FailBench montre l'inverse, avec un écart de performance particulièrement marqué selon le type de tâche observée : les modèles approchent la saturation quand le succès dépend d'un mouvement d'objet visible et facilement observable, mais retombent près du niveau du hasard, sous 0,60 de précision équilibrée, sur des tâches d'assemblage à fort contact physique où l'échec n'est pas visuellement évident. Pour les intégrateurs et équipes qui envisagent d'automatiser la supervision qualité de lignes robotisées avec des VLM, à Nvidia le comportement de GR00T N2 ou d'autres pipelines VLA, ces chiffres suggèrent qu'une confiance aveugle dans un détecteur automatique reste risquée sur les tâches d'assemblage fin, précisément là où l'erreur coûte le plus cher en production. L'analyse d'erreur des auteurs révèle un biais systématique des modèles à prédire un succès par défaut lorsque la preuve visuelle est ambiguë, un biais qui persiste même en augmentant l'effort de raisonnement alloué au modèle, ce qui limite l'intérêt du simple scaling de compute au moment de l'inférence pour corriger ce défaut. En revanche, une intervention plus ciblée au niveau de l'entrée, la localisation spatiale et le recadrage automatique des régions de l'image pertinentes pour le résultat, améliore le meilleur détecteur de 2,4 points de pourcentage sans entraînement supplémentaire. FailBench s'inscrit dans une lignée de benchmarks cherchant à combler l'écart entre démonstrations en conditions contrôlées et fiabilité réelle des systèmes de perception robotique, un enjeu central alors que les VLM sont de plus en plus proposés comme couche de supervision autonome pour des flottes de robots manipulateurs en usine ou en entrepôt.

RecherchePaper
1 source
Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques
2arXiv cs.RO 

Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques

Une nouvelle version (v2) d'un article de recherche publié sur arXiv (2603.06084) détaille un pipeline pour entraîner des modèles vision-langage (VLM) compacts à générer des arbres de comportement (Behavior Trees, BT) exécutables et compatibles ROS2 pour la planification de tâches robotiques. Les auteurs ont converti 1 622 épisodes du corpus Open X-Embodiment via un pipeline enseignant multi-étapes, produisant un jeu de données augmenté de 2 433 exemples multimodaux associant images, instructions et BT. Ce jeu de données a servi à affiner, par fine-tuning efficace en paramètres (PEFT), des VLM open source allant de 500 millions à 4 milliards de paramètres. Les BT générés ont été évalués hors ligne sur leur validité syntaxique, puis exécutés sur 15 tâches domestiques dans l'environnement de simulation BEHAVIOR-1K. Le meilleur modèle, Gemma-3 4B, atteint une validité syntaxique parfaite et un taux de réussite de 87%, devançant Claude Opus 4.8 et approchant GPT-5, tout en tournant entièrement en local. Ce résultat nourrit le débat récurrent sur l'écart entre démonstration et réalité dans la planification robotique pilotée par IA: un modèle compact, exécutable sans API propriétaire ni connexion cloud, égale voire dépasse des modèles fermés bien plus massifs sur une tâche concrète. Pour les intégrateurs et décideurs industriels, c'est un signal en faveur d'une planification embarquée, sans latence réseau ni coûts d'inférence récurrents, un critère souvent déterminant pour un déploiement à grande échelle. Les ablations confirment aussi une hypothèse centrale du secteur: l'ancrage visuel est décisif, le taux de réussite passant de 40% en texte seul à 87% avec observations visuelles. L'augmentation de données, elle, fait grimper la validité syntaxique des BT de 65% à 100%, rappelant que la qualité des données d'entraînement prime souvent sur la taille du modèle. Ces travaux prolongent une lignée de recherches utilisant les Behavior Trees, formalisme hiérarchique déjà répandu en robotique industrielle via ROS2, comme cible de génération pour les grands modèles de langage. Jusqu'ici, ces approches restaient soit purement textuelles, soit dépendantes de VLM propriétaires massifs, faute de jeu de données public reliant observations visuelles et BT exécutables, un manque que ce travail cherche explicitement à combler. La comparaison directe avec Claude Opus 4.8 et GPT-5 positionne cette contribution académique comme une tentative de démocratiser la planification VLM face aux modèles propriétaires. Aucun partenariat industriel ni déploiement sur robot physique n'est mentionné: l'évaluation reste cantonnée à la simulation BEHAVIOR-1K, ce qui invite à la prudence avant toute extrapolation vers un usage en environnement réel.

RechercheOpinion
1 source
IndustrialVLA-Bench : une évaluation traçable multi-axes des modèles de politique robotique ouverts
3arXiv cs.RO 

IndustrialVLA-Bench : une évaluation traçable multi-axes des modèles de politique robotique ouverts

IndustrialVLA-Bench, publié en septembre 2026 sur arXiv (2609.25562) avec le code sur GitHub (xiaoqi-7/IndustrialVLA-Bench), compare six systèmes de politiques robotiques open source sous un protocole de rapport unifié. Il oppose les vision-language-action models (VLA), qui associent observations et instructions à des actions, aux world-action models (WAM), qui intègrent une dynamique du monde apprise dans la génération d'actions, et les teste sur trois volets LIBERO : capacité brute, robustesse à des perturbations non linguistiques (LIBERO-Plus) et sensibilité à la formulation des consignes (LIBERO-Para). Les six systèmes ne s'écartent que de 1,58 point en moyenne sur les tâches propres de LIBERO, contre 14,62 points en robustesse et 31,08 points en sensibilité aux paraphrases, un écart qui persiste (1,36, 14,62 et 23,10 points) en ne retenant que les trois systèmes jugés fidèles au protocole d'origine, les autres reposant sur des reproductions partielles ou une vérification encore en attente. Ce travail chiffre un problème que le secteur pressentait sans le mesurer : les VLA et WAM publiés sont généralement comparés sous des protocoles différents, ce qui rend leurs classements peu exploitables pour un intégrateur devant choisir une pile logicielle. Que les scores en conditions contrôlées soient quasi identiques d'un système à l'autre, alors que les écarts explosent dès qu'on introduit du bruit visuel ou une reformulation de consigne, confirme empiriquement l'hypothèse d'un fossé entre démonstration et usage réel : la capacité brute ne prédit ni la robustesse ni la compréhension du langage sur le terrain. Pour un décideur B2B, un score LIBERO flatteur ne garantit donc rien en atelier, où l'éclairage varie et les consignes orales ne se répètent jamais à l'identique. IndustrialVLA-Bench s'appuie sur LIBERO, référence académique pour l'évaluation de la manipulation pilotée par le langage, et y ajoute les variantes de robustesse et de paraphrase déjà proposées séparément dans la littérature récente pour bâtir un protocole de comparaison commun. L'article ne dévoile pas l'identité des six systèmes testés, mais s'inscrit dans un paysage où des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA rivalisent avec des architectures world-action pour équiper des robots industriels ; aucun acteur français ou européen n'apparaît dans cette évaluation. Les auteurs publient code et journaux d'évaluation complets sur GitHub, une transparence qui pourrait pousser les prochains lancements à publier des mesures de robustesse, et pas seulement des scores de capacité en conditions favorables.

RecherchePaper
1 source
Exploitation des failles : attaques adverses universelles contre les modèles vision-langage-action (VLA) en robotique
4arXiv cs.RO 

Exploitation des failles : attaques adverses universelles contre les modèles vision-langage-action (VLA) en robotique

Des chercheurs publient sur arXiv une attaque adversariale « universelle » contre les modèles Vision-Language-Action (VLA), ces réseaux de bout en bout qui fusionnent perception visuelle, compréhension du langage et génération d'actions pour la manipulation robotique. Le dispositif, baptisé Universal Adversarial Object, est une sphère dont la texture de surface a été optimisée. Posée dans le champ de vision du robot, elle dégrade nettement le taux de réussite des tâches. L'approche repose sur un cadre d'attaque à plusieurs niveaux, qui perturbe conjointement la planification de trajectoire, l'exécution de la tâche et le contrôle de l'action. Les auteurs l'ont validée en simulation et en conditions réelles sur deux modèles représentatifs, Pi0 et RDT. Le taux de réussite moyen recule de 31,2 % à 39,9 % selon le modèle, et tombe quasiment à zéro dans les scénarios complexes. Le résumé ne précise ni les tâches testées, ni le nombre d'essais, ni la plateforme matérielle, ni le niveau d'accès au modèle supposé pour l'attaquant. Ces éléments conditionnent la portée des chiffres. Pour les intégrateurs et les responsables de déploiement, le résultat touche un point que les démonstrations commerciales abordent peu. Un VLA ne se contente pas d'être fragile face à des variations de décor ou d'éclairage. Il peut être dégradé par un simple objet physique, passif et bon marché à produire, sans intrusion logicielle ni accès au réseau du robot. Le caractère « universel » est le point central : l'objet n'est pas conçu pour une scène ou une consigne donnée, ce qui rend une attaque plausible hors laboratoire. Le travail contredit l'idée implicite selon laquelle l'entraînement à grande échelle suffirait à rendre ces politiques robustes. Il pose aussi une question de sûreté fonctionnelle. Une chute de réussite de plus de 30 % reste un échec de tâche, mais un robot qui interagit avec des humains peut produire des mouvements inattendus. Ces risques sont rarement couverts par les normes de sécurité actuelles, pensées pour des automates déterministes. Il faut toutefois rester prudent : les gains annoncés viennent d'une évaluation académique, avec des tâches choisies par les auteurs. Pi0 (Physical Intelligence) et RDT (Robotics Diffusion Transformer) comptent parmi les VLA ouverts les plus utilisés dans la recherche. Ils servent de base à de nombreux travaux de fine-tuning, ce qui explique leur choix comme cibles. Cette étude s'inscrit dans une littérature croissante sur les attaques adversariales physiques, d'abord développées pour la vision par ordinateur (patchs adversariaux), puis étendues aux modèles multimodaux. Elle intervient alors que Figure, Tesla, NVIDIA et d'autres poussent des politiques VLA vers des déploiements industriels. La suite logique consistera à tester des défenses : entraînement adversarial, détection d'objets hors distribution et filtrage des entrées visuelles. Il faudra aussi vérifier si l'attaque se transfère aux modèles fermés.

RecherchePaper
1 source