
IndustrialVLA-Bench : une évaluation traçable multi-axes des modèles de politique robotique ouverts
IndustrialVLA-Bench, publié en septembre 2026 sur arXiv (2609.25562) avec le code sur GitHub (xiaoqi-7/IndustrialVLA-Bench), compare six systèmes de politiques robotiques open source sous un protocole de rapport unifié. Il oppose les vision-language-action models (VLA), qui associent observations et instructions à des actions, aux world-action models (WAM), qui intègrent une dynamique du monde apprise dans la génération d'actions, et les teste sur trois volets LIBERO : capacité brute, robustesse à des perturbations non linguistiques (LIBERO-Plus) et sensibilité à la formulation des consignes (LIBERO-Para). Les six systèmes ne s'écartent que de 1,58 point en moyenne sur les tâches propres de LIBERO, contre 14,62 points en robustesse et 31,08 points en sensibilité aux paraphrases, un écart qui persiste (1,36, 14,62 et 23,10 points) en ne retenant que les trois systèmes jugés fidèles au protocole d'origine, les autres reposant sur des reproductions partielles ou une vérification encore en attente.
Ce travail chiffre un problème que le secteur pressentait sans le mesurer : les VLA et WAM publiés sont généralement comparés sous des protocoles différents, ce qui rend leurs classements peu exploitables pour un intégrateur devant choisir une pile logicielle. Que les scores en conditions contrôlées soient quasi identiques d'un système à l'autre, alors que les écarts explosent dès qu'on introduit du bruit visuel ou une reformulation de consigne, confirme empiriquement l'hypothèse d'un fossé entre démonstration et usage réel : la capacité brute ne prédit ni la robustesse ni la compréhension du langage sur le terrain. Pour un décideur B2B, un score LIBERO flatteur ne garantit donc rien en atelier, où l'éclairage varie et les consignes orales ne se répètent jamais à l'identique.
IndustrialVLA-Bench s'appuie sur LIBERO, référence académique pour l'évaluation de la manipulation pilotée par le langage, et y ajoute les variantes de robustesse et de paraphrase déjà proposées séparément dans la littérature récente pour bâtir un protocole de comparaison commun. L'article ne dévoile pas l'identité des six systèmes testés, mais s'inscrit dans un paysage où des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA rivalisent avec des architectures world-action pour équiper des robots industriels ; aucun acteur français ou européen n'apparaît dans cette évaluation. Les auteurs publient code et journaux d'évaluation complets sur GitHub, une transparence qui pourrait pousser les prochains lancements à publier des mesures de robustesse, et pas seulement des scores de capacité en conditions favorables.
Dans nos dossiers




