Aller au contenu principal
RecherchearXiv cs.RO 

Plus rapide et meilleur ? Des bugs de benchmark et des limites de conception faussent l'évaluation de l'accélération des modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a passé au crible sept benchmarks de manipulation simulée, dont RoboTwin, LIBERO-Plus et VLABench, utilisés pour évaluer les politiques vision-langage-action (VLA) et les méthodes qui réduisent leur latence d'inférence. Point de départ : plusieurs méthodes d'accélération « training-free », qui approximent le calcul de la politique de référence, affichaient des taux de succès supérieurs à ceux de la baseline elle-même. Les auteurs ont tracé les trajectoires d'objets face aux zones d'acceptation des checkers pour localiser les causes, et recensent 22 bugs, classés en trois familles (cohérence de la tâche, initialisation, reproductibilité), ainsi que 4 limitations de conception. Ils ont corrigé des checkers de succès trop permissifs, rectifié des masses d'objets irréalistes et ajouté un score sensible au mouvement, qui favorise les actions plus fluides. Les corrections peuvent inverser les classements : sur une tâche, la baseline passe de la dernière à la première place. Sur une autre, elle passe de 21 points de pourcentage derrière une méthode accélérée à 5 points devant. Les correctifs et les réglages révisés sont publiés.

Ce travail touche à un point sensible pour quiconque prépare un déploiement de VLA sur robot réel. La latence d'inférence est un verrou majeur, et les méthodes d'accélération (élagage de tokens, mise en cache, approximations) sont souvent validées uniquement en simulation. Or un gain de vitesse accompagné d'un meilleur taux de succès est physiquement suspect : approximer le calcul devrait au mieux préserver la performance. Ici, ce « gain » provient d'artefacts, comme des critères de réussite trop lâches ou des objets trop légers, qui récompensent des mouvements brusques. Pour les intégrateurs et les décideurs, la leçon est claire : un taux de succès en simulation ne suffit pas à valider une optimisation. Il faut auditer le benchmark, examiner les trajectoires et, in fine, valider sur matériel. Ce constat alimente le débat sur l'écart entre résultats de démonstration et performance réelle, et sur la fiabilité des classements publiés.

Ces benchmarks sont devenus la monnaie commune de la recherche sur les VLA, de sorte que leurs défauts se propagent aux comparaisons entre méthodes et aux revendications des laboratoires et des éditeurs de modèles. L'article n'identifie pas de modèle ou d'entreprise particulière comme fautif. Il s'agit d'une étude académique, publiée sur arXiv en préprint, sans relecture par les pairs à ce stade. Il ne s'agit ni d'un produit ni d'un déploiement, mais d'un outil de méthode. La suite dépendra de l'adoption des correctifs par les mainteneurs des benchmarks et par la communauté. On peut aussi s'attendre à ce que des évaluations en conditions réelles, plus coûteuses mais moins sujettes à ces biais, deviennent un complément attendu des résultats en simulation.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source
VLAQuantBench : évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action
2arXiv cs.RO 

VLAQuantBench : évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action

Des chercheurs ont publié VLAQuantBench, un protocole d'évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action, construit sur 409 runs et 94 574 épisodes de simulation, avec quatre modèles testés sur le benchmark LIBERO et X-VLA évalué en plus sur trois autres familles de benchmarks de simulation. Sous une quantification W4A4 non calibrée (poids et activations sur 4 bits), étendre le sous-ensemble de couches de la tête d'action de π0.5 de 126 à 167 couches fait bondir le taux de réussite de 7,0% à 70,5%, un gain confirmé par rejeu à observations fixes. Une calibration limitée à deux épisodes supprime les échecs sévères observés sur les sous-ensembles testés, mais la même recette de lissage et d'écrêtage dégrade le score de π0 et ne suffit pas à restaurer OpenVLA-OFT de bout en bout, qui exige de protéger une seule projection de sortie de 28 672 paramètres pour retrouver une performance quasi égale à la référence, le reste du réseau (441 couches linéaires) pouvant alors tourner en poids 3 bits sur LIBERO-Long ou en activations 8 bits sur les quatre suites testées. Ces résultats visent directement les équipes qui doivent faire tenir des VLA de plusieurs milliards de paramètres dans la mémoire limitée d'un contrôleur embarqué, un enjeu croissant pour les robots manipulateurs et humanoïdes commerciaux. Le constat principal invalide l'idée de règles de sensibilité par couche universelles et transférables d'un modèle à l'autre: une même recette de calibration peut sauver un modèle et en casser un autre, ce qui impose aux intégrateurs de valider chaque schéma de quantification modèle par modèle plutôt que de recycler des heuristiques génériques. L'étude montre aussi qu'un effondrement massif sous quantification agressive ne trahit pas forcément une fragilité intrinsèque du VLA, puisqu'un ajustement ciblé du périmètre de couches protégées, ou une simple calibration sur deux épisodes, peut faire passer la réussite de 7% à plus de 70%. La quantification post-entraînement, technique éprouvée sur les grands modèles de langage, est de plus en plus reprise telle quelle pour les VLA sans validation poussée sur des tâches de manipulation en boucle fermée, un vide que ce travail comble en testant côte à côte π0, π0.5, OpenVLA-OFT et X-VLA. Le code, les configurations et les enregistrements d'épisodes sont publiés en accès libre sur GitHub, ce qui permet à d'autres équipes de reproduire ou d'étendre les assignations de précision identifiées. L'article, référencé arXiv:2609.25376, n'annonce ni nouveau modèle ni déploiement commercial, mais livre un outil méthodologique aux équipes de recherche et d'ingénierie qui arbitrent entre empreinte mémoire et fiabilité avant de faire tourner un VLA sur du matériel embarqué.

RecherchePaper
1 source
LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
3arXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires. Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle. LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

RechercheOpinion
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
4arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source