Plus rapide et meilleur ? Des bugs de benchmark et des limites de conception faussent l'évaluation de l'accélération des modèles vision-langage-action (VLA)
Une équipe de chercheurs a passé au crible sept benchmarks de manipulation simulée, dont RoboTwin, LIBERO-Plus et VLABench, utilisés pour évaluer les politiques vision-langage-action (VLA) et les méthodes qui réduisent leur latence d'inférence. Point de départ : plusieurs méthodes d'accélération « training-free », qui approximent le calcul de la politique de référence, affichaient des taux de succès supérieurs à ceux de la baseline elle-même. Les auteurs ont tracé les trajectoires d'objets face aux zones d'acceptation des checkers pour localiser les causes, et recensent 22 bugs, classés en trois familles (cohérence de la tâche, initialisation, reproductibilité), ainsi que 4 limitations de conception. Ils ont corrigé des checkers de succès trop permissifs, rectifié des masses d'objets irréalistes et ajouté un score sensible au mouvement, qui favorise les actions plus fluides. Les corrections peuvent inverser les classements : sur une tâche, la baseline passe de la dernière à la première place. Sur une autre, elle passe de 21 points de pourcentage derrière une méthode accélérée à 5 points devant. Les correctifs et les réglages révisés sont publiés.
Ce travail touche à un point sensible pour quiconque prépare un déploiement de VLA sur robot réel. La latence d'inférence est un verrou majeur, et les méthodes d'accélération (élagage de tokens, mise en cache, approximations) sont souvent validées uniquement en simulation. Or un gain de vitesse accompagné d'un meilleur taux de succès est physiquement suspect : approximer le calcul devrait au mieux préserver la performance. Ici, ce « gain » provient d'artefacts, comme des critères de réussite trop lâches ou des objets trop légers, qui récompensent des mouvements brusques. Pour les intégrateurs et les décideurs, la leçon est claire : un taux de succès en simulation ne suffit pas à valider une optimisation. Il faut auditer le benchmark, examiner les trajectoires et, in fine, valider sur matériel. Ce constat alimente le débat sur l'écart entre résultats de démonstration et performance réelle, et sur la fiabilité des classements publiés.
Ces benchmarks sont devenus la monnaie commune de la recherche sur les VLA, de sorte que leurs défauts se propagent aux comparaisons entre méthodes et aux revendications des laboratoires et des éditeurs de modèles. L'article n'identifie pas de modèle ou d'entreprise particulière comme fautif. Il s'agit d'une étude académique, publiée sur arXiv en préprint, sans relecture par les pairs à ce stade. Il ne s'agit ni d'un produit ni d'un déploiement, mais d'un outil de méthode. La suite dépendra de l'adoption des correctifs par les mainteneurs des benchmarks et par la communauté. On peut aussi s'attendre à ce que des évaluations en conditions réelles, plus coûteuses mais moins sujettes à ces biais, deviennent un complément attendu des résultats en simulation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




