La réussite suffit-elle ? Effet des perturbations d'entrée sur le comportement des VLA dans des tâches de manipulation sur table
Une étude publiée sur arXiv (2610.01351) propose un cadre d'évaluation indépendant des benchmarks pour mesurer la robustesse comportementale des modèles Vision-Language-Action (VLA), au-delà du seul taux de réussite des tâches (TSR). Les auteurs l'implémentent en étendant LIBERO et LIBERO-Plus, deux benchmarks de manipulation sur table très utilisés. Le protocole couvre trois VLA de pointe, quatre suites de tâches LIBERO et sept conditions de perturbation des entrées. Il ne s'intéresse qu'aux trajectoires réussies. Pour chacune, il mesure la fluidité du mouvement, l'efficacité et le comportement de la pince, ainsi que la variabilité de ces indicateurs. Le résultat central est que les perturbations modifient la façon dont les trajectoires réussies sont exécutées, un effet que le TSR ne permet pas de déduire. Dans plusieurs suites, des modèles obtiennent un TSR comparable sous la même perturbation alors que leur comportement diverge nettement. Il s'agit d'un travail de recherche, sans produit ni déploiement associé. Les noms des trois modèles testés ne figurent pas dans le résumé.
Ce travail touche un point faible de l'évaluation des VLA. Un robot qui réussit sa tâche par des mouvements saccadés, des trajectoires allongées ou des ouvertures et fermetures de pince erratiques consomme plus de temps de cycle, use davantage la mécanique et présente plus de risques en environnement partagé. Pour un intégrateur ou un COO industriel, deux modèles affichant le même score sur un benchmark ne sont donc pas interchangeables. L'étude nuance aussi la lecture des classements de robustesse. Elle suggère qu'une partie de l'écart entre démonstration et réalité se cache dans la qualité d'exécution, que les métriques binaires ne voient pas.
LIBERO est devenu l'un des terrains d'évaluation de référence pour les VLA, avec des scores de réussite proches de la saturation pour les meilleurs modèles. Cette saturation a motivé des extensions comme LIBERO-Plus, qui introduit des perturbations. Le papier prolonge cette tendance en passant de « le modèle réussit-il sous perturbation ? » à « comment réussit-il ? ». Les auteurs recommandent de compléter le TSR par des métriques comportementales, sans prétendre le remplacer. Il reste à voir si ces métriques seront adoptées par les concepteurs de benchmarks et validées sur des robots réels. L'étude se limite à la manipulation sur table en simulation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




