Behavior-Skill : un benchmark détaillé pour évaluer les politiques VLA dans des tâches à long horizon
Des chercheurs associés au laboratoire NuBot de la National University of Defense Technology (NUDT), en Chine, ont publié en aout 2026 sur arXiv un article présentant Behavior-Skill, un benchmark destine a évaluer les politiques vision-langage-action (VLA) sur des taches ménagères a long horizon. Le jeu de données comprend 235 492 instances de compétences élémentaires issues de 10 000 démonstrations, reparties sur 50 taches domestiques et 34 catégories sémantiques de compétences (saisir, verser, ouvrir un tiroir, etc.). Chaque instance associe une instruction de compétence a un segment observation-action aligne, avec un état intermédiaire restaurable et une condition de réussite propre, ce qui permet d'évaluer chaque sous-compétence indépendamment plutôt que de se limiter au succès global de la tache. Les auteurs ont teste sur l'ensemble des 50 taches deux politiques VLA représentatives, pi0.5 (Physical Intelligence) et GR00T (famille de modèles de NVIDIA), en mesurant des métriques a la fois au niveau trajectoire et au niveau compétence. Le code et les données sont disponibles publiquement sur GitHub, sous nubot-nudt/Behavior-Skill.
Pour l'industrie de la robotique mobile et humanoïde, ce travail met en lumière un angle mort connu mais rarement quantifie: le score de réussite global d'une tache masque ou et pourquoi une politique échoue réellement. Les résultats montrent des taux d'échec très inégaux selon les compétences, la manipulation a contact riche (saisir des objets déformables, manipuler des poignées, ajuster une prise) formant un goulot d'étranglement persistant, même pour des modèles réputés généralistes comme pi0.5 ou GR00T. Pour des intégrateurs ou décideurs qui évaluent une pile VLA avant déploiement, cela confirme qu'une démonstration réussie sur une tache complète ne garantit pas la robustesse des briques sous-jacentes, et qu'un audit fin par compétence devient nécessaire avant de valider un cas d'usage industriel.
Ce benchmark s'inscrit dans une lignée d'évaluations pour la manipulation mobile a long horizon qui, jusqu'ici, reposaient presque exclusivement sur des rollouts de tache complète et des métriques agrégées, rendant les échecs intermédiaires difficiles a observer et a diagnostiquer. En proposant une décomposition fine par compétence, Behavior-Skill se positionne comme un complément, et non un remplacement, des benchmarks de bout en bout existants, dans un paysage ou pi0.5 et GR00T comptent parmi les références les plus citées pour les politiques VLA généralistes. Les auteurs invitent la communauté a s'appuyer sur cette base pour diagnostiquer et améliorer les politiques existantes, sans annoncer a ce stade de déploiement industriel ni de suite commerciale au-delà de la publication du benchmark et de son code source.
Dans nos dossiers




