ManiUnit : un jeu de données et un banc d'essai de compétences de manipulation pour les tâches à long horizon
ManiUnit est un jeu de données et un benchmark de compétences de manipulation, construit à partir de 50 activités du simulateur BEHAVIOR-1K et publié sur arXiv en octobre 2026. Le jeu de données compte 137 899 segments répartis sur 21 types de compétences et 417 sous-tâches, tandis que le benchmark comprend 1 260 instances de test. Chaque segment est associé à une instruction explicite de sous-tâche. Le benchmark mesure aussi la sensibilité à des perturbations de la position initiale de la base mobile ou de la configuration articulaire du robot. Il restaure des états intermédiaires du simulateur et définit des conditions de succès locales, ce qui permet d'évaluer chaque compétence sans exécuter les étapes qui la précèdent. Sur deux activités à long horizon, une politique de compétence entraînée sur les segments ManiUnit atteint 78,7 % de succès local en manipulation, contre 49,3 % pour une politique de tâche entraînée sur des démonstrations complètes. Une fois coordonnées par un planificateur, politiques de tâche et de compétence font passer le succès sur la tâche complète de 4,0 % à 18,0 %.
L'enjeu est de rendre diagnostiquables les échecs de la manipulation mobile à long horizon, où un robot doit traverser plusieurs pièces et enchaîner des compétences à partir d'une seule consigne en langage naturel. Les auteurs identifient trois difficultés. D'abord, des observations proches sous une même consigne rendent la sélection de la compétence ambiguë. Ensuite, même lorsqu'une compétence réussit, l'état du robot qu'elle transmet à la suivante peut s'écarter des états de départ démontrés et dégrader l'exécution. Enfin, les métriques au niveau de la tâche masquent les causes d'échec, puisqu'une défaillance précoce empêche de tester les étapes suivantes. Les évaluations de politiques vision-langage-action (VLA) représentatives montrent que des scores agrégés similaires peuvent cacher des écarts importants d'une compétence à l'autre. Sur le benchmark complet, les perturbations articulaires réduisent le taux de succès d'environ 56 % par rapport aux états de départ démontrés. Ce résultat appelle à la prudence face aux démonstrations de VLA mesurées sur des conditions initiales propres.
Il faut toutefois relativiser la portée de ces chiffres : tout est mesuré en simulation, sur un nombre limité d'activités pour la comparaison compétence contre tâche, et un succès de 18,0 % sur la tâche complète reste très éloigné d'un seuil industriel. Les auteurs ne nomment pas ici les modèles VLA évalués. ManiUnit s'inscrit dans la lignée de BEHAVIOR-1K, benchmark de tâches domestiques de longue durée, et d'une tendance à décomposer les tâches en compétences réutilisables pilotées par un planificateur, plutôt qu'à entraîner une politique monolithique. Le gain obtenu avec le planificateur suggère que cette approche modulaire est plus prometteuse, mais elle dépend de la robustesse de chaque compétence face aux états hérités. Le jeu de données et le benchmark sont des ressources de recherche, sans calendrier de déploiement ni transfert vers le matériel réel annoncé dans le résumé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



