MIKASA-Robo-VLA : évaluer la mémoire des modèles vision-langage-action (VLA) pour la manipulation à long horizon
MIKASA-Robo-VLA, un nouveau benchmark publié sur arXiv (v1, octobre 2026), propose 90 tâches de manipulation conditionnées par le langage pour mesurer comment les politiques vision-langage-action (VLA) exploitent une information qui disparaît en cours de tâche. Dans 80 d'entre elles, l'indice dont dépend l'action est masqué ; les 10 restantes sont des contrôles réactifs où il reste visible. Chaque tâche fournit une instruction textuelle, alors que la suite d'origine, MIKASA-Robo (32 tâches), n'utilisait le langage que sur un sous-ensemble représentatif. Pour 70 tâches, les temps de phase de l'environnement définissent un « écart d'information », et dans 28 cas il dépasse la fenêtre de 16 images du VLA à contexte fixe le plus large recensé par les auteurs. Les chercheurs publient 22 500 trajectoires oracle couvrant 10 types de mémoire, aux formats RLDS et LeRobotDataset v3. Une baseline de référence π0.5, avec images courantes et proprioception mais sans historique d'observations ni module de mémoire explicite, est affinée sur 14 tâches et atteint 0,211 ± 0,044 de succès moyen.
L'intérêt tient à un angle mort de l'évaluation actuelle. La plupart des VLA ne voient que une ou quelques images récentes, et les benchmarks courants récompensent surtout des comportements réactifs, ce qui peut masquer l'absence totale de mémoire. En distinguant tâches à mémoire et contrôles réactifs, le benchmark permet d'isoler cette faiblesse plutôt que de la confondre avec un défaut de perception ou de contrôle. Pour les intégrateurs et décideurs B2B, c'est un rappel que les démonstrations de manipulation longue durée (assemblage multi-étapes, tri avec conditions cachées, reprise après occlusion) ne disent pas grand-chose de la capacité d'un modèle à retenir ce qu'il ne voit plus. Le score de 0,211 est toutefois à lire avec prudence : il ne porte que sur 14 tâches, et les auteurs reconnaissent eux-mêmes que le moindre succès sur les tâches de la catégorie Long est brouillé par le « chunking » en boucle ouverte et par la composition des types de mémoire de ce sous-ensemble. Il ne prouve donc pas, à lui seul, que la mémoire explique l'écart.
Ce travail prolonge la lignée MIKASA-Robo, centrée sur la mémoire en manipulation, et s'inscrit dans le mouvement de standardisation des données robotiques autour de RLDS et de LeRobot, l'écosystème porté notamment par Hugging Face, avec une compatibilité v3 qui facilite la réutilisation. π0.5, de Physical Intelligence, sert de référence, mais aucun résultat n'est publié pour des architectures dotées d'historique ou de mémoire explicite, qui seraient les comparaisons naturelles. La suite logique, que le papier laisse ouverte, serait d'évaluer ces variantes sur l'ensemble des 90 tâches. Le jeu de données et la page du projet sont déjà disponibles, ce qui permet à d'autres laboratoires de tester leurs propres modèles. Il s'agit d'un benchmark de simulation, sans déploiement industriel associé.
Dans nos dossiers




