
MINERVA : quelle taille minimale pour une politique de manipulation qui résout LIBERO ?
Publiée le 4 septembre 2026 sur arXiv (2609.03715v1), l'étude MINERVA mesure la taille de modèle réellement nécessaire pour résoudre LIBERO, le benchmark de manipulation aujourd'hui dominé par des modèles vision-langage-action (VLA) de plusieurs milliards de paramètres. Sa politique de 0,54 million de paramètres atteint 95,1% de réussite sur 2 000 essais répartis sur les quatre suites standard de LIBERO, à seulement 2,4 points du résultat rapporté pour pi-0.5 de LeRobot, avec 7 700 fois moins de paramètres. Les performances plafonnent vers 1 million de paramètres et s'effondrent sous 250 000. La régression L1 directe égale le flow matching tout en étant jusqu'à 3,8 fois plus rapide sur GPU, et sur simple CPU portable, sans GPU, la politique replanifie chaque pas de contrôle en 5 à 9 millisecondes, 113 fois plus vite que SmolVLA et 1 400 fois plus vite que pi-0.5. Sur LIBERO-90 (89 tâches), le même protocole obtient 94,6%, mais chute à 46-56% face aux perturbations de LIBERO-Plus, avec une robustesse quasi nulle aux variations photométriques.
Ce résultat bouscule l'idée dominante selon laquelle la manipulation robotique exige des VLA à l'échelle des grands modèles de langage: un réseau 7 700 fois plus petit que pi-0.5 approche ses performances, signe que le plancher de capacité requis par LIBERO est très bas. Une permutation des identifiants de tâche montre que le conditionnement par instruction sert surtout à sélectionner une tâche mémorisée: changer seulement ce mappage ramène le taux de réussite près du hasard, ce qui interroge ce que le benchmark mesure vraiment. Pour les intégrateurs, une inférence en quelques millisecondes sur simple CPU ouvre la voie à des contrôleurs embarqués bon marché, tandis que la fragilité aux perturbations photométriques rappelle qu'un score élevé sur benchmark ne garantit pas la robustesse en conditions réelles.
Le travail s'inscrit dans une course à l'échelle menée par des VLA généralistes comme pi-0 et pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI ou SmolVLA de Hugging Face, cité ici comme référence de politique compacte. LIBERO, benchmark de manipulation devenu standard depuis 2023, sert de terrain de comparaison, mais son biais vers la mémorisation des tâches, mis au jour par MINERVA, questionne sa validité comme mesure de généralisation. Les auteurs appellent à une conception de politiques consciente de la capacité et à des stratégies de distillation pour produire des modèles robotiques efficaces au déploiement, plutôt qu'à une simple course au nombre de paramètres.
Dans nos dossiers




