LIBERO-VPro : évaluer la robustesse visuelle en boucle fermée des modèles fondation pour la robotique
Des chercheurs publient LIBERO-VPro (arXiv:2609.24350), un benchmark conçu pour évaluer la robustesse visuelle en boucle fermée des modèles fondation destinés à la manipulation robotique, alors que les évaluations standards supposent des observations visuelles propres et synchrones du début à la fin de la tâche. Le benchmark perturbe délibérément le flux visuel disponible pendant l'exécution, selon quatre axes complémentaires : dégradation de l'évidence visuelle, obsolescence de la caméra, cohérence de la source visuelle, et variation de scène pertinente pour la tâche, répartis en 12 catégories de défis, 96 configurations expérimentales et 3296 cas tâche-condition. L'équipe évalue trois modèles vision-langage-action (VLA) et trois modèles world-action (WAM) sur environ 196 000 épisodes simulés, complétés par 200 essais réels sur un bras Franka Research 3.
Le résultat central : une performance nominale élevée sur les benchmarks classiques masque des faiblesses substantielles d'ancrage visuel et d'adaptation. Les modèles testés tolèrent bien une occlusion sévère des objets, mais se dégradent brutalement dès que les indices d'interaction locale sont perturbés ou que des a priori spatiaux familiers sont violés ; ils se montrent aussi très sensibles à des observations périmées ou manquantes, et peinent à adapter leur comportement quand les préconditions de la tâche changent. Point notable pour les intégrateurs et les équipes de recherche : VLA et WAM affichent des profils de robustesse distincts, ce qui confirme que la robustesse visuelle est multidimensionnelle et dépend de l'architecture, plutôt que d'être une propriété acquise mécaniquement via le préentraînement à grande échelle. Pour une industrie qui pousse ces modèles vers des déploiements réels, l'étude rappelle qu'un bon score sur un benchmark statique ne garantit rien face à une caméra dégradée, une latence ou une scène qui change, un écart largement soupçonné mais rarement quantifié de façon aussi systématique.
LIBERO-VPro s'appuie sur la suite LIBERO, déjà utilisée comme référence pour l'apprentissage continu en manipulation robotique, en y ajoutant une couche de perturbation visuelle absente des évaluations existantes. Le papier ne nomme pas publiquement les modèles VLA et WAM testés, mais s'inscrit dans un paysage où des familles comme Pi-0, GR00T N2 ou Helix cherchent justement à prouver leur fiabilité au-delà de démonstrations scriptées. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste un travail de recherche académique et non une annonce produit ni un déploiement commercial. Les auteurs présentent LIBERO-VPro comme un cadre de diagnostic destiné à guider le développement de futurs modèles capables de mieux ancrer et adapter leurs actions en conditions visuelles dégradées, sans calendrier de suite ni partenariat industriel annoncé.
Dans nos dossiers




