Aller au contenu principal
LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
RecherchearXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires.

Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle.

LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

À lire aussi

Au-delà des tests à axe unique : évaluation croisée de la robustesse combinée des politiques vision-langage-action
1arXiv cs.RO 

Au-delà des tests à axe unique : évaluation croisée de la robustesse combinée des politiques vision-langage-action

Une équipe de recherche présente LIBERO-CTRL, un benchmark en six axes conçu pour tester la robustesse des politiques vision-langage-action (VLA) face à des perturbations combinées plutôt qu'isolées, selon un article publié sur arXiv le 15 septembre 2026 (arXiv:2609.15940v1). Le protocole apparie, pour chaque état initial, des essais à perturbation unique avec un essai équivalent soumis simultanément à plusieurs perturbations, à trois niveaux de sévérité. L'évaluation porte sur six politiques VLA et met en évidence deux phénomènes que les taux de réussite agrégés ne permettent pas de distinguer : des échecs émergents, où toutes les variantes à perturbation unique réussissent mais la version combinée échoue, et des réussites compensées, où au moins une variante à perturbation unique échoue mais la version combinée réussit. Ces deux effets vont dans des directions opposées et peuvent s'annuler statistiquement dans les moyennes, alors même que jusqu'à 29,0% des états initiaux appariés changent de résultat, ce taux montant à 34,5% dans la condition la plus affectée. Cette étude touche un point sensible pour l'industrie robotique : elle démontre que les scores de robustesse agrégés, largement utilisés pour comparer les politiques VLA entre elles, peuvent masquer des écarts de comportement substantiels dès que plusieurs perturbations surviennent en même temps, ce qui est précisément la situation d'un déploiement réel en usine ou en entrepôt. Autrement dit, un modèle jugé robuste sur des tests à perturbation unique peut échouer de façon imprévisible dès que deux conditions défavorables se combinent, sans que cela transparaisse dans les benchmarks classiques. Pour les intégrateurs et décideurs B2B qui évaluent des politiques génératives pour du pick-and-place ou de la manipulation en environnement non contrôlé, ce résultat invite à exiger des évaluations appariées par instance plutôt que des moyennes globales avant de valider un déploiement, et tempère l'idée que les benchmarks actuels suffisent à garantir une robustesse compositionnelle. Le travail s'inscrit dans la lignée des efforts de la communauté robotique pour évaluer les politiques VLA au-delà des suites de test standard comme LIBERO, habituellement utilisées pour mesurer la sensibilité à des décalages de distribution pris un par un (changement d'éclairage, de position d'objet, de texture, etc.). Les auteurs soulignent que les taux de transition entre échec et réussite restent stables lors de réévaluations indépendantes des politiques stochastiques, ce qui exclut un simple artefact de bruit expérimental. L'article ne précise pas les politiques testées nommément dans le résumé ni un calendrier de suivi, mais son apport principal est méthodologique : il fournit un cadre reproductible pour quantifier la robustesse composée, appelé à être repris par les équipes évaluant des modèles VLA en conditions de déploiement multi-perturbations.

RecherchePaper
1 source
CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts
2arXiv cs.RO 

CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts

Des chercheurs présentent CoRE-VLA, une nouvelle architecture de modèle vision-langage-action (VLA) conçue pour résoudre un problème concret de déploiement robotique: la gestion de capteurs hétérogènes et potentiellement défaillants. Publié sur arXiv le 3 juillet 2026, le papier propose de traiter la génération d'actions comme un calcul épars conditionné par le contexte, plutôt que par un calcul dense partagé comme dans les VLA classiques. Concrètement, la disponibilité des capteurs active des experts spécialisés par modalité (le papier se concentre sur la profondeur, ou depth, comme capteur auxiliaire représentatif), tandis que l'intention de la tâche route les représentations vers des experts pertinents pour chaque sous-objectif. Les auteurs testent CoRE-VLA sur les benchmarks LIBERO et RoboCasa GR1 Tabletop, ainsi que sur des manipulations réelles à deux bras, et rapportent des performances supérieures à un modèle dense équivalent et à un VLA pré-entraîné de référence, y compris en généralisation zero-shot sur des scénarios non vus à l'entraînement. L'enjeu pratique est réel pour les intégrateurs: la plupart des VLA actuels couplent rigidement la génération d'action à un jeu de capteurs fixe, ce qui les rend fragiles dès qu'un capteur auxiliaire tombe en panne ou qu'un embodiment robotique en est simplement dépourvu par conception. CoRE-VLA promet une dégradation gracieuse sans réentraînement complet, un point clé pour des flottes hétérogènes déployées en usine ou en entrepôt où tous les robots n'ont pas la même instrumentation. C'est un signal de plus que la recherche VLA s'oriente vers la robustesse opérationnelle plutôt que la seule performance en benchmark contrôlé, un décalage régulièrement pointé du doigt entre démonstrations académiques et réalité industrielle. Ce travail s'inscrit dans la lignée des architectures VLA généralistes type Pi-0 ou GR00T N2, mais adresse un angle mort spécifique: l'hétérogénéité capteurs plutôt que la seule diversité des tâches. Il s'agit ici d'une contribution de recherche publiée sur arXiv, sans partenaire industriel ni déploiement annoncé; les prochaines étapes attendues seraient une validation sur davantage d'embodiments réels et une comparaison directe avec les VLA propriétaires déployés en production.

RechercheActu
1 source
MIKASA-Robo-VLA : évaluer la mémoire des modèles vision-langage-action (VLA) pour la manipulation à long horizon
3arXiv cs.RO 

MIKASA-Robo-VLA : évaluer la mémoire des modèles vision-langage-action (VLA) pour la manipulation à long horizon

MIKASA-Robo-VLA, un nouveau benchmark publié sur arXiv (v1, octobre 2026), propose 90 tâches de manipulation conditionnées par le langage pour mesurer comment les politiques vision-langage-action (VLA) exploitent une information qui disparaît en cours de tâche. Dans 80 d'entre elles, l'indice dont dépend l'action est masqué ; les 10 restantes sont des contrôles réactifs où il reste visible. Chaque tâche fournit une instruction textuelle, alors que la suite d'origine, MIKASA-Robo (32 tâches), n'utilisait le langage que sur un sous-ensemble représentatif. Pour 70 tâches, les temps de phase de l'environnement définissent un « écart d'information », et dans 28 cas il dépasse la fenêtre de 16 images du VLA à contexte fixe le plus large recensé par les auteurs. Les chercheurs publient 22 500 trajectoires oracle couvrant 10 types de mémoire, aux formats RLDS et LeRobotDataset v3. Une baseline de référence π0.5, avec images courantes et proprioception mais sans historique d'observations ni module de mémoire explicite, est affinée sur 14 tâches et atteint 0,211 ± 0,044 de succès moyen. L'intérêt tient à un angle mort de l'évaluation actuelle. La plupart des VLA ne voient que une ou quelques images récentes, et les benchmarks courants récompensent surtout des comportements réactifs, ce qui peut masquer l'absence totale de mémoire. En distinguant tâches à mémoire et contrôles réactifs, le benchmark permet d'isoler cette faiblesse plutôt que de la confondre avec un défaut de perception ou de contrôle. Pour les intégrateurs et décideurs B2B, c'est un rappel que les démonstrations de manipulation longue durée (assemblage multi-étapes, tri avec conditions cachées, reprise après occlusion) ne disent pas grand-chose de la capacité d'un modèle à retenir ce qu'il ne voit plus. Le score de 0,211 est toutefois à lire avec prudence : il ne porte que sur 14 tâches, et les auteurs reconnaissent eux-mêmes que le moindre succès sur les tâches de la catégorie Long est brouillé par le « chunking » en boucle ouverte et par la composition des types de mémoire de ce sous-ensemble. Il ne prouve donc pas, à lui seul, que la mémoire explique l'écart. Ce travail prolonge la lignée MIKASA-Robo, centrée sur la mémoire en manipulation, et s'inscrit dans le mouvement de standardisation des données robotiques autour de RLDS et de LeRobot, l'écosystème porté notamment par Hugging Face, avec une compatibilité v3 qui facilite la réutilisation. π0.5, de Physical Intelligence, sert de référence, mais aucun résultat n'est publié pour des architectures dotées d'historique ou de mémoire explicite, qui seraient les comparaisons naturelles. La suite logique, que le papier laisse ouverte, serait d'évaluer ces variantes sur l'ensemble des 90 tâches. Le jeu de données et la page du projet sont déjà disponibles, ce qui permet à d'autres laboratoires de tester leurs propres modèles. Il s'agit d'un benchmark de simulation, sans déploiement industriel associé.

RecherchePaper
1 source
R2S-Eval : évaluation de robots par calibration réel-vers-simulation via des modèles vision-langage
4arXiv cs.RO 

R2S-Eval : évaluation de robots par calibration réel-vers-simulation via des modèles vision-langage

Des chercheurs ont mis en ligne sur arXiv, courant septembre 2026, un article (arXiv:2609.03276) décrivant R2S-Eval, un pipeline d'évaluation pour les politiques de manipulation robotique, en particulier les modèles vision-langage-action (VLA) déployés sur des robots physiques. Le système combine une calibration "real-to-sim", où le simulateur est ajusté pour reproduire fidèlement les conditions d'un banc d'essai réel, avec un modèle vision-langage (VLM) chargé de juger la qualité des vidéos de rollout générées en simulation. Plutôt que de mesurer uniquement un taux de succès binaire, le VLM compare les vidéos par paires et produit des préférences agrégées ensuite en classements de politiques. Les auteurs ont testé la méthode à la fois en simulation et sur des essais réels, montrant des classements stables et reproductibles, en accord avec les préférences de juges humains, tout en réduisant fortement le nombre d'essais matériels nécessaires. Une page projet dédiée (r2s-eval.github.io) accompagne la publication. Pour l'industrie robotique, cette contribution s'attaque à un problème concret et coûteux: évaluer une politique VLA sur du matériel réel exige des essais répétés, des remises en scène manuelles et une surveillance humaine continue, un processus qui peut produire des classements différents d'une session à l'autre et qui ne capture pas la qualité d'exécution, fluidité, précision, comportements de récupération, au-delà du simple succès ou échec. En automatisant une part de cette évaluation via la simulation calibrée et un juge VLM, R2S-Eval offre aux intégrateurs et équipes R&D un moyen de comparer des politiques concurrentes plus vite et de façon plus fiable, sans multiplier les cycles d'essais physiques onéreux. C'est un signal que le secteur cherche à combler l'écart entre les démonstrations spectaculaires de modèles VLA et une méthodologie d'évaluation rigoureuse, préalable à toute commercialisation sérieuse de politiques génératives sur des flottes de robots. Cette proposition s'inscrit dans une vague plus large de modèles VLA génériques, dans la lignée de familles comme Pi-0, GR00T N2 ou Helix évoquées dans la littérature récente, conçus pour généraliser des tâches de manipulation à partir d'apprentissage multimodal, où l'évaluation fiable reste un angle mort largement sous-traité comparé aux annonces de capacités. Le protocole proposé vise justement à vérifier que ce pipeline automatisé aboutit aux mêmes conclusions qu'une évaluation réelle exhaustive, condition nécessaire avant toute adoption large. L'article ne mentionne ni partenariat industriel, ni déploiement commercial, ni calendrier de disponibilité d'un outil package: il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, dont la reprise par d'autres laboratoires déterminera l'impact réel sur les pratiques de benchmarking en robotique.

RecherchePaper
1 source