Aller au contenu principal
RecherchearXiv cs.RO 

LIBERO-VPro : évaluer la robustesse visuelle en boucle fermée des modèles fondation pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient LIBERO-VPro (arXiv:2609.24350), un benchmark conçu pour évaluer la robustesse visuelle en boucle fermée des modèles fondation destinés à la manipulation robotique, alors que les évaluations standards supposent des observations visuelles propres et synchrones du début à la fin de la tâche. Le benchmark perturbe délibérément le flux visuel disponible pendant l'exécution, selon quatre axes complémentaires : dégradation de l'évidence visuelle, obsolescence de la caméra, cohérence de la source visuelle, et variation de scène pertinente pour la tâche, répartis en 12 catégories de défis, 96 configurations expérimentales et 3296 cas tâche-condition. L'équipe évalue trois modèles vision-langage-action (VLA) et trois modèles world-action (WAM) sur environ 196 000 épisodes simulés, complétés par 200 essais réels sur un bras Franka Research 3.

Le résultat central : une performance nominale élevée sur les benchmarks classiques masque des faiblesses substantielles d'ancrage visuel et d'adaptation. Les modèles testés tolèrent bien une occlusion sévère des objets, mais se dégradent brutalement dès que les indices d'interaction locale sont perturbés ou que des a priori spatiaux familiers sont violés ; ils se montrent aussi très sensibles à des observations périmées ou manquantes, et peinent à adapter leur comportement quand les préconditions de la tâche changent. Point notable pour les intégrateurs et les équipes de recherche : VLA et WAM affichent des profils de robustesse distincts, ce qui confirme que la robustesse visuelle est multidimensionnelle et dépend de l'architecture, plutôt que d'être une propriété acquise mécaniquement via le préentraînement à grande échelle. Pour une industrie qui pousse ces modèles vers des déploiements réels, l'étude rappelle qu'un bon score sur un benchmark statique ne garantit rien face à une caméra dégradée, une latence ou une scène qui change, un écart largement soupçonné mais rarement quantifié de façon aussi systématique.

LIBERO-VPro s'appuie sur la suite LIBERO, déjà utilisée comme référence pour l'apprentissage continu en manipulation robotique, en y ajoutant une couche de perturbation visuelle absente des évaluations existantes. Le papier ne nomme pas publiquement les modèles VLA et WAM testés, mais s'inscrit dans un paysage où des familles comme Pi-0, GR00T N2 ou Helix cherchent justement à prouver leur fiabilité au-delà de démonstrations scriptées. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste un travail de recherche académique et non une annonce produit ni un déploiement commercial. Les auteurs présentent LIBERO-VPro comme un cadre de diagnostic destiné à guider le développement de futurs modèles capables de mieux ancrer et adapter leurs actions en conditions visuelles dégradées, sans calendrier de suite ni partenariat industriel annoncé.

À lire aussi

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
1arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
2arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)
3arXiv cs.RO 

Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)

Des chercheurs ont publié sur arXiv en septembre 2026 un article décrivant WM-VS (World Model for Visual Servoing), un cadre d'asservissement visuel en boucle fermée fonde sur un modèle du monde aligne sur la progression de la tache. Le système utilise des correspondances DINOv2 calculées hors ligne sur une région cible pour définir une coordonnée de servo signée en quatre dimensions (translation, échelle, rotation dans le plan). L'entrainement se fait en deux étapes: la première aligne les transitions latentes conditionnées par l'action sur cette coordonnée, la seconde gelé le modèle du monde et entraine une politique réactive de vitesse articulaire via imitation d'action, supervision des conséquences et courtes projections imaginées favorisant la réduction d'erreur. Le déploiement se fait uniquement en RGB, de manière réactive, sans optimisation de trajectoire en ligne. Sur un bras réel a 7 degrés de liberté en configuration camera fixe (eye-to-hand), l'erreur RMSE sur les coins de la cible descend a 10% ou moins de sa valeur initiale dans 30 essais sur 30, et ce critère est maintenu jusqu'a la dernière image valide dans 25 essais sur 30, soit 83,33%. Retirer l'alignement sur l'erreur future fait chuter ce taux a 26,67%. Le signal de progression appris corrélé avec une mesure externe d'erreur par marqueur AprilTag non utilisée pour l'entrainement (coefficient de Spearman de 0,8778). Sans reentrainement, sur deux cibles 3D inédites, les auteurs rapportent des réductions d'erreur de translation de 86,48% et 90,27%, et de rotation de 70,01% et 65,70%. Code et données sont annonces pour une publication ultérieure en open source, mais ne sont pas encore disponibles. Le problème cible n'est pas cosmétique pour l'asservissement visuel industriel: la plupart des modèles du monde prédisent des états plausibles sans indiquer si une action réduit réellement l'erreur de tache, un écart que les auteurs nomment le "prédiction-control mismatch". Combler ce manque intéressé directement les intégrateurs qui cherchent des bras capables de corriger leur trajectoire en boucle fermée a partir d'une simple camera RGB, sans capteur de profondeur ni calcul de trajectoire couteux en ligne. Le résultat le plus parlant reste la généralisation a des cibles jamais vues, avec des réductions d'erreur supérieures a 65% sans reentrainement, qui suggère que le signal appris capture une notion géométrique transférable plutôt qu'un simple mimétisme des trajectoires d'entrainement. La validation reste toutefois limitée a un seul bras en laboratoire et a un petit jeu de cibles: rien n'indique la robustesse face aux occlusions, variations d'éclairage ou objets déformables d'un entrepôt ou d'une ligne d'assemblage réelle. Cette approche s'inscrit dans la vague des modèles du monde appliques au contrôle robotique, un axe distinct mais complémentaire des architectures vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la manipulation généraliste pilotée par instructions en langage naturel. WM-VS se concentre plus étroitement sur l'asservissement visuel classique, en le rendant réactif grâce a un apprentissage explicitement aligne sur la réduction d'erreur plutôt que sur la seule plausibilité visuelle. Les auteurs présentent ce travail comme une preuve de concept méthodologique avant diffusion plus large du code et des données. Aucun partenaire industriel, site pilote ou calendrier de déploiement n'est mentionne, ce qui situe cette contribution au stade de la recherche académique et non du produit prêt a l'emploi.

RecherchePaper
1 source
Vérification en temps réel de modèles pour la planification réactive en boucle fermée de robots
4arXiv cs.RO 

Vérification en temps réel de modèles pour la planification réactive en boucle fermée de robots

Une équipe de recherche a publié une version mise à jour (v2) sur arXiv (2508.19186) d'un article intitulé « Real-Time Model Checking for Closed-Loop Robot Reactive Planning », qui propose une méthode de vérification de modèles (model checking) pour la planification réactive multi-étapes d'un robot autonome. Le constat de départ : les méthodes classiques d'évitement d'obstacles ne raisonnent qu'un pas en avant et se retrouvent souvent piégées dans des minima locaux, par exemple face à une impasse (cul-de-sac) ou un obstacle isolé. Les auteurs ont conçu un petit algorithme de model checking, exécuté directement dans le code du robot, qui génère des plans en temps réel sur un appareil à faible puissance de calcul, sans données pré-calculées ni entraînement préalable. La méthode s'appuie sur des systèmes de contrôle temporaires, activés en chaîne pour contrer les perturbations locales qui écartent le robot de son comportement ou état de repos préféré, et limite l'explosion combinatoire de l'espace d'états en ne travaillant que sur des instantanés temporaires de l'environnement immédiat. La planification multi-étapes repose sur des contre-exemples générés par recherche en profondeur d'abord (depth-first search) et une propriété de chemin en logique temporelle linéaire (LTL) négée. L'intérêt pratique tient à la promesse d'un raisonnement multi-étapes low-cost, sans base de données ni apprentissage profond, embarquable sur du matériel modeste : un argument qui tranche avec la tendance dominante des approches de navigation gourmandes en données et en puissance de calcul. Pour les intégrateurs de robots mobiles critiques (véhicules autonomes, robots de mission), cela ouvre une piste de navigation sûre et déterministe, avec des garanties formelles issues du monde de la vérification logicielle plutôt que des heuristiques d'apprentissage. Les auteurs revendiquent des gains de performance mesurables face à un agent purement réactif limité à un seul pas de raisonnement. Le model checking est historiquement une technique de vérification formelle de logiciels et de systèmes critiques, ici détournée vers la planification de trajectoire en temps réel plutôt que vers l'analyse a posteriori. L'article, positionné comme une étude de cas pédagogique, ne revendique pas de déploiement industriel ni de produit commercialisé : il s'agit de résultats empiriques et de preuves informelles sur deux scénarios contrôlés (impasse et obstacle isolé), présentés comme base pour des travaux futurs en navigation embarquée sûre, notamment pour les véhicules autonomes et la robotique mobile mission-critique.

RecherchePaper
1 source