Aller au contenu principal
SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu
RecherchearXiv cs.RO 

SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 11 août 2026 sur arXiv (référence 2608.07548v1) un article présentant SC²-WM, un modèle du monde auto-correcteur destiné à la navigation par vision et langage en environnement continu (VLN-CE), une tâche où un agent robotique doit suivre des instructions en langage naturel pour se déplacer dans un espace qu'il ne perçoit que partiellement. Contrairement à la plupart des méthodes existantes, qui fonctionnent en boucle ouverte sans mécanisme pour détecter une dérive de leur représentation interne pendant l'exécution, SC²-WM introduit une boucle de rétroaction fermée : le modèle du monde anticipe les conséquences d'une action avant de l'exécuter et affine le plan de navigation au niveau de l'état interne. Pour les cas les plus difficiles, les auteurs ajoutent un mécanisme d'adaptation conditionnelle qui met à jour le modèle du monde lui-même au moment du test, lorsque la rétroaction signale que ses capacités sont insuffisantes pour la situation rencontrée. Les expériences, menées sur les benchmarks standards de VLN-CE, montrent une robustesse et une généralisation améliorées par rapport aux approches en boucle ouverte. Le code est mis à disposition sur GitHub (sunrise-ikun/SC2_WM). Aucun chiffre précis de gain de performance ni comparaison avec des systèmes commerciaux n'est communiqué dans le résumé.

Cette contribution touche un point sensible de la navigation robotique par instructions : le fossé entre les démonstrations en simulation et la fiabilité en conditions réelles. Un agent en boucle ouverte accumule des erreurs de perception ou d'interprétation du langage sans pouvoir les corriger, ce qui dégrade rapidement ses performances dès que l'environnement s'écarte des données d'entraînement. En donnant au modèle du monde la capacité de vérifier ses propres prédictions avant d'agir, puis de se réadapter localement quand ses connaissances ne suffisent plus, SC²-WM s'inscrit dans une tendance de fond de la recherche en IA incarnée : rendre les architectures de type modèle du monde ou VLA plus robustes à l'inférence, sans réentraînement complet. Pour les intégrateurs travaillant sur des AMR ou des plateformes mobiles guidées par langage naturel, ce type de mécanisme de correction interne est un prérequis pour sortir des scénarios de laboratoire scriptés et s'approcher d'un déploiement fiable en environnement non structuré.

SC²-WM s'inscrit dans la lignée des travaux récents combinant modèles du monde et navigation instruite par le langage, un domaine où la littérature s'est jusqu'ici surtout concentrée sur l'amélioration de la perception et de la planification en boucle ouverte, laissant de côté la correction d'erreurs pendant l'exécution. L'article ne précise ni affiliation institutionnelle ni partenariat industriel ; il s'agit d'une publication de recherche accompagnée d'un code open source, sans annonce de produit ni de déploiement commercial. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation sur des plateformes robotiques physiques et une comparaison directe avec d'autres architectures de navigation par le langage, notamment les approches fondées sur des modèles VLA génériques.

À lire aussi

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée
1arXiv cs.RO 

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée

Un article publié sur arXiv (référence 2608.07267, catégorie "cross-listing" signalant un croisement entre disciplines) présente WNM-3D, un modèle de navigation "world-action" conçu pour la navigation vision-langage en boucle fermée, c'est-à-dire des robots qui suivent des instructions en langage naturel à partir de flux vidéo égocentriques. Le système combine un encodeur de géométrie gelé, qui extrait des représentations 3D à partir de l'historique RGB monoculaire de l'agent, avec un adaptateur entraînable appelé 3D Scene-to-Token, qui convertit ces représentations en un préfixe de longueur fixe injecté dans un Transformer de diffusion. Grâce à un mécanisme d'attention "block-causal", ce contexte géométrique conditionne à la fois la génération des futures vues visuelles et celle des actions de navigation. L'entraînement se déroule en trois étapes : un ajustement supervisé sur des démonstrations générées par l'algorithme A*, une adaptation de type DAgger sur les états visités par la politique elle-même, puis une optimisation en boucle fermée via une méthode appelée DanceGRPO. Sur le benchmark GN-Bench, WNM-3D surpasse des politiques de navigation basées sur des modèles vision-langage classiques ainsi que sa propre variante conditionnée en 2D, avec une meilleure cohérence entre flux visuel et action et une erreur de mouvement visuel réduite sur un jeu d'évaluation proche de l'objectif. L'intérêt de ces travaux réside dans le diagnostic qu'ils posent sur les approches VLA (vision-language-action) actuelles, qui associent directement observations et instructions à des actions sans modéliser explicitement comment la scène visuelle doit évoluer sous l'effet du mouvement prédit. En ancrant la prédiction conjointe d'images futures et d'actions dans une représentation 3D persistante plutôt que dans un simple contexte 2D, WNM-3D vise à réduire la dérive en boucle fermée, un problème classique où les erreurs de navigation s'accumulent au fil des pas de temps. Pour les intégrateurs de robots mobiles autonomes, ce résultat suggère qu'un conditionnement géométrique explicite améliore la robustesse par rapport à des politiques purement basées sur des modèles vision-langage préentraînés, sans toutefois constituer une preuve de déploiement réel : les résultats restent circonscrits à un benchmark, sans essai terrain ni robot physique mentionné. Ce travail s'inscrit dans la lignée des modèles génératifs "world-action" (WAM), une famille d'approches qui prédisent conjointement observations futures et actions mais qui, jusqu'ici, ne conditionnaient pas cette génération sur une représentation géométrique de l'historique observé pour la navigation continue. WNM-3D se positionne explicitement contre les politiques VLA de référence et contre une variante 2D du même modèle, utilisée comme ablation pour isoler l'apport du conditionnement 3D. Aucun partenariat industriel, aucun calendrier de déploiement ni acteur commercial n'est mentionné dans l'abstract, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit prêt à l'intégration.

RechercheActu
1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
2arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
VLAQuantBench : évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action
3arXiv cs.RO 

VLAQuantBench : évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action

Des chercheurs ont publié VLAQuantBench, un protocole d'évaluation en boucle fermée de la quantification post-entraînement pour les modèles vision-langage-action, construit sur 409 runs et 94 574 épisodes de simulation, avec quatre modèles testés sur le benchmark LIBERO et X-VLA évalué en plus sur trois autres familles de benchmarks de simulation. Sous une quantification W4A4 non calibrée (poids et activations sur 4 bits), étendre le sous-ensemble de couches de la tête d'action de π0.5 de 126 à 167 couches fait bondir le taux de réussite de 7,0% à 70,5%, un gain confirmé par rejeu à observations fixes. Une calibration limitée à deux épisodes supprime les échecs sévères observés sur les sous-ensembles testés, mais la même recette de lissage et d'écrêtage dégrade le score de π0 et ne suffit pas à restaurer OpenVLA-OFT de bout en bout, qui exige de protéger une seule projection de sortie de 28 672 paramètres pour retrouver une performance quasi égale à la référence, le reste du réseau (441 couches linéaires) pouvant alors tourner en poids 3 bits sur LIBERO-Long ou en activations 8 bits sur les quatre suites testées. Ces résultats visent directement les équipes qui doivent faire tenir des VLA de plusieurs milliards de paramètres dans la mémoire limitée d'un contrôleur embarqué, un enjeu croissant pour les robots manipulateurs et humanoïdes commerciaux. Le constat principal invalide l'idée de règles de sensibilité par couche universelles et transférables d'un modèle à l'autre: une même recette de calibration peut sauver un modèle et en casser un autre, ce qui impose aux intégrateurs de valider chaque schéma de quantification modèle par modèle plutôt que de recycler des heuristiques génériques. L'étude montre aussi qu'un effondrement massif sous quantification agressive ne trahit pas forcément une fragilité intrinsèque du VLA, puisqu'un ajustement ciblé du périmètre de couches protégées, ou une simple calibration sur deux épisodes, peut faire passer la réussite de 7% à plus de 70%. La quantification post-entraînement, technique éprouvée sur les grands modèles de langage, est de plus en plus reprise telle quelle pour les VLA sans validation poussée sur des tâches de manipulation en boucle fermée, un vide que ce travail comble en testant côte à côte π0, π0.5, OpenVLA-OFT et X-VLA. Le code, les configurations et les enregistrements d'épisodes sont publiés en accès libre sur GitHub, ce qui permet à d'autres équipes de reproduire ou d'étendre les assignations de précision identifiées. L'article, référencé arXiv:2609.25376, n'annonce ni nouveau modèle ni déploiement commercial, mais livre un outil méthodologique aux équipes de recherche et d'ingénierie qui arbitrent entre empreinte mémoire et fiabilité avant de faire tourner un VLA sur du matériel embarqué.

RecherchePaper
1 source
Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)
4arXiv cs.RO 

Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)

Des chercheurs ont publié sur arXiv en septembre 2026 un article décrivant WM-VS (World Model for Visual Servoing), un cadre d'asservissement visuel en boucle fermée fonde sur un modèle du monde aligne sur la progression de la tache. Le système utilise des correspondances DINOv2 calculées hors ligne sur une région cible pour définir une coordonnée de servo signée en quatre dimensions (translation, échelle, rotation dans le plan). L'entrainement se fait en deux étapes: la première aligne les transitions latentes conditionnées par l'action sur cette coordonnée, la seconde gelé le modèle du monde et entraine une politique réactive de vitesse articulaire via imitation d'action, supervision des conséquences et courtes projections imaginées favorisant la réduction d'erreur. Le déploiement se fait uniquement en RGB, de manière réactive, sans optimisation de trajectoire en ligne. Sur un bras réel a 7 degrés de liberté en configuration camera fixe (eye-to-hand), l'erreur RMSE sur les coins de la cible descend a 10% ou moins de sa valeur initiale dans 30 essais sur 30, et ce critère est maintenu jusqu'a la dernière image valide dans 25 essais sur 30, soit 83,33%. Retirer l'alignement sur l'erreur future fait chuter ce taux a 26,67%. Le signal de progression appris corrélé avec une mesure externe d'erreur par marqueur AprilTag non utilisée pour l'entrainement (coefficient de Spearman de 0,8778). Sans reentrainement, sur deux cibles 3D inédites, les auteurs rapportent des réductions d'erreur de translation de 86,48% et 90,27%, et de rotation de 70,01% et 65,70%. Code et données sont annonces pour une publication ultérieure en open source, mais ne sont pas encore disponibles. Le problème cible n'est pas cosmétique pour l'asservissement visuel industriel: la plupart des modèles du monde prédisent des états plausibles sans indiquer si une action réduit réellement l'erreur de tache, un écart que les auteurs nomment le "prédiction-control mismatch". Combler ce manque intéressé directement les intégrateurs qui cherchent des bras capables de corriger leur trajectoire en boucle fermée a partir d'une simple camera RGB, sans capteur de profondeur ni calcul de trajectoire couteux en ligne. Le résultat le plus parlant reste la généralisation a des cibles jamais vues, avec des réductions d'erreur supérieures a 65% sans reentrainement, qui suggère que le signal appris capture une notion géométrique transférable plutôt qu'un simple mimétisme des trajectoires d'entrainement. La validation reste toutefois limitée a un seul bras en laboratoire et a un petit jeu de cibles: rien n'indique la robustesse face aux occlusions, variations d'éclairage ou objets déformables d'un entrepôt ou d'une ligne d'assemblage réelle. Cette approche s'inscrit dans la vague des modèles du monde appliques au contrôle robotique, un axe distinct mais complémentaire des architectures vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la manipulation généraliste pilotée par instructions en langage naturel. WM-VS se concentre plus étroitement sur l'asservissement visuel classique, en le rendant réactif grâce a un apprentissage explicitement aligne sur la réduction d'erreur plutôt que sur la seule plausibilité visuelle. Les auteurs présentent ce travail comme une preuve de concept méthodologique avant diffusion plus large du code et des données. Aucun partenaire industriel, site pilote ou calendrier de déploiement n'est mentionne, ce qui situe cette contribution au stade de la recherche académique et non du produit prêt a l'emploi.

RecherchePaper
1 source