
Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)
Des chercheurs ont publié sur arXiv en septembre 2026 un article décrivant WM-VS (World Model for Visual Servoing), un cadre d'asservissement visuel en boucle fermée fonde sur un modèle du monde aligne sur la progression de la tache. Le système utilise des correspondances DINOv2 calculées hors ligne sur une région cible pour définir une coordonnée de servo signée en quatre dimensions (translation, échelle, rotation dans le plan). L'entrainement se fait en deux étapes: la première aligne les transitions latentes conditionnées par l'action sur cette coordonnée, la seconde gelé le modèle du monde et entraine une politique réactive de vitesse articulaire via imitation d'action, supervision des conséquences et courtes projections imaginées favorisant la réduction d'erreur. Le déploiement se fait uniquement en RGB, de manière réactive, sans optimisation de trajectoire en ligne. Sur un bras réel a 7 degrés de liberté en configuration camera fixe (eye-to-hand), l'erreur RMSE sur les coins de la cible descend a 10% ou moins de sa valeur initiale dans 30 essais sur 30, et ce critère est maintenu jusqu'a la dernière image valide dans 25 essais sur 30, soit 83,33%. Retirer l'alignement sur l'erreur future fait chuter ce taux a 26,67%. Le signal de progression appris corrélé avec une mesure externe d'erreur par marqueur AprilTag non utilisée pour l'entrainement (coefficient de Spearman de 0,8778). Sans reentrainement, sur deux cibles 3D inédites, les auteurs rapportent des réductions d'erreur de translation de 86,48% et 90,27%, et de rotation de 70,01% et 65,70%. Code et données sont annonces pour une publication ultérieure en open source, mais ne sont pas encore disponibles.
Le problème cible n'est pas cosmétique pour l'asservissement visuel industriel: la plupart des modèles du monde prédisent des états plausibles sans indiquer si une action réduit réellement l'erreur de tache, un écart que les auteurs nomment le "prédiction-control mismatch". Combler ce manque intéressé directement les intégrateurs qui cherchent des bras capables de corriger leur trajectoire en boucle fermée a partir d'une simple camera RGB, sans capteur de profondeur ni calcul de trajectoire couteux en ligne. Le résultat le plus parlant reste la généralisation a des cibles jamais vues, avec des réductions d'erreur supérieures a 65% sans reentrainement, qui suggère que le signal appris capture une notion géométrique transférable plutôt qu'un simple mimétisme des trajectoires d'entrainement. La validation reste toutefois limitée a un seul bras en laboratoire et a un petit jeu de cibles: rien n'indique la robustesse face aux occlusions, variations d'éclairage ou objets déformables d'un entrepôt ou d'une ligne d'assemblage réelle.
Cette approche s'inscrit dans la vague des modèles du monde appliques au contrôle robotique, un axe distinct mais complémentaire des architectures vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la manipulation généraliste pilotée par instructions en langage naturel. WM-VS se concentre plus étroitement sur l'asservissement visuel classique, en le rendant réactif grâce a un apprentissage explicitement aligne sur la réduction d'erreur plutôt que sur la seule plausibilité visuelle. Les auteurs présentent ce travail comme une preuve de concept méthodologique avant diffusion plus large du code et des données. Aucun partenaire industriel, site pilote ou calendrier de déploiement n'est mentionne, ce qui situe cette contribution au stade de la recherche académique et non du produit prêt a l'emploi.
Dans nos dossiers




