
CST-WM : un modèle du monde à structure causale pour le suivi visuel incarné
Des chercheurs proposent CST-WM, un modèle du monde à structure causale pour le suivi visuel incarné (embodied visual tracking), publié sur arXiv (2609.06302v2). La tâche consiste à choisir des actions qui gardent une cible mobile visible à bonne distance, puis à la retrouver après une occlusion, une sortie de champ ou le croisement d'un élément distracteur. Le suivi est formulé comme une planification sur les preuves futures de présence de la cible, à l'aide d'un modèle du monde conditionné par l'action. L'état du modèle est scindé en trois branches (preuve de la cible, robot, observation). La transition supprime le lien direct, au même pas de temps, entre l'action et la preuve de la cible, mais conserve le chemin passant par le mouvement du robot et les vues qui en résultent. Couplé à un contrôle prédictif par rollouts (MPC), un modèle unique gère le suivi stable et la réacquisition après perte. Sur EVT-Bench et Habitat 3.0, il est évalué en suivi standard, en récupération après perte et en transfert entre jeux de données. Sur un quadrupède Unitree Go2, il réussit 20 essais réels sur 30 (occlusion, croisement de distracteurs, mouvements rapides), contre 14 sur 30 pour TrackVLA.
L'intérêt tient au diagnostic d'un défaut discret mais répandu. Dans les données de suivi enregistrées, les actions de la politique de collecte sont corrélées à la position de la cible. Un prédicteur générique apprend alors un raccourci, où l'action courante est écrite directement dans la prédiction de la cible. Les auteurs appellent cela l'hallucination causale. Les rollouts semblent plausibles, mais le classement des actions candidates repose sur une mauvaise raison, ce qui dégrade précisément la planification. Les résultats vont dans ce sens : retirer le masque d'action provoque la plus forte baisse de réacquisition parmi les ablations. Hors ligne, l'erreur de rollout multi-pas est plus faible et le classement des actions s'accorde mieux avec celui du simulateur. Pour les intégrateurs, le message est qu'un modèle du monde entraîné sur des logs opérationnels peut être trompé par des biais de collecte, et que l'ajout d'une structure causale se montre plus utile que davantage de données. Les limites sont claires : 30 essais par méthode sur un seul robot restent un échantillon réduit, et l'écart de 20 contre 14 sur 30 demande confirmation à plus grande échelle.
Ces travaux se positionnent face aux suiveurs réactifs et aux approches VLA (vision-langage-action) comme TrackVLA, qui mappent directement les observations vers les actions sans anticiper les conséquences. Ils s'ajoutent aux modèles du monde utilisés en planification robotique, en y injectant une contrainte causale explicite. Le Go2, plateforme de recherche courante, sert de banc d'essai réaliste, mais aucun déploiement industriel ni produit n'est annoncé : il s'agit d'une publication académique. Les prochaines étapes probables sont des validations sur d'autres morphologies, des environnements plus denses et des mesures de latence de planification, que le résumé ne précise pas.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




