
AcrossVAM 1.0 : modélisation du monde par particules pour la prédiction vidéo robotique assistée par texte
Un article de recherche publié sur arXiv (2608.28491v1) présente AcrossVAM1.0, un modèle léger de prédiction vidéo robotique guidé par texte, qui sépare le raisonnement sur le mouvement de la préservation de l'apparence visuelle. Un codec figé, SAM3-DLP, décompose quatre images de contexte en particules sémantiques du robot, du bras et de la pince, plus un latent de fond ; un Transformer spatio-temporel de 0,28 million de paramètres aligne ces particules, projette leur état futur et se module via FiLM sur un embedding OpenCLIP figé. Un décodeur à deux flux combine mouvement par particules et apparence tirée de la dernière image observée pour produire cinq images futures. Sur le benchmark maison VRS, la dynamique par particules réduit l'erreur de trajectoire de 21,0% face à une simple persistance, et le PSNR/SSIM des images futures progresse de 19,97/0,796 à 20,573/0,8004 sur trois graines testées, tandis que le PSNR des zones de mouvement grimpe de 11,89 à 13,23.
Le résultat valide une piste architecturale précise : traiter des particules d'objets de faible dimension, plutôt que des pixels bruts, comme interface de prédiction vidéo robotique, une alternative potentiellement plus légère et interprétable aux modèles vision-langage-action massifs. Les auteurs tempèrent eux-mêmes la portée de leur travail : le modèle livré ne bat pas encore la simple persistance sur la métrique perceptuelle LPIPS, et remplacer les instructions correctes par des instructions mélangées au hasard ne change l'erreur de trajectoire que de 2,8 à 3,1%, signe que l'ancrage du langage reste largement à démontrer. Pour des intégrateurs évaluant des modèles world/action génératifs, ce travail illustre donc autant le potentiel de l'approche par particules que l'écart persistant entre fidélité visuelle et réelle compréhension du langage.
AcrossVAM1.0 s'inscrit dans une lignée de travaux cherchant à dépasser les générateurs vidéo end-to-end en robotique, où la fidélité pixel masque souvent l'absence de réel raisonnement sur le mouvement, en s'appuyant sur des briques externes figées : SAM3-DLP pour la segmentation en particules, OpenCLIP pour l'ancrage textuel. L'étude reste au stade de la recherche publiée, avec analyses oracle et contrôles négatifs, l'ancrage robuste du langage et la fidélité de l'apparence livrée restant les deux chantiers prioritaires identifiés par les auteurs pour la suite.
Dans nos dossiers




