
SpatialVAM : une diffusion vidéo multi-vues consciente de l'espace pour un pilotage robotique économe en données
Une équipe de recherche présente SpatialVAM, un système décrit comme le premier "3D Video Action Model", capable de prédire simultanément des vidéos de heatmaps multi-vues sensibles à la structure spatiale et des vidéos RGB classiques pour piloter un bras robotique. Publié sur arXiv sous la référence 2604.03181 (version de remplacement d'un article existant), le modèle apprend à partir de seulement dix trajectoires de démonstration, sans pré-entraînement supplémentaire. Il est évalué sur les bancs d'essai simulés Meta-World et RoboCasa ainsi que sur des plateformes robotiques réelles, avec des gains de performance rapportés de 22% sur Meta-World, 15% sur RoboCasa et 16% en conditions réelles par rapport aux meilleures alternatives testées, qu'il s'agisse d'autres modèles vidéo-action, de modèles vision-langage-action (VLA) ou de politiques fondées sur des représentations 3D. Le système exécute des tâches longues et impliquant des contacts physiques, généralise à des situations hors distribution d'entraînement et produit des prédictions vidéo jugées réalistes pour anticiper l'évolution future de la scène.
L'intérêt principal pour l'industrie robotique tient à l'efficacité en données. La plupart des politiques de manipulation actuelles reposent sur des observations visuelles 2D ou sur des backbones pré-entraînés sur des paires image-texte statiques, ce qui impose des volumes de démonstrations importants et limite la compréhension de la dynamique de l'environnement. En injectant nativement l'information spatiale 3D dans un modèle vidéo fondamental, tout en alignant le format de représentation entre le pré-entraînement vidéo et le finetuning pour l'action, SpatialVAM cherche à combler cet écart. Si ces résultats se confirment au-delà des bancs d'essai académiques, ils renforceraient l'hypothèse qu'un apprentissage par imitation avec très peu de démonstrations peut suffire pour des tâches de manipulation complexes, un enjeu direct pour les intégrateurs cherchant à éviter la collecte de jeux de données massifs et coûteux.
Le travail se positionne explicitement contre trois familles d'approches existantes: les modèles vidéo-action classiques, les politiques vision-langage-action de type VLA, et les politiques fondées sur des représentations 3D, sans toutefois nommer de systèmes concurrents précis. Aucune affiliation d'entreprise ni de laboratoire n'est précisée dans le résumé, et le travail reste à ce stade une contribution de recherche évaluée en simulation et sur banc réel, sans indication de déploiement industriel ni de calendrier de commercialisation.
Dans nos dossiers




