
AtlasVLA : une modélisation persistante de l'état monde-ego pour les modèles vision-langage-action
Une équipe de recherche présente AtlasVLA, un nouveau framework pour les modèles vision-langage-action (VLA), décrit dans un article publié sur arXiv le 6 août 2026 (arXiv:2608.06729v1). Le système repose sur une architecture à double mémoire: une "4D Persistent World State Memory", qui transforme les observations 2D transitoires en un état spatial global mis à jour en continu via un hachage voxel, et une "Ego-Working State Memory", qui conserve l'historique de l'état du robot et l'avancement de la tâche en cours. Ces deux mémoires conditionnent un transformeur de diffusion (DiT) chargé de générer les actions. Testé sur les bancs d'essai LIBERO, RLBench et sur des tâches réelles, AtlasVLA atteint des performances de pointe en n'utilisant qu'une seule caméra montée au poignet, avec des gains de taux de réussite de 9,4 points sur LIBERO-Long et de 17,5 points sur des tâches réelles à long horizon, comparé à des méthodes de référence multi-caméras.
Ce résultat s'attaque à une limite connue des modèles VLA actuels: leur nature réactive, qui pousse les robots à "oublier" un objet dès qu'il sort du champ de la caméra, et à perdre le fil de la progression dans les tâches à plusieurs étapes. Pour les intégrateurs industriels, l'intérêt est concret: obtenir une robustesse comparable à des rigs multi-caméras avec un seul capteur poignet réduit le coût matériel et la complexité de calibration des cellules robotisées. Le résultat remet en question l'hypothèse selon laquelle une couverture visuelle multi-angles serait indispensable pour la manipulation à long horizon, un argument souvent avancé par les fournisseurs de systèmes de vision embarqués. Ces chiffres proviennent toutefois d'un article encore non revu par les pairs, et les conditions précises des essais réels (nombre d'essais, environnements testés) restent à vérifier avant toute généralisation.
Le travail s'inscrit dans la lignée des modèles VLA qui ont émergé ces dernières années, de RT-2 à Pi-0 en passant par GR00T N2 ou Helix, tous construits sur un mappage direct image vers action avec peu ou pas de mémoire persistante. AtlasVLA se positionne explicitement contre les approches multi-vues, qu'il dit surpasser de façon nette sur les tâches longues. L'article ne précise pas d'acteur industriel ni de calendrier de déploiement: il s'agit à ce stade d'une contribution de recherche, sans indication de portage vers un produit commercial ou un partenariat avec un fabricant de robots humanoïdes ou de bras manipulateurs.
Dans nos dossiers




