SimpleMemVLA : une mémoire vidéo native simple mais efficace pour les modèles vision-langage-action
Des chercheurs affiliés au laboratoire chinois OpenBMB publient sur arXiv (référence 2609.05533v2, version révisée) un système de mémoire pour modèles vision-langage-action (VLA) baptisé SimpleMemVLA, conçu pour la manipulation robotique sur des horizons longs, où l'information nécessaire à une décision a parfois été observée plusieurs minutes auparavant. Contrairement aux mécanismes existants tels que les bancs de récupération, les compresseurs appris ou les états récurrents, qui doivent choisir a priori quoi conserver du passé sans savoir ce qu'une future décision exigera, SimpleMemVLA se passe de tout module de mémoire dédié: il exploite directement le contexte vidéo natif du modèle de base, en gardant l'historique échantillonné intact au format vidéo horodaté pour lequel ce backbone a été pré-entraîné. Les indices pertinents sont acheminés vers une tête d'action par flow-matching via les états cachés d'une sous-tâche générée, et l'historique partagé entre décisions consécutives est pré-rempli pendant l'exécution, ce qui maintient une latence proche de celle d'un VLA mono-image. Le système atteint l'état de l'art sur quatre benchmarks de mémoire sans dégrader le contrôle général, et surpasse nettement, à backbone et entraînement identiques, les approches par récupération, compression et états récurrents. Sur un robot physique à deux bras, il mène à bien deux tâches dont l'indice décisif disparaît de la scène avant que le robot n'agisse.
Le résultat remet en cause une hypothèse répandue dans la conception des VLA: qu'un historique de plusieurs minutes serait trop volumineux pour être traité tel quel, justifiant des architectures de mémoire dédiées et coûteuses à entraîner. En montrant qu'un backbone VLM moderne peut ingérer cet historique brut sans perte de latence notable, l'étude suggère qu'une partie du travail d'ingénierie mémoire spécialisée pourrait devenir superflue à mesure que les fenêtres de contexte s'élargissent, un peu comme dans les grands modèles de langage. Pour les intégrateurs et chercheurs en manipulation longue durée, cela ouvre une piste plus simple pour traiter des tâches où un repère visuel clé (étiquette, position d'un objet) doit être mémorisé bien avant d'être exploité. La validation reste toutefois circonscrite: les benchmarks sont vraisemblablement simulés et la démonstration physique se limite à deux tâches sur un seul robot bibras, loin d'un déploiement industriel.
Le travail s'inscrit dans la lignée des recherches sur la mémoire des modèles VLA, qu'il compare explicitement aux approches par récupération, compression et états récurrents citées dans l'article. Aucun partenaire industriel, pilote ni calendrier commercial n'est annoncé: il s'agit d'une contribution académique dont le code est publié en accès libre sur GitHub, sous le dépôt OpenBMB/SimpleMemVLA, sans mention d'acteur français ou européen dans ce travail.
Dans nos dossiers




