Aller au contenu principal
RecherchearXiv cs.RO 

SimpleMemVLA : une mémoire vidéo native simple mais efficace pour les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs affiliés au laboratoire chinois OpenBMB publient sur arXiv (référence 2609.05533v2, version révisée) un système de mémoire pour modèles vision-langage-action (VLA) baptisé SimpleMemVLA, conçu pour la manipulation robotique sur des horizons longs, où l'information nécessaire à une décision a parfois été observée plusieurs minutes auparavant. Contrairement aux mécanismes existants tels que les bancs de récupération, les compresseurs appris ou les états récurrents, qui doivent choisir a priori quoi conserver du passé sans savoir ce qu'une future décision exigera, SimpleMemVLA se passe de tout module de mémoire dédié: il exploite directement le contexte vidéo natif du modèle de base, en gardant l'historique échantillonné intact au format vidéo horodaté pour lequel ce backbone a été pré-entraîné. Les indices pertinents sont acheminés vers une tête d'action par flow-matching via les états cachés d'une sous-tâche générée, et l'historique partagé entre décisions consécutives est pré-rempli pendant l'exécution, ce qui maintient une latence proche de celle d'un VLA mono-image. Le système atteint l'état de l'art sur quatre benchmarks de mémoire sans dégrader le contrôle général, et surpasse nettement, à backbone et entraînement identiques, les approches par récupération, compression et états récurrents. Sur un robot physique à deux bras, il mène à bien deux tâches dont l'indice décisif disparaît de la scène avant que le robot n'agisse.

Le résultat remet en cause une hypothèse répandue dans la conception des VLA: qu'un historique de plusieurs minutes serait trop volumineux pour être traité tel quel, justifiant des architectures de mémoire dédiées et coûteuses à entraîner. En montrant qu'un backbone VLM moderne peut ingérer cet historique brut sans perte de latence notable, l'étude suggère qu'une partie du travail d'ingénierie mémoire spécialisée pourrait devenir superflue à mesure que les fenêtres de contexte s'élargissent, un peu comme dans les grands modèles de langage. Pour les intégrateurs et chercheurs en manipulation longue durée, cela ouvre une piste plus simple pour traiter des tâches où un repère visuel clé (étiquette, position d'un objet) doit être mémorisé bien avant d'être exploité. La validation reste toutefois circonscrite: les benchmarks sont vraisemblablement simulés et la démonstration physique se limite à deux tâches sur un seul robot bibras, loin d'un déploiement industriel.

Le travail s'inscrit dans la lignée des recherches sur la mémoire des modèles VLA, qu'il compare explicitement aux approches par récupération, compression et états récurrents citées dans l'article. Aucun partenaire industriel, pilote ni calendrier commercial n'est annoncé: il s'agit d'une contribution académique dont le code est publié en accès libre sur GitHub, sous le dépôt OpenBMB/SimpleMemVLA, sans mention d'acteur français ou européen dans ce travail.

À lire aussi

rMuscle : mémoire musculaire robotique pour une inférence efficace des modèles vision-langage-action
1arXiv cs.RO 

rMuscle : mémoire musculaire robotique pour une inférence efficace des modèles vision-langage-action

Un preprint arXiv (2609.19104v1, septembre 2026) présente rMuscle, un framework d'inférence en temps réel pour les modèles Vision-Language-Action (VLA) qui pilotent des robots. Le système part d'un constat : dans un poste de travail structuré, les exécutions robotiques répétées montrent une forte similarité, non seulement dans les observations et les trajectoires d'action, mais aussi dans les états internes du modèle. rMuscle exploite cette redondance via un cache à double phase inspiré de la mémoire musculaire humaine : un Context Cache qui réutilise les tokens visuels déjà calculés, et un Action Cache qui réutilise les motifs d'activation des neurones pour réduire les accès aux poids du modèle, son coût restant limité par recalcul en ligne et récupération par fenêtre glissante. Testé sur GPU RTX 4090 et cartes embarquées Jetson Thor, sur les benchmarks de simulation LIBERO et RoboTwin ainsi que sur des tâches de manipulation physique réelle, il affiche une accélération de 1,29 à 1,42 fois sans dégrader les taux de réussite du modèle original. L'enjeu est concret : la latence d'inférence détermine directement la réactivité et la fluidité des mouvements d'un robot, un facteur critique alors que les VLA s'imposent comme le paradigme dominant du contrôle robotique en usine. Les frameworks d'inférence généralistes ignorent pourtant la répétitivité propre aux tâches industrielles structurées, un angle mort que rMuscle attaque directement plutôt que de viser une accélération générique du calcul, ce qui concerne au premier chef les intégrateurs qui déploient des VLA sur du matériel embarqué à ressources limitées comme le Jetson Thor. Le point le plus significatif pour le secteur est que ce gain de vitesse ne dégrade pas le taux de réussite sur robot réel, une réponse directe au doute récurrent sur l'écart entre démonstrations en simulation et performance en conditions réelles. Il s'agit néanmoins d'un résultat de recherche publié en preprint, sans validation par les pairs ni intégration annoncée dans un produit commercial identifié. Ce travail s'inscrit dans la course actuelle à l'optimisation de l'inférence des VLA, devenus le paradigme dominant à mesure que les tâches manuelles répétitives en usine s'imposent comme le scénario de déploiement le plus rentable pour l'IA incarnée. rMuscle se distingue des méthodes génériques de compression ou de quantification de modèles en misant sur la structure même du travail industriel répété poste par poste, sans que les auteurs précisent quels VLA spécifiques ont servi de base expérimentale ni de calendrier de publication du code. La suite logique, non confirmée par l'article, serait une adoption par des frameworks d'inférence robotique plus larges ou des tests sur d'autres plateformes matérielles au-delà du RTX 4090 et du Jetson Thor.

RechercheActu
1 source
UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
2arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source
StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action
3arXiv cs.RO 

StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action

Publié le 22 septembre 2026 sur arXiv sous la référence 2609.22684, StateMem est un nouveau framework de mémoire pour les politiques vision-langage-action (VLA) utilisées en manipulation robotique. Plutôt que de s'appuyer sur des banques de mémoire externes comme celles de MemoryVLA, il maintient un unique token de mémoire persistant mis à jour par résidus de faible rang et route de façon adaptative les préfixes mis en cache, avec un contrôleur sans entraînement ajustant le seuil en ligne et une correction rapide compensant la dérive des données en cache. Sur le benchmark LIBERO, StateMem atteint 97,6% de réussite moyenne tout en réduisant de 20,25% la fréquence de rafraîchissement complet du préfixe du modèle vision-langage. Sur RoboMemArena, catégorie Occlusion, il devance les autres méthodes VLA isolées avec 21,8% de taux de succès par tâche et 44,3% de taux de succès cumulé, et gagne 21 points de réussite moyenne sur six tâches de manipulation réelle. L'enjeu est concret pour l'industrie: la manipulation robotique dépendante de la mémoire, où une action tardive doit exploiter une information vue plus tôt, comme un objet temporairement caché, reste un point faible des VLA qui ne regardent que l'observation courante. En évitant le stockage et la récupération explicites d'une mémoire externe, StateMem allège le pipeline d'inférence et réduit le calcul redondant, un critère décisif pour la latence et le coût de calcul embarqué en déploiement temps réel. Les gains en environnement d'occlusion sont particulièrement significatifs car ils ciblent l'écart entre démonstrations de laboratoire et conditions réelles d'usine ou d'entrepôt, où l'occlusion visuelle est fréquente. Le travail s'inscrit dans la lignée des politiques VLA qui cherchent à dépasser la réaction à l'instant présent pour intégrer un raisonnement temporel, en se positionnant comme alternative plus légère aux architectures à mémoire externe explicite telles que MemoryVLA. Les auteurs valident leur approche sur trois terrains complémentaires, la suite standardisée LIBERO, le benchmark récent RoboMemArena axé sur mémoire et occlusion, et des tâches réelles sur robot physique, limitant le risque de sur-optimisation à un seul environnement simulé. Déposé en pré-publication sans mention de licence commerciale ni de partenariat industriel, StateMem reste à ce stade une contribution de recherche dont l'adoption en production dépendra de sa reproduction indépendante.

RechercheActu
1 source
MemBodied : mémoire associative récurrente pour modèles vision-langage-action
4arXiv cs.RO 

MemBodied : mémoire associative récurrente pour modèles vision-langage-action

Un modèle appelé MemBodied introduit une mémoire épisodique de taille fixe pour les modèles Vision-Language-Action (VLA), détaillée dans un article arXiv (2609.28256v1) publié en septembre 2026. Le système repose sur deux composants complémentaires: un état associatif qui enregistre les interactions au fil des appels successifs de la politique, et une ancre d'épisode qui conserve une représentation compacte de la scène initiale comme référence. Sur cinq tâches du benchmark RMBench conçues pour nécessiter de la mémoire, MemBodied atteint un taux de succès moyen 7,81 fois supérieur à celui d'une politique sans état (stateless) et 2,98 fois supérieur à une mémoire récurrente classique, tout en dépassant la meilleure référence à mémoire augmentée de 1,3 fois avec dix fois moins de paramètres ajoutés. Sur la suite LIBERO-Long, entièrement observable, il atteint 90,6% de réussite, soit une amélioration de 5,4 points par rapport à la politique stateless Pi-0. Le problème que cible ce travail est central pour l'industrie robotique: la majorité des politiques VLA déployées aujourd'hui ne conservent aucune information au-delà de l'observation en cours, ce qui les rend incapables de gérer des tâches de manipulation dépendantes de l'historique, par exemple retrouver un objet déplacé hors champ ou se souvenir qu'une étape a déjà été exécutée. La solution habituelle, garder l'historique complet dans le contexte du modèle, fait gonfler la latence d'inférence et le coût de calcul, un frein direct pour des cas d'usage industriels en temps réel. En proposant une mémoire à empreinte constante plutôt qu'un contexte qui s'étend indéfiniment, MemBodied répond à une limite concrète des architectures VLA à grande échelle (Pi-0, GR00T N2, Helix) qui excellent sur des tâches courtes mais peinent sur des séquences longues nécessitant du raisonnement temporel. Les VLA se sont imposés comme paradigme dominant du contrôle robotique généraliste ces dernières années, portés par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. MemBodied se positionne comme une alternative légère à l'extension de contexte, comparée aux politiques sans état, à la mémoire récurrente standard et aux meilleures approches de mémoire augmentée existantes. Il s'agit à ce stade d'un résultat de recherche mesuré sur des benchmarks (RMBench, LIBERO-Long), sans annonce de déploiement industriel ni de partenariat commercial.

RechercheActu
1 source