Aller au contenu principal
RecherchearXiv cs.RO 

Diviser pour mémoriser : une mémoire récursive centrée sur l'action pour les politiques VLA à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Divide-and-Remember (D&R), une méthode de mémoire récursive pour les politiques VLA (vision-language-action) appliquées à la manipulation de longue durée. Le papier, publié sur arXiv (2610.00982), s'attaque aux tâches dites dépendantes de l'historique, où l'observation courante ne suffit pas à déterminer l'action. D&R apprend une fonction de mémoire mt = M(ht) en s'appuyant sur une sélection récursive : la sélection sur l'historique complet est découpée en sous-problèmes de type top-K sur 2K tokens. Des sélecteurs légers, de taille fixe et entraînés de bout en bout, peuvent ainsi gérer un historique non borné. Tous les blocs de récursion partagent un unique sélecteur, ce qui limite le coût de calcul. Sur RoboMME, un benchmark de 16 tâches de manipulation longue qui exigent de se souvenir du quand, du où, du quoi et du comment agir, D&R atteint le meilleur taux de succès moyen publié, avec des gains constants sur les quatre suites, pour un budget de seulement 64 tokens de mémoire. Les auteurs affirment que des essais sur robot réel confirment le gain, sans en donner les chiffres dans le résumé. Le code et les checkpoints sont publiés.

L'enjeu dépasse le seul score de benchmark. Les VLA actuels restent largement réactifs : ils se débrouillent quand la scène contient l'information utile, mais échouent dès qu'il faut se rappeler quel objet a été déplacé, quelle étape est déjà faite ou où un élément a disparu. Ces cas sont fréquents en logistique, en assemblage et en tâches de service. Les méthodes existantes de mémoire reposent sur des heuristiques fixées à la conception, comme conserver les images à forte variation de pixels, et donnent des résultats irréguliers selon les tâches. Le papier les remplace par un critère théorique : la mémoire optimale maximise l'information mutuelle conditionnelle entre l'action et la mémoire, sachant l'observation courante. Autrement dit, elle ne garde que ce qui, dans le passé, est utile à l'action et absent de la vue présente. Pour un intégrateur, le point clé est le budget : 64 tokens, c'est une mémoire compatible avec une inférence embarquée, là où allonger le contexte fait exploser latence et coût. Il faut toutefois rester prudent : RoboMME est un benchmark principalement simulé, et la validation sur robot réel n'est détaillée que dans le papier complet. Il s'agit d'un résultat de recherche, pas d'un produit déployé.

Ce travail s'inscrit dans la montée en puissance des VLA généralistes, comme Pi-0 ou GR00T, qui traitent surtout une observation courte ou quelques images récentes. La mémoire à long horizon est identifiée comme un point faible de ces architectures, et plusieurs équipes explorent la compression du contexte, la mémoire par mots-clés ou les représentations récurrentes. D&R se distingue par sa formulation en problème d'optimisation, issue du cadre POMDP de l'apprentissage par imitation. Les prochaines étapes à surveiller sont la reproduction des résultats sur d'autres benchmarks, les chiffres détaillés sur robot réel et l'intégration dans des modèles de fondation de grande taille.

Dans nos dossiers

À lire aussi

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon
1arXiv cs.RO 

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon

Des chercheurs proposent ActMem-VLA, une architecture qui ajoute une mémoire de l'historique des actions à un modèle vision-langage-action (VLA) déjà entraîné, sans le ré-entraîner. Le système greffe sur une politique de base figée (fine-tunée puis gelée) un plugin composé d'un module mémoire basé sur Mamba, un modèle à espace d'états, et d'un expert léger baptisé PreAction Expert (PAE). Mamba encode les actions déjà exécutées, et cette mémoire conditionne le PAE avec le contexte courant. Pendant les premières étapes de débruitage, à fort bruit, le PAE oriente la progression de la tâche. Il transmet ensuite l'action partiellement débruitée à l'Action Expert (AE) figé, qui affine les détails sur les étapes restantes à faible bruit. Seuls Mamba et le PAE sont optimisés. Sur le benchmark LIBERO-Mem, ActMem-VLA atteint 80,8 % de réussite moyenne sur les dix tâches, contre 65,2 % pour π0.5 et 49,5 % pour MemoryVLA, pour seulement 3,45 % de paramètres supplémentaires. Sur quatre tâches réelles, le gain moyen sur π0.5 est de 28,8 %. L'article ne précise pas s'il s'agit de points de pourcentage ou d'un gain relatif. L'enjeu est le « perceptual aliasing » : à deux étapes différentes d'une tâche longue, l'observation et l'état du robot peuvent être quasi identiques, alors que l'action correcte diffère. Sans accès à l'historique, la politique hésite ou répète une étape déjà faite. Le résultat compte pour les intégrateurs, car la mémoire est ici un module ajouté à un VLA existant, sans repartir d'un entraînement complet. Un modèle de base validé en production pourrait ainsi gagner en fiabilité sur les séquences longues (assemblage multi-étapes, kitting, tri) pour un surcoût de calcul modeste. Le score de 80,8 % montre aussi qu'il reste près d'une tentative sur cinq en échec. LIBERO-Mem est de plus un benchmark de simulation conçu pour tester la mémoire, et l'évaluation réelle ne porte que sur quatre tâches, sans détail public dans le résumé sur le nombre d'essais. Le travail s'inscrit dans une série de méthodes qui injectent des indices temporels ou de progression dans les VLA, par conditionnement de features, modification de l'a priori d'action ou guidage de l'échantillonnage. MemoryVLA, comparé ici, fait partie de cette famille. Le coût de ces approches, qui entraînent conjointement la mémoire et le VLA de base, motive la séparation choisie par les auteurs entre pilotage conditionné par l'historique et raffinement par la politique figée. Le point de comparaison principal reste π0.5 de Physical Intelligence. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Aucun déploiement industriel ni code n'est mentionné dans le résumé, et les prochaines étapes probables sont une validation sur d'autres bases VLA et sur des tâches réelles plus longues.

RecherchePaper
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
2arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
AURA : une mémoire à déclenchement par action pour les politiques robotiques à VRAM constante
3arXiv cs.RO 

AURA : une mémoire à déclenchement par action pour les politiques robotiques à VRAM constante

Des chercheurs ont publié sur arXiv (référence 2606.02775) une architecture mémoire baptisée AURA-Mem (Action-Utility Recurrent Adaptive Memory), conçue pour réduire drastiquement l'empreinte mémoire des politiques robotiques exécutées sur matériel embarqué. Le principe est simple : envelopper un backbone Vision-Language-Action (VLA) gelé avec une mémoire récurrente de taille fixe, pilotée par une porte apprise qui n'écrit en mémoire que lorsque l'observation courante modifierait l'action suivante. L'état d'inférence reste constant à 4 224 octets, quelle que soit la durée de l'épisode, là où un KV-cache standard atteint 6 061 fois cette taille après 100 000 pas. Sur le benchmark synthétique contrôlé, AURA-Mem produit entre 5,19 et 6,13 fois moins d'écritures que la meilleure baseline O(1), avec un pic à 9,19 fois moins sur les configurations plus faciles. Sur OpenVLA-OFT 7B évalué en boucle fermée sur LIBERO-Long (60 épisodes par bras), le taux de succès reste stable à 0,233, identique à la politique de base non gatée, et légèrement supérieur au bras KV always-write (0,217), tout en divisant par 7 le nombre d'écritures effectives. L'enjeu industriel est direct : les robots mobiles et les manipulateurs déployés en conditions réelles tournent sur hardware edge à mémoire haute bande passante limitée, avec une flash dont l'endurance en écriture est finie. Dans ce régime, c'est l'écriture mémoire, et non la puissance de calcul, qui devient le goulot d'étranglement. AURA-Mem démontre que le signal d'action-surprise, c'est-à-dire écrire uniquement quand l'observation changerait le comportement, est la clé du gain: les plannings d'écriture aléatoires ou périodiques à budget équivalent ne reproduisent pas les mêmes performances, ce qui isole clairement l'apport de la sélectivité apprise. C'est une réponse concrète au problème du déploiement longue durée des VLA sur robots réels, où la gestion de l'état de contexte est souvent traitée par des heuristiques peu robustes. AURA-Mem s'inscrit dans une vague de travaux visant à rendre les grands modèles VLA viables hors datacenter. OpenVLA, développé à Stanford et Embodied Intelligence, est l'un des modèles VLA open-source les plus utilisés en robotique de manipulation; la variante OFT (fine-tuning orienté action) à 7 milliards de paramètres est aujourd'hui un standard de facto pour les évaluations comparatives. La contribution reste pour l'instant une preuve de concept académique: les auteurs signalent eux-mêmes que la borne théorique sur la valeur de l'état d'information approximée est vacuante à cette échelle, et ne constitue pas encore une garantie formelle. Les travaux compétiteurs dans l'espace mémoire des VLA incluent les approches à fenêtre glissante, les mémoires épisodiques par reconstruction, et les architectures Mamba/SSM; AURA-Mem se distingue en ne nécessitant aucune modification du backbone et en ciblant explicitement les contraintes hardware embarquées. Les prochaines étapes naturelles seraient une validation sur robot physique en environnement non contrôlé et une intégration dans des pipelines de déploiement industriels, deux points absents de l'article actuel.

RechercheOpinion
1 source
Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon
4arXiv cs.RO 

Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon

Des chercheurs ont soumis le 16 juin 2026 sur arXiv (2606.16178) une architecture transformer nommée PRISM, conçue pour doter les politiques visuomotrices entraînées par imitation learning d'une mémoire à court terme effective. Le système combine deux mécanismes : une attention filtrée (gated attention) qui supprime les corrélations parasites entre l'historique sensoriel et la prédiction d'action, et une architecture hiérarchique qui compresse les informations locales en tokens compacts pour capturer des dépendances temporelles étendues. PRISM maintient ainsi une mémoire opérationnelle sur environ deux minutes. Ses performances : 5 à 12 % de gains absolus sur les baselines les plus solides, et 11 à 15 % de mieux que sa variante sans mémoire sur RoboCasa et LIBERO, dépassant des modèles VLA fine-tunés comme GR00T-N1-3B (NVIDIA) et OpenVLA, sans aucun pré-entraînement à grande échelle. Les auteurs publient aussi ReMemBench, un benchmark de huit tâches de manipulation domestique couvrant quatre catégories mémorielles. La quasi-totalité des politiques visuomotrices actuelles n'exploitent que l'entrée sensorielle instantanée, les rendant incapables de gérer des tâches impliquant des objets temporairement occultés ou des actions à déclencher après un délai défini. PRISM démontre qu'une architecture mémoire soigneusement conçue peut surpasser des VLA massivement pré-entraînés, remettant en question l'hypothèse dominante selon laquelle la taille du corpus de pré-entraînement prime sur les choix architecturaux. Pour les intégrateurs et les décideurs industriels, ce résultat ouvre la voie à des politiques de manipulation longue séquence plus accessibles en calcul. PRISM s'inscrit dans un débat actif entre approches récurrentes (LSTM, Mamba) et architectures transformer pour les politiques de manipulation robotique. Les benchmarks RoboCasa et LIBERO font référence en simulation pour ce type de tâches, et des modèles comme GR00T-N1 de NVIDIA (3B paramètres) ou OpenVLA ont misé sur un pré-entraînement multimodal massif pour y performer. PRISM se positionne comme une alternative architecturale plus légère et sans pré-entraînement. Il faut toutefois souligner que tous les résultats sont obtenus en simulation : aucun transfert sim-to-real ni déploiement physique n'est annoncé, laissant ouverte la question de la robustesse sur robot réel.

RechercheOpinion
1 source