Aller au contenu principal
DRAM : mémoire associative récurrente à règle delta pour les politiques de manipulation robotique
RecherchearXiv cs.RO 

DRAM : mémoire associative récurrente à règle delta pour les politiques de manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent DRAM (Delta-rule Recurrent Associative Memory), un module de mémoire enfichable destiné aux politiques de manipulation robotique pré-entraînées. Décrit dans un preprint arXiv (2609.32453, version 2), il s'attache à un large éventail de politiques existantes et leur confère une mémoire longue durée sans modifier leur architecture ni réentraîner le backbone. Seuls le module de mémoire et l'action expert, la tête qui produit les actions, subissent un post-entraînement propre à la tâche. Le module maintient une mémoire associative de taille fixe, fondée sur une attention linéaire à règle delta avec porte (gated delta-rule). Sa mise à jour est modifiée pour intégrer en parallèle tous les tokens de chaque image. Un mécanisme de lecture indépendant de l'architecture injecte ensuite le contexte historique dans la prédiction d'action, quelle que soit la politique hôte. Les auteurs annoncent que DRAM améliore de façon constante des politiques gelées par rapport aux références à contexte court et à d'autres conceptions de mémoire compacte. Le résumé ne donne aucun chiffre, ni taux de réussite, ni nombre de tâches, ni liste des politiques testées.

L'enjeu est pratique. La manipulation dépend de l'historique : savoir quelles étapes d'une tâche sont faites, où un objet a été rangé ou si une tentative a échoué. Or la plupart des politiques pré-entraînées, notamment les VLA (vision-language-action), ne voient que l'observation courante ou une courte fenêtre temporelle. Les deux remèdes actuels ont un coût. Empiler plusieurs images dans le backbone fait grimper le coût d'inférence, un problème pour le contrôle temps réel sur du matériel embarqué. S'appuyer sur des caractéristiques sémantiques prédéfinies limite la généralité et peut imposer de réentraîner le backbone. Une mémoire de taille fixe garde un coût d'inférence constant quelle que soit la durée de la tâche. Le fait que le backbone reste gelé compte aussi pour les intégrateurs : on pourrait ajouter de la mémoire à un modèle de fondation déjà validé sans relancer un entraînement lourd. Il s'agit toutefois d'une preuve de concept académique. Rien n'indique à ce stade une validation sur robot réel, des tâches longues en conditions industrielles ou des mesures de latence.

Cette approche s'inscrit dans le courant qui importe en robotique les modèles récurrents efficaces issus du langage : attention linéaire, règle delta, mémoires d'état de taille fixe, alternatives aux Transformers à contexte croissant. Elle répond à une limite reconnue des VLA généralistes actuels, souvent sans état ou à mémoire très courte. Les auteurs la comparent à d'autres mémoires compactes, mais le résumé ne nomme pas les concurrents. La suite logique serait des évaluations sur plusieurs familles de politiques, avec des tâches réelles à longue échéance et un chiffrage du surcoût de calcul, seuls éléments qui permettront de juger si la mémoire post-hoc tient ses promesses hors du laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
1arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
MemBodied : mémoire associative récurrente pour modèles vision-langage-action
2arXiv cs.RO 

MemBodied : mémoire associative récurrente pour modèles vision-langage-action

Un modèle appelé MemBodied introduit une mémoire épisodique de taille fixe pour les modèles Vision-Language-Action (VLA), détaillée dans un article arXiv (2609.28256v1) publié en septembre 2026. Le système repose sur deux composants complémentaires: un état associatif qui enregistre les interactions au fil des appels successifs de la politique, et une ancre d'épisode qui conserve une représentation compacte de la scène initiale comme référence. Sur cinq tâches du benchmark RMBench conçues pour nécessiter de la mémoire, MemBodied atteint un taux de succès moyen 7,81 fois supérieur à celui d'une politique sans état (stateless) et 2,98 fois supérieur à une mémoire récurrente classique, tout en dépassant la meilleure référence à mémoire augmentée de 1,3 fois avec dix fois moins de paramètres ajoutés. Sur la suite LIBERO-Long, entièrement observable, il atteint 90,6% de réussite, soit une amélioration de 5,4 points par rapport à la politique stateless Pi-0. Le problème que cible ce travail est central pour l'industrie robotique: la majorité des politiques VLA déployées aujourd'hui ne conservent aucune information au-delà de l'observation en cours, ce qui les rend incapables de gérer des tâches de manipulation dépendantes de l'historique, par exemple retrouver un objet déplacé hors champ ou se souvenir qu'une étape a déjà été exécutée. La solution habituelle, garder l'historique complet dans le contexte du modèle, fait gonfler la latence d'inférence et le coût de calcul, un frein direct pour des cas d'usage industriels en temps réel. En proposant une mémoire à empreinte constante plutôt qu'un contexte qui s'étend indéfiniment, MemBodied répond à une limite concrète des architectures VLA à grande échelle (Pi-0, GR00T N2, Helix) qui excellent sur des tâches courtes mais peinent sur des séquences longues nécessitant du raisonnement temporel. Les VLA se sont imposés comme paradigme dominant du contrôle robotique généraliste ces dernières années, portés par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. MemBodied se positionne comme une alternative légère à l'extension de contexte, comparée aux politiques sans état, à la mémoire récurrente standard et aux meilleures approches de mémoire augmentée existantes. Il s'agit à ce stade d'un résultat de recherche mesuré sur des benchmarks (RMBench, LIBERO-Long), sans annonce de déploiement industriel ni de partenariat commercial.

RechercheActu
1 source
HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique
3arXiv cs.RO 

HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique

Une équipe de recherche a déposé sur arXiv (2606.10363v1) HiMem-WAM, un nouveau modèle d'action hiérarchique pour la manipulation robotique. L'architecture s'attaque à une limitation persistante des World Action Models (WAM) existants : leur incapacité à maintenir une mémoire de tâche cohérente sur des séquences longues, typiques des manipulations multi-étapes. HiMem-WAM combine trois mécanismes : des actions latentes centrées sur le mouvement (niveau bas), des latents de compétences de haut niveau, et une porte mémoire déclenchée aux transitions de compétences prédites. Ce verrou mémoire écrit des états compacts à des moments-clés, permettant l'inférence causale sans génération vidéo ni estimation de flux optique au moment du test. Le modèle a été évalué sur les benchmarks LIBERO, LIBERO-PLUS et RMBench, ainsi que sur des tâches en conditions réelles. La contribution principale est d'ordre systémique : la structuration hiérarchique améliore la robustesse sous perturbations lors du déploiement, là où la plupart des architectures VLA actuelles échouent dès qu'un événement imprévu survient en milieu de séquence. Pour un décideur industriel, c'est un signal pertinent : le module mémoire apporte, selon les auteurs, un gain substantiel sur les tâches longues dépendantes de l'historique d'action. Éviter la génération vidéo en temps d'inférence réduit également la latence et la charge computationnelle, deux freins réels au déploiement embarqué. Ces résultats restent toutefois issus d'un preprint non peer-reviewed, et les performances sur benchmarks standardisés ne garantissent pas les mêmes gains en environnement de production non contrôlé. Les World Action Models constituent un paradigme récent qui apprend les dynamiques visuelles pertinentes pour l'action, distinct des architectures VLA classiques comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, lesquelles s'appuient sur des transformers multimodaux de grande taille. La manipulation longue-horizon reste un défi ouvert pour l'ensemble du secteur : ni les diffusion-policies ni les modèles language-conditioned n'ont résolu le maintien du contexte sur des séquences dépassant une dizaine de sous-tâches. HiMem-WAM propose une piste architecturale concrète, mais sans intégration hardware annoncée ni timeline de déploiement, ce qui en fait pour l'instant une contribution de recherche fondamentale.

RechercheOpinion
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
4arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source