Aller au contenu principal
Se souvenir intelligemment : compresseur d'historique visuel et espace d'expérience hyperbolique pour la mémoire robotique
RecherchearXiv cs.RO 

Se souvenir intelligemment : compresseur d'historique visuel et espace d'expérience hyperbolique pour la mémoire robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en août 2026 sur arXiv (référence 2608.15269) un module nommé Remember Smarter (RS), une brique plug-and-play qui donne aux politiques robotiques vision-langage-action (VLA) une mémoire compacte pour les tâches longues sans agrandir leur fenêtre de contexte. Sa branche visuelle compresse l'historique de patches multi-vues via des réseaux Mamba spatial et temporel, puis l'injecte par cross-attention résiduelle dans les états cachés liés à l'action, sans toucher au flux de tokens visuels du modèle vision-langage. Sa branche "expérience" stocke dans un espace hyperbolique de Poincaré les états du VLM issus des épisodes réussis, les organise hiérarchiquement et les réinjecte en tokens de prompt géodésiques de manière asynchrone, sans ralentir l'inférence. Appliqué au modèle Pi-0, RS fait passer le taux de réussite total sur le benchmark LIBERO-Plus de 53,6% à 70,6%, avec des gains également rapportés lors d'expériences complémentaires sur robot réel.

Ce résultat cible un goulot d'étranglement connu des VLA à grande échelle : allonger l'horizon d'une tâche oblige souvent à choisir entre oublier le contexte récent, au prix de la précision, ou étendre la fenêtre de contexte, au prix du calcul et de la latence. En séparant une mémoire courte réutilisable d'une mémoire longue d'expérience, sans alourdir le flux principal du modèle vision-langage, RS vise un gain de fiabilité sans surcoût d'inférence, un compromis clé pour qui cherche à déployer des VLA à cadence élevée sur du matériel embarqué. Le saut de près de 17 points sur LIBERO-Plus, un benchmark conçu pour stresser la généralisation des politiques robotiques, suggère que la mémoire à long terme reste un frein réel à la fiabilité des VLA plutôt qu'un simple détail d'ingénierie, même si ces résultats restent pour l'instant valides en simulation et sur un nombre limité d'essais en robot réel, sans déploiement industriel annoncé.

Ce travail s'inscrit dans une vague de recherches visant à doter les VLA d'une mémoire structurée, alors que des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI ont déjà prouvé la viabilité de l'architecture vision-langage-action tout en butant sur les tâches longues et répétitives typiques de l'usine ou de l'entrepôt. Le recours aux réseaux Mamba, une architecture séquentielle moins coûteuse que les transformers sur le temporel long, et à un espace hyperbolique de Poincaré pour organiser l'expérience passée, reflète des tendances récentes en représentation hiérarchique. Le choix de Pi-0 comme base d'évaluation positionne RS comme un module complémentaire plutôt que concurrent des grands modèles de fondation robotique existants. À ce stade, il s'agit d'une publication de recherche et non d'un produit livré ni d'un pilote industriel : aucune feuille de route commerciale ni partenariat avec un fabricant de robots n'est mentionné.

À lire aussi

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon
1arXiv cs.RO 

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon

Des chercheurs proposent ActMem-VLA, une architecture qui ajoute une mémoire de l'historique des actions à un modèle vision-langage-action (VLA) déjà entraîné, sans le ré-entraîner. Le système greffe sur une politique de base figée (fine-tunée puis gelée) un plugin composé d'un module mémoire basé sur Mamba, un modèle à espace d'états, et d'un expert léger baptisé PreAction Expert (PAE). Mamba encode les actions déjà exécutées, et cette mémoire conditionne le PAE avec le contexte courant. Pendant les premières étapes de débruitage, à fort bruit, le PAE oriente la progression de la tâche. Il transmet ensuite l'action partiellement débruitée à l'Action Expert (AE) figé, qui affine les détails sur les étapes restantes à faible bruit. Seuls Mamba et le PAE sont optimisés. Sur le benchmark LIBERO-Mem, ActMem-VLA atteint 80,8 % de réussite moyenne sur les dix tâches, contre 65,2 % pour π0.5 et 49,5 % pour MemoryVLA, pour seulement 3,45 % de paramètres supplémentaires. Sur quatre tâches réelles, le gain moyen sur π0.5 est de 28,8 %. L'article ne précise pas s'il s'agit de points de pourcentage ou d'un gain relatif. L'enjeu est le « perceptual aliasing » : à deux étapes différentes d'une tâche longue, l'observation et l'état du robot peuvent être quasi identiques, alors que l'action correcte diffère. Sans accès à l'historique, la politique hésite ou répète une étape déjà faite. Le résultat compte pour les intégrateurs, car la mémoire est ici un module ajouté à un VLA existant, sans repartir d'un entraînement complet. Un modèle de base validé en production pourrait ainsi gagner en fiabilité sur les séquences longues (assemblage multi-étapes, kitting, tri) pour un surcoût de calcul modeste. Le score de 80,8 % montre aussi qu'il reste près d'une tentative sur cinq en échec. LIBERO-Mem est de plus un benchmark de simulation conçu pour tester la mémoire, et l'évaluation réelle ne porte que sur quatre tâches, sans détail public dans le résumé sur le nombre d'essais. Le travail s'inscrit dans une série de méthodes qui injectent des indices temporels ou de progression dans les VLA, par conditionnement de features, modification de l'a priori d'action ou guidage de l'échantillonnage. MemoryVLA, comparé ici, fait partie de cette famille. Le coût de ces approches, qui entraînent conjointement la mémoire et le VLA de base, motive la séparation choisie par les auteurs entre pilotage conditionné par l'historique et raffinement par la politique figée. Le point de comparaison principal reste π0.5 de Physical Intelligence. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Aucun déploiement industriel ni code n'est mentionné dans le résumé, et les prochaines étapes probables sont une validation sur d'autres bases VLA et sur des tâches réelles plus longues.

RecherchePaper
1 source
HyperDCM : rejeu dynamique de mémoire par clusters en espace hyperbolique pour la navigation robotique continue à travers différentes scènes
2arXiv cs.RO 

HyperDCM : rejeu dynamique de mémoire par clusters en espace hyperbolique pour la navigation robotique continue à travers différentes scènes

Des chercheurs proposent HyperDCM (Hyperbolic Dynamic Cluster Memory), un mécanisme de mémoire destiné à la navigation robotique en apprentissage continu, décrit dans une prépublication arXiv (2607.16267v1) parue fin juillet 2026. Le système s'attache à résoudre l'oubli catastrophique, ce phénomène par lequel un robot perd sa capacité à naviguer dans des environnements déjà appris lorsqu'il en découvre de nouveaux. HyperDCM combine plusieurs briques : des modèles de vision-langage extraient des triplets sémantiques (objets, relations spatiales) à partir d'images RGB, un réseau de convolution sur graphes relationnels (R-GCN) encode ces scènes sous forme de graphes, puis ces représentations sont projetées dans un espace hyperbolique plutôt qu'euclidien pour mieux préserver la structure hiérarchique des scènes. Une stratégie de clustering dynamique sélectionne ensuite les exemples les plus représentatifs à rejouer en mémoire, plutôt que de stocker l'ensemble des trajectoires passées. Le tout s'intègre à des politiques de navigation par diffusion, testées sur des jeux de données multi-scènes en intérieur et en extérieur, où HyperDCM affiche une meilleure rétention des compétences acquises et une meilleure généralisation que les méthodes de continual learning de référence adaptées à ce cadre. Pour l'industrie robotique, ce type de travail répond à un vrai point de friction commercial : un robot mobile ou humanoïde déployé sur plusieurs sites clients doit s'adapter à chaque nouvel entrepôt ou bâtiment sans effacer ses acquis précédents, faute de quoi chaque déploiement nécessite un réentraînement coûteux. Une mémoire structurée et compacte, capable de conserver l'essentiel sans stocker toutes les données brutes, va dans le sens d'une navigation véritablement continue et scalable, un prérequis pour les flottes d'AMR ou de robots humanoïdes opérant chez plusieurs intégrateurs. Le travail s'inscrit dans la lignée des recherches sur les politiques de diffusion appliquées à la navigation et sur l'apprentissage continu en robotique, un domaine où la plupart des méthodes existantes proviennent de la vision par ordinateur classique et s'adaptent mal aux contraintes spatiales de la navigation. À ce stade, HyperDCM reste un résultat de recherche validé sur benchmarks académiques, sans annonce de déploiement industriel ni de partenariat commercial ; la suite logique serait une validation sur des plateformes robotiques réelles et une comparaison directe avec les architectures de mémoire utilisées par les grands modèles VLA du secteur.

RecherchePaper
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
3arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source
HIRE : raisonnement d'interaction historique et exécution rapide pour manipulation précise malgré l'ambiguïté visuelle
4arXiv cs.RO 

HIRE : raisonnement d'interaction historique et exécution rapide pour manipulation précise malgré l'ambiguïté visuelle

Une équipe de recherche a publié le 28 septembre 2026 sur arXiv (2609.30828v1) un nouveau système baptisé HIRE, pour "History-Conditioned Interaction Reasoning and High-Rate Execution", conçu pour la manipulation robotique de précision dans des tâches à contact critique comme l'insertion, le vissage ou les interactions rotatives. L'architecture combine deux modules à fréquences différentes : un raisonneur d'état d'interaction (ISR) qui encode l'historique de forces et de couples (wrench) via un "Force Perceiver" pour lever l'ambiguïté entre observations visuellement identiques mais correspondant à des états physiques différents, et un exécuteur haute fréquence (IME) qui décompose le mouvement en progression intrinsèque et correction transversale pour un contrôle fin du contact. Sur des expériences robot réel couvrant des interactions de surface, d'insertion et de rotation, HIRE atteint au moins 90% de taux de complétion sur l'ensemble des étapes de tâches évaluées, avec une meilleure désambiguïsation des états d'interaction et une meilleure généralisation. Le code source sera publié ultérieurement, lors de la publication définitive de l'article : il ne s'agit donc pour l'instant que d'un préprint de recherche, non reproductible en l'état. L'intérêt pour l'industrie tient au problème précis que le papier cible : les politiques vision-langage-action (VLA) et les approches purement visuelles échouent quand deux scènes qui se ressemblent nécessitent des actions différentes selon un état caché, un cas fréquent en assemblage industriel et insertion de connecteurs. En couplant mémoire de force longue durée et boucle réactive rapide dans une architecture "cross-rate", HIRE propose une piste concrète pour des tâches d'assemblage fin où les manipulateurs équipés de capteurs force-couple restent aujourd'hui peu fiables face à l'aliasing visuel. Le chiffre de 90% mérite toutefois d'être relativisé : il provient d'essais en laboratoire sur robot unique, sans indication du nombre d'essais ni de comparaison chiffrée avec des bases de référence dans le résumé, ce qui est typique d'un stade préliminaire de recherche plutôt que d'une validation à l'échelle industrielle. Le travail s'inscrit dans la lignée des méthodes "force-aware" et à mémoire augmentée d'un côté, et des politiques réactives haute fréquence de l'autre, deux familles jusqu'ici traitées séparément dans la littérature sur la manipulation robotique. Aucun partenaire industriel, site de déploiement ni calendrier de commercialisation n'est mentionné : il s'agit d'une contribution académique dont la prochaine étape annoncée est la publication complète, accompagnée de la mise à disposition du code.

RecherchePaper
1 source