Se souvenir intelligemment : compresseur d'historique visuel et espace d'expérience hyperbolique pour la mémoire robotique
Des chercheurs ont publié en août 2026 sur arXiv (référence 2608.15269) un module nommé Remember Smarter (RS), une brique plug-and-play qui donne aux politiques robotiques vision-langage-action (VLA) une mémoire compacte pour les tâches longues sans agrandir leur fenêtre de contexte. Sa branche visuelle compresse l'historique de patches multi-vues via des réseaux Mamba spatial et temporel, puis l'injecte par cross-attention résiduelle dans les états cachés liés à l'action, sans toucher au flux de tokens visuels du modèle vision-langage. Sa branche "expérience" stocke dans un espace hyperbolique de Poincaré les états du VLM issus des épisodes réussis, les organise hiérarchiquement et les réinjecte en tokens de prompt géodésiques de manière asynchrone, sans ralentir l'inférence. Appliqué au modèle Pi-0, RS fait passer le taux de réussite total sur le benchmark LIBERO-Plus de 53,6% à 70,6%, avec des gains également rapportés lors d'expériences complémentaires sur robot réel.
Ce résultat cible un goulot d'étranglement connu des VLA à grande échelle : allonger l'horizon d'une tâche oblige souvent à choisir entre oublier le contexte récent, au prix de la précision, ou étendre la fenêtre de contexte, au prix du calcul et de la latence. En séparant une mémoire courte réutilisable d'une mémoire longue d'expérience, sans alourdir le flux principal du modèle vision-langage, RS vise un gain de fiabilité sans surcoût d'inférence, un compromis clé pour qui cherche à déployer des VLA à cadence élevée sur du matériel embarqué. Le saut de près de 17 points sur LIBERO-Plus, un benchmark conçu pour stresser la généralisation des politiques robotiques, suggère que la mémoire à long terme reste un frein réel à la fiabilité des VLA plutôt qu'un simple détail d'ingénierie, même si ces résultats restent pour l'instant valides en simulation et sur un nombre limité d'essais en robot réel, sans déploiement industriel annoncé.
Ce travail s'inscrit dans une vague de recherches visant à doter les VLA d'une mémoire structurée, alors que des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI ont déjà prouvé la viabilité de l'architecture vision-langage-action tout en butant sur les tâches longues et répétitives typiques de l'usine ou de l'entrepôt. Le recours aux réseaux Mamba, une architecture séquentielle moins coûteuse que les transformers sur le temporel long, et à un espace hyperbolique de Poincaré pour organiser l'expérience passée, reflète des tendances récentes en représentation hiérarchique. Le choix de Pi-0 comme base d'évaluation positionne RS comme un module complémentaire plutôt que concurrent des grands modèles de fondation robotique existants. À ce stade, il s'agit d'une publication de recherche et non d'un produit livré ni d'un pilote industriel : aucune feuille de route commerciale ni partenariat avec un fabricant de robots n'est mentionné.
Dans nos dossiers




