Aller au contenu principal
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
RecherchearXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement.

L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives.

Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

À lire aussi

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon
1arXiv cs.RO 

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon

Un article de recherche publie sur arXiv le 18 aout 2026 (référence 2608.14986v1) présente GaussMemory, un système de mémoire spatiale pour la manipulation robotique a long horizon, construit sur le 3D Gaussian Splatting comme substrat géométrique persistant. A la différence des mémoires 3D existantes, qui enregistrent les observations selon des règles fixes en traitant chaque élément de la scene avec la même importance, GaussMemory apprend de bout en bout quels objets suivre précisément, a quelle fréquence les mettre a jour et quoi oublier. Sur les bancs d'essai LIBERO et VLABench, il depasse le système MemoryVLA sur les taches Goal et Long-10, et surpasse le modèle π0-FAST de 5,2 points sur la piste 1 et de 6,0 points sur la piste 6. Le problème vise est bien connu du secteur: les architectures vision-langage-action mémorisent généralement l'environnement de façon passive, sans distinguer ce qui compte pour la tache en cours, ce qui dégradé les performances des que les séquences de manipulation s'allongent. En unifiant mise a jour et lecture de la mémoire dans un seul mécanisme appris plutôt que des heuristiques écrites a la main, GaussMemory s'inscrit dans une tendance de fond visant a faire passer les VLA de démonstrations courtes en laboratoire vers des taches multi-étapes plus proches des besoins industriels réels. Pour les intégrateurs qui évaluent des piles VLA, des gains chiffres sur des benchmarks standardises comme LIBERO et VLABench offrent un point de comparaison plus solide qu'une simple vidéo de démonstration. Le travail se positionne explicitement face a deux références du domaine, MemoryVLA et π0-FAST, ce dernier dérivé du modèle π0 de Physical Intelligence, citées comme bases de comparaison directes plutôt que comme simples antécédents. Il s'inscrit dans la lignée des travaux sur le 3D Gaussian Splatting, technique de représentation de scènes issue de la vision par ordinateur, de plus en plus réutilisée comme mémoire de travail pour des agents robotiques. A ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation, sans déploiement matériel annonce ni partenaire industriel cite, et sans calendrier donne pour un transfert vers des robots physiques, ce qui distingue clairement cette contribution d'une annonce produit ou d'un pilote commercial.

RechercheActu
1 source
MIKASA-Robo-VLA : évaluer la mémoire des modèles vision-langage-action (VLA) pour la manipulation à long horizon
2arXiv cs.RO 

MIKASA-Robo-VLA : évaluer la mémoire des modèles vision-langage-action (VLA) pour la manipulation à long horizon

MIKASA-Robo-VLA, un nouveau benchmark publié sur arXiv (v1, octobre 2026), propose 90 tâches de manipulation conditionnées par le langage pour mesurer comment les politiques vision-langage-action (VLA) exploitent une information qui disparaît en cours de tâche. Dans 80 d'entre elles, l'indice dont dépend l'action est masqué ; les 10 restantes sont des contrôles réactifs où il reste visible. Chaque tâche fournit une instruction textuelle, alors que la suite d'origine, MIKASA-Robo (32 tâches), n'utilisait le langage que sur un sous-ensemble représentatif. Pour 70 tâches, les temps de phase de l'environnement définissent un « écart d'information », et dans 28 cas il dépasse la fenêtre de 16 images du VLA à contexte fixe le plus large recensé par les auteurs. Les chercheurs publient 22 500 trajectoires oracle couvrant 10 types de mémoire, aux formats RLDS et LeRobotDataset v3. Une baseline de référence π0.5, avec images courantes et proprioception mais sans historique d'observations ni module de mémoire explicite, est affinée sur 14 tâches et atteint 0,211 ± 0,044 de succès moyen. L'intérêt tient à un angle mort de l'évaluation actuelle. La plupart des VLA ne voient que une ou quelques images récentes, et les benchmarks courants récompensent surtout des comportements réactifs, ce qui peut masquer l'absence totale de mémoire. En distinguant tâches à mémoire et contrôles réactifs, le benchmark permet d'isoler cette faiblesse plutôt que de la confondre avec un défaut de perception ou de contrôle. Pour les intégrateurs et décideurs B2B, c'est un rappel que les démonstrations de manipulation longue durée (assemblage multi-étapes, tri avec conditions cachées, reprise après occlusion) ne disent pas grand-chose de la capacité d'un modèle à retenir ce qu'il ne voit plus. Le score de 0,211 est toutefois à lire avec prudence : il ne porte que sur 14 tâches, et les auteurs reconnaissent eux-mêmes que le moindre succès sur les tâches de la catégorie Long est brouillé par le « chunking » en boucle ouverte et par la composition des types de mémoire de ce sous-ensemble. Il ne prouve donc pas, à lui seul, que la mémoire explique l'écart. Ce travail prolonge la lignée MIKASA-Robo, centrée sur la mémoire en manipulation, et s'inscrit dans le mouvement de standardisation des données robotiques autour de RLDS et de LeRobot, l'écosystème porté notamment par Hugging Face, avec une compatibilité v3 qui facilite la réutilisation. π0.5, de Physical Intelligence, sert de référence, mais aucun résultat n'est publié pour des architectures dotées d'historique ou de mémoire explicite, qui seraient les comparaisons naturelles. La suite logique, que le papier laisse ouverte, serait d'évaluer ces variantes sur l'ensemble des 90 tâches. Le jeu de données et la page du projet sont déjà disponibles, ce qui permet à d'autres laboratoires de tester leurs propres modèles. Il s'agit d'un benchmark de simulation, sans déploiement industriel associé.

RecherchePaper
1 source
HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique
3arXiv cs.RO 

HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique

Une équipe de recherche a déposé sur arXiv (2606.10363v1) HiMem-WAM, un nouveau modèle d'action hiérarchique pour la manipulation robotique. L'architecture s'attaque à une limitation persistante des World Action Models (WAM) existants : leur incapacité à maintenir une mémoire de tâche cohérente sur des séquences longues, typiques des manipulations multi-étapes. HiMem-WAM combine trois mécanismes : des actions latentes centrées sur le mouvement (niveau bas), des latents de compétences de haut niveau, et une porte mémoire déclenchée aux transitions de compétences prédites. Ce verrou mémoire écrit des états compacts à des moments-clés, permettant l'inférence causale sans génération vidéo ni estimation de flux optique au moment du test. Le modèle a été évalué sur les benchmarks LIBERO, LIBERO-PLUS et RMBench, ainsi que sur des tâches en conditions réelles. La contribution principale est d'ordre systémique : la structuration hiérarchique améliore la robustesse sous perturbations lors du déploiement, là où la plupart des architectures VLA actuelles échouent dès qu'un événement imprévu survient en milieu de séquence. Pour un décideur industriel, c'est un signal pertinent : le module mémoire apporte, selon les auteurs, un gain substantiel sur les tâches longues dépendantes de l'historique d'action. Éviter la génération vidéo en temps d'inférence réduit également la latence et la charge computationnelle, deux freins réels au déploiement embarqué. Ces résultats restent toutefois issus d'un preprint non peer-reviewed, et les performances sur benchmarks standardisés ne garantissent pas les mêmes gains en environnement de production non contrôlé. Les World Action Models constituent un paradigme récent qui apprend les dynamiques visuelles pertinentes pour l'action, distinct des architectures VLA classiques comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, lesquelles s'appuient sur des transformers multimodaux de grande taille. La manipulation longue-horizon reste un défi ouvert pour l'ensemble du secteur : ni les diffusion-policies ni les modèles language-conditioned n'ont résolu le maintien du contexte sur des séquences dépassant une dizaine de sous-tâches. HiMem-WAM propose une piste architecturale concrète, mais sans intégration hardware annoncée ni timeline de déploiement, ce qui en fait pour l'instant une contribution de recherche fondamentale.

RechercheOpinion
1 source
SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
4arXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever. Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production. SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

RecherchePaper
1 source