Aller au contenu principal
WeaveLA : mémoire latente inter-sous-tâches pilotée par événements pour la manipulation robotique répétitive
RecherchearXiv cs.RO 

WeaveLA : mémoire latente inter-sous-tâches pilotée par événements pour la manipulation robotique répétitive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié WeaveLA (Weave Latent Memory for Vision-Language-Action Policies) sur arXiv (identifiant 2606.17463v1), un module de mémoire inter-sous-tâches qui se greffe sur un backbone VLA gelé, en l'occurrence π₀.₅ de Physical Intelligence, sans modifier ses poids. À chaque franchissement d'un sous-objectif, WeaveLA compresse le segment d'actions accompli en tokens latents via attention pooling guidé par requêtes, puis injecte ces tokens dans le chemin de génération d'actions du sous-objectif suivant. Évalué sur le benchmark RoboMME, le résultat le plus saillant porte sur la tranche "SwingXtimes" à N=3 répétitions : le taux de succès passe de 0 % à 47,8 %, tandis que les épisodes à exécution unique restent inchangés, confirmant que les gains sont strictement confinés aux tâches causalement dépendantes entre sous-objectifs.

Ce résultat pointe une limite structurelle précise des VLA à fenêtre courte : l'absence d'un canal explicite pour propager l'état entre sous-tâches. Les architectures actuelles, qu'il s'agisse de π₀, OpenVLA ou des variantes à mémoire existantes, gèrent bien la manipulation pas-à-pas, mais peinent dès que la réussite d'une étape conditionne la suivante. WeaveLA montre qu'un module léger, déclenché uniquement sur les événements de complétion de sous-objectifs, suffit à corriger cette fragilité sans régression sur les tâches simples. C'est un signal favorable pour les intégrateurs industriels qui cherchent à déployer des politiques génériques sur des workflows multi-étapes sans réentraîner l'intégralité du modèle.

Le backbone π₀.₅ utilisé est celui de Physical Intelligence, startup fondée à San Francisco en 2023 et ayant levé environ 400 millions de dollars, devenue référence de facto en manipulation généraliste. WeaveLA s'inscrit dans un courant visant à augmenter les VLA par des modules de mémoire externe plutôt que de les remplacer, une direction concurrente aux travaux de Google DeepMind (RT-2, RT-X), NVIDIA (GR00T N2) et Figure AI (Helix). Étant un preprint non relu par les pairs, le travail ne s'accompagne d'aucun calendrier de déploiement ni de partenariat annoncé, et ses résultats, obtenus en environnement simulé, restent à valider sur des plateformes réelles.

À lire aussi

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon
1arXiv cs.RO 

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon

Un article de recherche publie sur arXiv le 18 aout 2026 (référence 2608.14986v1) présente GaussMemory, un système de mémoire spatiale pour la manipulation robotique a long horizon, construit sur le 3D Gaussian Splatting comme substrat géométrique persistant. A la différence des mémoires 3D existantes, qui enregistrent les observations selon des règles fixes en traitant chaque élément de la scene avec la même importance, GaussMemory apprend de bout en bout quels objets suivre précisément, a quelle fréquence les mettre a jour et quoi oublier. Sur les bancs d'essai LIBERO et VLABench, il depasse le système MemoryVLA sur les taches Goal et Long-10, et surpasse le modèle π0-FAST de 5,2 points sur la piste 1 et de 6,0 points sur la piste 6. Le problème vise est bien connu du secteur: les architectures vision-langage-action mémorisent généralement l'environnement de façon passive, sans distinguer ce qui compte pour la tache en cours, ce qui dégradé les performances des que les séquences de manipulation s'allongent. En unifiant mise a jour et lecture de la mémoire dans un seul mécanisme appris plutôt que des heuristiques écrites a la main, GaussMemory s'inscrit dans une tendance de fond visant a faire passer les VLA de démonstrations courtes en laboratoire vers des taches multi-étapes plus proches des besoins industriels réels. Pour les intégrateurs qui évaluent des piles VLA, des gains chiffres sur des benchmarks standardises comme LIBERO et VLABench offrent un point de comparaison plus solide qu'une simple vidéo de démonstration. Le travail se positionne explicitement face a deux références du domaine, MemoryVLA et π0-FAST, ce dernier dérivé du modèle π0 de Physical Intelligence, citées comme bases de comparaison directes plutôt que comme simples antécédents. Il s'inscrit dans la lignée des travaux sur le 3D Gaussian Splatting, technique de représentation de scènes issue de la vision par ordinateur, de plus en plus réutilisée comme mémoire de travail pour des agents robotiques. A ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation, sans déploiement matériel annonce ni partenaire industriel cite, et sans calendrier donne pour un transfert vers des robots physiques, ce qui distingue clairement cette contribution d'une annonce produit ou d'un pilote commercial.

RechercheActu
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
2arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
Ne lâchez pas BATON : manipulation robotique étendue, sous-tâches exploratoires à base d'agents, mémoire des transitions
3arXiv cs.RO 

Ne lâchez pas BATON : manipulation robotique étendue, sous-tâches exploratoires à base d'agents, mémoire des transitions

Des chercheurs publient sur arXiv (arXiv:2608.16889v1) une méthode nommée BATON pour la manipulation robotique "long-horizon", ces taches multi-étapes qui enchainent plusieurs compétences a contact physique. Le problème identifie: les modèles vision-langage-action (VLA) maitrisent de mieux en mieux des compétences isolées, mais les erreurs s'accumulent quand on les chaine, et une approche existante qui fige le VLA et confie la planification a un agent LLM voit son cout d'exploration exploser en T^K épisodes pour K étapes, sans pouvoir dire a quelle étape imputer un échec. BATON explore chaque sous-tache séparément en régime court, stocke sa solution en mémoire, puis compose la trajectoire complète a partir de ces briques, ramenant le cout a une forme additive T*K et permettant d'attribuer chaque échec a une étape précise. Un agent vérificateur contrôle via la camera de poignet le moment d'invoquer le VLA, tandis que des transitions de passation et d'anticipation assurent la cohérence entre sous-taches, sans aucune mise a jour de paramètres. Sur le benchmark RoboMemArena, BATON améliore le taux de réussite des taches de 11,6% et le taux de réussite cumulée de 14,9% par rapport a l'état de l'art. Ce résultat cible le problème qui freine le déploiement industriel des robots manipulateurs sur des taches réelles: réussir des compétences isolées ne garantit pas la réussite d'une chaine complète, le fosse classique entre démonstration et déploiement effectif. En rendant le cout d'exploration additif plutôt que multiplicatif, BATON rend potentiellement viable l'apprentissage autonome de séquences longues sans explosion du nombre d'essais nécessaires, un frein pratique pour qui cherche a automatiser des taches d'assemblage ou de logistique complexes. L'approche souligne surtout que la gestion des transitions entre étapes, et non la seule qualité du VLA, reste souvent l'angle mort des annonces commerciales, qui privilégient des vidéos sélectionnées a des taux de réussite mesures sur benchmark reproductible. Le travail prolonge les architectures combinant un VLA fige et un agent LLM planificateur, une piste déjà jugée prometteuse mais jusque-la bridée par le cout d'exploration sur les taches longues. A la différence des méthodes qui reentrainent ou affinent le VLA, BATON ne met a jour aucun paramètre et repose entièrement sur la mémoire et la composition de sous-solutions apprises séparément. Publie en aout 2026 sous forme de preprint arXiv et évalué uniquement sur le benchmark RoboMemArena, il reste a ce stade un résultat de recherche: aucun code public, aucun partenariat industriel ni déploiement pilote n'est mentionne.

RecherchePaper
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
4arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source