Aller au contenu principal
RecherchearXiv cs.RO 

Se souvenir de ses actions : mémoire de l'historique d'actions et débruitage à double expert pour les politiques VLA à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ActMem-VLA, une architecture qui ajoute une mémoire de l'historique des actions à un modèle vision-langage-action (VLA) déjà entraîné, sans le ré-entraîner. Le système greffe sur une politique de base figée (fine-tunée puis gelée) un plugin composé d'un module mémoire basé sur Mamba, un modèle à espace d'états, et d'un expert léger baptisé PreAction Expert (PAE). Mamba encode les actions déjà exécutées, et cette mémoire conditionne le PAE avec le contexte courant. Pendant les premières étapes de débruitage, à fort bruit, le PAE oriente la progression de la tâche. Il transmet ensuite l'action partiellement débruitée à l'Action Expert (AE) figé, qui affine les détails sur les étapes restantes à faible bruit. Seuls Mamba et le PAE sont optimisés. Sur le benchmark LIBERO-Mem, ActMem-VLA atteint 80,8 % de réussite moyenne sur les dix tâches, contre 65,2 % pour π0.5 et 49,5 % pour MemoryVLA, pour seulement 3,45 % de paramètres supplémentaires. Sur quatre tâches réelles, le gain moyen sur π0.5 est de 28,8 %. L'article ne précise pas s'il s'agit de points de pourcentage ou d'un gain relatif.

L'enjeu est le « perceptual aliasing » : à deux étapes différentes d'une tâche longue, l'observation et l'état du robot peuvent être quasi identiques, alors que l'action correcte diffère. Sans accès à l'historique, la politique hésite ou répète une étape déjà faite. Le résultat compte pour les intégrateurs, car la mémoire est ici un module ajouté à un VLA existant, sans repartir d'un entraînement complet. Un modèle de base validé en production pourrait ainsi gagner en fiabilité sur les séquences longues (assemblage multi-étapes, kitting, tri) pour un surcoût de calcul modeste. Le score de 80,8 % montre aussi qu'il reste près d'une tentative sur cinq en échec. LIBERO-Mem est de plus un benchmark de simulation conçu pour tester la mémoire, et l'évaluation réelle ne porte que sur quatre tâches, sans détail public dans le résumé sur le nombre d'essais.

Le travail s'inscrit dans une série de méthodes qui injectent des indices temporels ou de progression dans les VLA, par conditionnement de features, modification de l'a priori d'action ou guidage de l'échantillonnage. MemoryVLA, comparé ici, fait partie de cette famille. Le coût de ces approches, qui entraînent conjointement la mémoire et le VLA de base, motive la séparation choisie par les auteurs entre pilotage conditionné par l'historique et raffinement par la politique figée. Le point de comparaison principal reste π0.5 de Physical Intelligence. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs. Aucun déploiement industriel ni code n'est mentionné dans le résumé, et les prochaines étapes probables sont une validation sur d'autres bases VLA et sur des tâches réelles plus longues.

À lire aussi

Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon
1arXiv cs.RO 

Extension de la mémoire à court terme des politiques visuomotrices pour les tâches à long horizon

Des chercheurs ont soumis le 16 juin 2026 sur arXiv (2606.16178) une architecture transformer nommée PRISM, conçue pour doter les politiques visuomotrices entraînées par imitation learning d'une mémoire à court terme effective. Le système combine deux mécanismes : une attention filtrée (gated attention) qui supprime les corrélations parasites entre l'historique sensoriel et la prédiction d'action, et une architecture hiérarchique qui compresse les informations locales en tokens compacts pour capturer des dépendances temporelles étendues. PRISM maintient ainsi une mémoire opérationnelle sur environ deux minutes. Ses performances : 5 à 12 % de gains absolus sur les baselines les plus solides, et 11 à 15 % de mieux que sa variante sans mémoire sur RoboCasa et LIBERO, dépassant des modèles VLA fine-tunés comme GR00T-N1-3B (NVIDIA) et OpenVLA, sans aucun pré-entraînement à grande échelle. Les auteurs publient aussi ReMemBench, un benchmark de huit tâches de manipulation domestique couvrant quatre catégories mémorielles. La quasi-totalité des politiques visuomotrices actuelles n'exploitent que l'entrée sensorielle instantanée, les rendant incapables de gérer des tâches impliquant des objets temporairement occultés ou des actions à déclencher après un délai défini. PRISM démontre qu'une architecture mémoire soigneusement conçue peut surpasser des VLA massivement pré-entraînés, remettant en question l'hypothèse dominante selon laquelle la taille du corpus de pré-entraînement prime sur les choix architecturaux. Pour les intégrateurs et les décideurs industriels, ce résultat ouvre la voie à des politiques de manipulation longue séquence plus accessibles en calcul. PRISM s'inscrit dans un débat actif entre approches récurrentes (LSTM, Mamba) et architectures transformer pour les politiques de manipulation robotique. Les benchmarks RoboCasa et LIBERO font référence en simulation pour ce type de tâches, et des modèles comme GR00T-N1 de NVIDIA (3B paramètres) ou OpenVLA ont misé sur un pré-entraînement multimodal massif pour y performer. PRISM se positionne comme une alternative architecturale plus légère et sans pré-entraînement. Il faut toutefois souligner que tous les résultats sont obtenus en simulation : aucun transfert sim-to-real ni déploiement physique n'est annoncé, laissant ouverte la question de la robustesse sur robot réel.

RechercheOpinion
1 source
2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon
2arXiv cs.RO 

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon

Publiée le 11 septembre 2026 sur arXiv sous la référence 2609.11308, une nouvelle architecture baptisée 2AM propose une autre méthode pour la manipulation robotique à long horizon, ces tâches multi-étapes qui exigent de se souvenir de ce qui a déjà été fait. Le système sépare strictement deux rôles : un agent multimodal conserve seul la mémoire de la tâche et traduit l'historique des interactions en instructions de sous-tâches en langage naturel, complétées par des indices optionnels en 2D (points de préhension, de dépose et de déplacement) ; un modèle d'action unique, basé uniquement sur des images RGB et sans état interne entre les épisodes, exécute le mouvement. Pour le rendre pilotable, les auteurs ont enrichi les démonstrations d'étiquettes d'indices structurées et entraîné le modèle avec abandon aléatoire de conditions, bruit spatial et décalage temporel, afin qu'il tolère des instructions imparfaites. Testé sur le benchmark LIBERO-Mem, sans profondeur, sans géométrie calculée en ligne ni déplacement d'objets planifié, 2AM atteint un taux de complétion moyen de 76,3 %, contre 14,8 % pour la meilleure référence publiée à ce jour, soit un gain de 61,5 points, avec 63,0 % de réussite au sens large et 11,8 % au sens strict. Ce résultat vise un problème méthodologique récurrent des systèmes agentiques actuels, qui combinent souvent des modèles vision-langage-action (VLA) avec planificateurs et outils géométriques, parfois appuyés par de la profondeur ou une géométrie calibrée : il devient difficile de savoir si les gains viennent d'observations plus riches, d'outils moteurs alternatifs ou de la politique elle-même, et si les échecs viennent de la politique ou d'une interface langagière mal spécifiée. En réduisant volontairement la panoplie d'outils au profit d'une interface à plus haute bande passante entre agent et modèle d'action, 2AM isole la variable de précision du pilotage. Le résultat suggère que la mémoire de tâche peut rester entièrement côté agent, sans être intégrée dans la politique d'action, un choix opposé à la tendance qui consiste à faire porter mémoire et raisonnement par un seul grand modèle entraîné de bout en bout. Pour les équipes qui développent des modèles d'action génératifs comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, ce travail introduit une hypothèse alternative : la capacité effective d'un modèle dépendrait autant de la précision avec laquelle il est piloté que de ce qu'il a appris à l'entraînement, ce qui interroge la course actuelle aux VLA toujours plus massifs. Le travail s'inscrit dans la lignée des benchmarks LIBERO, largement utilisés en apprentissage de politiques robotiques, dont LIBERO-Mem constitue une extension dédiée aux tâches à mémoire longue. Il se positionne en creux face aux architectures dominantes du secteur, qui empilent VLA, planificateurs symboliques et perception 3D pour gérer des séquences de manipulation complexes, une approche que la publication critique implicitement pour son opacité dans l'attribution des performances. Aucun déploiement matériel réel n'est mentionné : les résultats restent circonscrits à la simulation et au benchmark, sans validation sur robot physique ni pilote industriel annoncé. L'affiliation institutionnelle des auteurs et un calendrier de suite ne sont pas précisés, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit ou d'un partenariat commercial.

RechercheActu
1 source
Se souvenir intelligemment : compresseur d'historique visuel et espace d'expérience hyperbolique pour la mémoire robotique
3arXiv cs.RO 

Se souvenir intelligemment : compresseur d'historique visuel et espace d'expérience hyperbolique pour la mémoire robotique

Des chercheurs ont publié en août 2026 sur arXiv (référence 2608.15269) un module nommé Remember Smarter (RS), une brique plug-and-play qui donne aux politiques robotiques vision-langage-action (VLA) une mémoire compacte pour les tâches longues sans agrandir leur fenêtre de contexte. Sa branche visuelle compresse l'historique de patches multi-vues via des réseaux Mamba spatial et temporel, puis l'injecte par cross-attention résiduelle dans les états cachés liés à l'action, sans toucher au flux de tokens visuels du modèle vision-langage. Sa branche "expérience" stocke dans un espace hyperbolique de Poincaré les états du VLM issus des épisodes réussis, les organise hiérarchiquement et les réinjecte en tokens de prompt géodésiques de manière asynchrone, sans ralentir l'inférence. Appliqué au modèle Pi-0, RS fait passer le taux de réussite total sur le benchmark LIBERO-Plus de 53,6% à 70,6%, avec des gains également rapportés lors d'expériences complémentaires sur robot réel. Ce résultat cible un goulot d'étranglement connu des VLA à grande échelle : allonger l'horizon d'une tâche oblige souvent à choisir entre oublier le contexte récent, au prix de la précision, ou étendre la fenêtre de contexte, au prix du calcul et de la latence. En séparant une mémoire courte réutilisable d'une mémoire longue d'expérience, sans alourdir le flux principal du modèle vision-langage, RS vise un gain de fiabilité sans surcoût d'inférence, un compromis clé pour qui cherche à déployer des VLA à cadence élevée sur du matériel embarqué. Le saut de près de 17 points sur LIBERO-Plus, un benchmark conçu pour stresser la généralisation des politiques robotiques, suggère que la mémoire à long terme reste un frein réel à la fiabilité des VLA plutôt qu'un simple détail d'ingénierie, même si ces résultats restent pour l'instant valides en simulation et sur un nombre limité d'essais en robot réel, sans déploiement industriel annoncé. Ce travail s'inscrit dans une vague de recherches visant à doter les VLA d'une mémoire structurée, alors que des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI ont déjà prouvé la viabilité de l'architecture vision-langage-action tout en butant sur les tâches longues et répétitives typiques de l'usine ou de l'entrepôt. Le recours aux réseaux Mamba, une architecture séquentielle moins coûteuse que les transformers sur le temporel long, et à un espace hyperbolique de Poincaré pour organiser l'expérience passée, reflète des tendances récentes en représentation hiérarchique. Le choix de Pi-0 comme base d'évaluation positionne RS comme un module complémentaire plutôt que concurrent des grands modèles de fondation robotique existants. À ce stade, il s'agit d'une publication de recherche et non d'un produit livré ni d'un pilote industriel : aucune feuille de route commerciale ni partenariat avec un fabricant de robots n'est mentionné.

RecherchePaper
1 source
Mémoire linguistique explicite pour la planification à long terme dans les modèles vision-langage-action
4arXiv cs.RO 

Mémoire linguistique explicite pour la planification à long terme dans les modèles vision-langage-action

Une équipe de recherche propose sur arXiv (référence 2608.04765) une nouvelle architecture pour les modèles vision-langage-action (VLA), conçue pour améliorer la planification sur des tâches longues et complexes. Le système repose sur un module de mémoire linguistique explicite qui convertit les observations visuelles successives en une séquence textuelle cohérente, dotée d'une logique temporelle. L'architecture est hiérarchique et découplée en deux niveaux : un modèle vision-langage (VLM) de haut niveau, entraîné selon un paradigme de question-réponse visuelle, effectue le raisonnement sémantique et met à jour récursivement la mémoire ainsi que les sous-instructions ; un modèle VLA de bas niveau exécute ensuite le contrôle continu et précis à partir de ces sous-instructions et des observations visuelles. Les auteurs ont évalué la méthode dans plusieurs environnements de simulation, puis mené des expériences de transfert sim-to-real sur une plateforme robotique réelle, sans préciser dans le résumé le type de bras, le payload utilisé, ni le nom de l'institution. L'enjeu dépasse l'amélioration incrémentale : les modèles VLA actuels butent sur les tâches longues car ils sont conditionnés uniquement par l'observation courante, ce qui les rend de fait non-markoviens et sujets à une dérive, les erreurs d'exécution s'accumulant faute de correction en boucle fermée. C'est précisément le fossé entre démonstration et réalité que pointent les critiques des vidéos humanoïdes : enchaîner plusieurs sous-tâches de façon fiable, sans réinitialisation entre chaque étape. En rendant la mémoire du système explicite et interprétable (sous forme de texte plutôt que de vecteurs latents opaques), l'approche offre aussi une traçabilité utile pour le débogage industriel, un point sensible pour des intégrateurs qui doivent comprendre pourquoi un robot échoue en cours de tâche plutôt que se contenter d'un taux de succès global. Ce travail s'inscrit dans une lignée de recherches cherchant à corriger les limites du contrôle bout en bout pur, où le fine-tuning sur l'action tend à dégrader les représentations sémantiques héritées des VLM, un problème documenté sur des familles de modèles comme RT-2, OpenVLA, Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. D'autres équipes explorent des pistes voisines, mémoire épisodique, planification hiérarchique, modèles du monde, pour traiter le même problème d'horizon long. Publié en août 2026 sous forme de preprint, sans code ni benchmark comparatif détaillé dans le résumé, ce travail reste à ce stade une contribution académique : il faudra des évaluations sur des suites de référence partagées et des tests au-delà du laboratoire pour juger si la mémoire linguistique explicite tient sa promesse de robustesse en conditions réelles.

RechercheOpinion
1 source