Aller au contenu principal
RecherchearXiv cs.RO 

MemBodied : mémoire associative récurrente pour modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un modèle appelé MemBodied introduit une mémoire épisodique de taille fixe pour les modèles Vision-Language-Action (VLA), détaillée dans un article arXiv (2609.28256v1) publié en septembre 2026. Le système repose sur deux composants complémentaires: un état associatif qui enregistre les interactions au fil des appels successifs de la politique, et une ancre d'épisode qui conserve une représentation compacte de la scène initiale comme référence. Sur cinq tâches du benchmark RMBench conçues pour nécessiter de la mémoire, MemBodied atteint un taux de succès moyen 7,81 fois supérieur à celui d'une politique sans état (stateless) et 2,98 fois supérieur à une mémoire récurrente classique, tout en dépassant la meilleure référence à mémoire augmentée de 1,3 fois avec dix fois moins de paramètres ajoutés. Sur la suite LIBERO-Long, entièrement observable, il atteint 90,6% de réussite, soit une amélioration de 5,4 points par rapport à la politique stateless Pi-0.

Le problème que cible ce travail est central pour l'industrie robotique: la majorité des politiques VLA déployées aujourd'hui ne conservent aucune information au-delà de l'observation en cours, ce qui les rend incapables de gérer des tâches de manipulation dépendantes de l'historique, par exemple retrouver un objet déplacé hors champ ou se souvenir qu'une étape a déjà été exécutée. La solution habituelle, garder l'historique complet dans le contexte du modèle, fait gonfler la latence d'inférence et le coût de calcul, un frein direct pour des cas d'usage industriels en temps réel. En proposant une mémoire à empreinte constante plutôt qu'un contexte qui s'étend indéfiniment, MemBodied répond à une limite concrète des architectures VLA à grande échelle (Pi-0, GR00T N2, Helix) qui excellent sur des tâches courtes mais peinent sur des séquences longues nécessitant du raisonnement temporel.

Les VLA se sont imposés comme paradigme dominant du contrôle robotique généraliste ces dernières années, portés par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. MemBodied se positionne comme une alternative légère à l'extension de contexte, comparée aux politiques sans état, à la mémoire récurrente standard et aux meilleures approches de mémoire augmentée existantes. Il s'agit à ce stade d'un résultat de recherche mesuré sur des benchmarks (RMBench, LIBERO-Long), sans annonce de déploiement industriel ni de partenariat commercial.

À lire aussi

SmoLSTM : un modèle vision-langage-action compact à mémoire récurrente persistante
1arXiv cs.RO 

SmoLSTM : un modèle vision-langage-action compact à mémoire récurrente persistante

Un modèle vision-langage-action baptisé SmoLSTM vise à résoudre un problème classique des politiques robotiques actuelles : lorsque l'action est prédite uniquement à partir de l'observation courante, une tâche impliquant un objet occulté ou plusieurs objets visuellement identiques devient ambiguë sans historique de l'épisode. La parade habituelle, élargir la fenêtre d'observation, transforme cet horizon en hyperparamètre et fait croître le coût de calcul à chaque pas de temps. L'équipe à l'origine du papier, publié le 22 septembre 2026 sur arXiv (2609.22854), propose à la place de stocker l'épisode dans un état récurrent. SmoLSTM associe un backbone SmolVLM gelé de 256 millions de paramètres à une couche de contrôle LSTM à mémoire matricielle, où jetons d'observation et requêtes d'action circulent dans un unique flux causal jamais réinitialisé sur toute la durée de l'épisode, ce qui rend le stockage de l'état en O(1) quelle que soit la longueur de l'épisode. Une tête d'action par flow-matching prédit à chaque pas des séquences de 10 deltas de pose de l'effecteur et des commandes de préhenseur. Entraînée conjointement sur 7 461 démonstrations couvrant 140 tâches, la politique unique atteint 85,1% de couverture de sous-objectifs et 77,5% de réussite complète sur le benchmark LIBERO-Mem, avec seulement 40 millions de paramètres entraînables, dépassant à la fois la baseline object-centric du benchmark et les approches à mémoire récentes. Cette architecture répond directement à une limite documentée des VLA en environnement industriel: la mémoire d'épisode conditionne la fiabilité en manipulation, notamment quand un capteur perd temporairement la vue d'un objet ou face à des pièces indiscernables sur une ligne. Pour les intégrateurs, l'intérêt tient surtout au ratio performance/coût: la quasi-totalité du réseau reste gelée, seuls 40 millions de paramètres sont ajustés, ce qui limite le coût d'entraînement sans faire exploser le calcul par pas comme le ferait un contexte élargi. Une expérience de contrôle renforce la démonstration: réinitialiser l'état récurrent à chaque pas de contrôle fait chuter le taux de réussite complète à 7,0%, preuve que les gains proviennent bien du contexte transporté entre décisions et non d'un artefact d'entraînement. L'architecture s'inscrit dans la lignée des VLA compacts dérivés de SmolVLM, en réaction aux modèles à fenêtre de contexte élargie qui dominent le paysage actuel, aux côtés d'approches comme Pi-0 ou GR00T N2. Les auteurs comparent leur méthode à la fois à la baseline object-centric propre à LIBERO-Mem et à d'autres approches à mémoire récentes, et valident sa généralité en obtenant aussi 79,6% de réussite moyenne sur le benchmark standard LIBERO, sans mémoire d'occlusion particulière à exploiter. Ces résultats restent toutefois obtenus en simulation, sur des tâches de manipulation de table type LIBERO, et non sur un déploiement robotique réel: il s'agit d'un travail de recherche fraîchement publié, sans annonce de portage matériel ni de calendrier de test physique à ce stade.

RechercheOpinion
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
2arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action
4arXiv cs.RO 

StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action

Publié le 22 septembre 2026 sur arXiv sous la référence 2609.22684, StateMem est un nouveau framework de mémoire pour les politiques vision-langage-action (VLA) utilisées en manipulation robotique. Plutôt que de s'appuyer sur des banques de mémoire externes comme celles de MemoryVLA, il maintient un unique token de mémoire persistant mis à jour par résidus de faible rang et route de façon adaptative les préfixes mis en cache, avec un contrôleur sans entraînement ajustant le seuil en ligne et une correction rapide compensant la dérive des données en cache. Sur le benchmark LIBERO, StateMem atteint 97,6% de réussite moyenne tout en réduisant de 20,25% la fréquence de rafraîchissement complet du préfixe du modèle vision-langage. Sur RoboMemArena, catégorie Occlusion, il devance les autres méthodes VLA isolées avec 21,8% de taux de succès par tâche et 44,3% de taux de succès cumulé, et gagne 21 points de réussite moyenne sur six tâches de manipulation réelle. L'enjeu est concret pour l'industrie: la manipulation robotique dépendante de la mémoire, où une action tardive doit exploiter une information vue plus tôt, comme un objet temporairement caché, reste un point faible des VLA qui ne regardent que l'observation courante. En évitant le stockage et la récupération explicites d'une mémoire externe, StateMem allège le pipeline d'inférence et réduit le calcul redondant, un critère décisif pour la latence et le coût de calcul embarqué en déploiement temps réel. Les gains en environnement d'occlusion sont particulièrement significatifs car ils ciblent l'écart entre démonstrations de laboratoire et conditions réelles d'usine ou d'entrepôt, où l'occlusion visuelle est fréquente. Le travail s'inscrit dans la lignée des politiques VLA qui cherchent à dépasser la réaction à l'instant présent pour intégrer un raisonnement temporel, en se positionnant comme alternative plus légère aux architectures à mémoire externe explicite telles que MemoryVLA. Les auteurs valident leur approche sur trois terrains complémentaires, la suite standardisée LIBERO, le benchmark récent RoboMemArena axé sur mémoire et occlusion, et des tâches réelles sur robot physique, limitant le risque de sur-optimisation à un seul environnement simulé. Déposé en pré-publication sans mention de licence commerciale ni de partenariat industriel, StateMem reste à ce stade une contribution de recherche dont l'adoption en production dépendra de sa reproduction indépendante.

RechercheActu
1 source