Aller au contenu principal
SmoLSTM : un modèle vision-langage-action compact à mémoire récurrente persistante
RecherchearXiv cs.RO 

SmoLSTM : un modèle vision-langage-action compact à mémoire récurrente persistante

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un modèle vision-langage-action baptisé SmoLSTM vise à résoudre un problème classique des politiques robotiques actuelles : lorsque l'action est prédite uniquement à partir de l'observation courante, une tâche impliquant un objet occulté ou plusieurs objets visuellement identiques devient ambiguë sans historique de l'épisode. La parade habituelle, élargir la fenêtre d'observation, transforme cet horizon en hyperparamètre et fait croître le coût de calcul à chaque pas de temps. L'équipe à l'origine du papier, publié le 22 septembre 2026 sur arXiv (2609.22854), propose à la place de stocker l'épisode dans un état récurrent. SmoLSTM associe un backbone SmolVLM gelé de 256 millions de paramètres à une couche de contrôle LSTM à mémoire matricielle, où jetons d'observation et requêtes d'action circulent dans un unique flux causal jamais réinitialisé sur toute la durée de l'épisode, ce qui rend le stockage de l'état en O(1) quelle que soit la longueur de l'épisode. Une tête d'action par flow-matching prédit à chaque pas des séquences de 10 deltas de pose de l'effecteur et des commandes de préhenseur. Entraînée conjointement sur 7 461 démonstrations couvrant 140 tâches, la politique unique atteint 85,1% de couverture de sous-objectifs et 77,5% de réussite complète sur le benchmark LIBERO-Mem, avec seulement 40 millions de paramètres entraînables, dépassant à la fois la baseline object-centric du benchmark et les approches à mémoire récentes.

Cette architecture répond directement à une limite documentée des VLA en environnement industriel: la mémoire d'épisode conditionne la fiabilité en manipulation, notamment quand un capteur perd temporairement la vue d'un objet ou face à des pièces indiscernables sur une ligne. Pour les intégrateurs, l'intérêt tient surtout au ratio performance/coût: la quasi-totalité du réseau reste gelée, seuls 40 millions de paramètres sont ajustés, ce qui limite le coût d'entraînement sans faire exploser le calcul par pas comme le ferait un contexte élargi. Une expérience de contrôle renforce la démonstration: réinitialiser l'état récurrent à chaque pas de contrôle fait chuter le taux de réussite complète à 7,0%, preuve que les gains proviennent bien du contexte transporté entre décisions et non d'un artefact d'entraînement.

L'architecture s'inscrit dans la lignée des VLA compacts dérivés de SmolVLM, en réaction aux modèles à fenêtre de contexte élargie qui dominent le paysage actuel, aux côtés d'approches comme Pi-0 ou GR00T N2. Les auteurs comparent leur méthode à la fois à la baseline object-centric propre à LIBERO-Mem et à d'autres approches à mémoire récentes, et valident sa généralité en obtenant aussi 79,6% de réussite moyenne sur le benchmark standard LIBERO, sans mémoire d'occlusion particulière à exploiter. Ces résultats restent toutefois obtenus en simulation, sur des tâches de manipulation de table type LIBERO, et non sur un déploiement robotique réel: il s'agit d'un travail de recherche fraîchement publié, sans annonce de portage matériel ni de calendrier de test physique à ce stade.

À lire aussi

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
1arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source
StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action
2arXiv cs.RO 

StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action

Publié le 22 septembre 2026 sur arXiv sous la référence 2609.22684, StateMem est un nouveau framework de mémoire pour les politiques vision-langage-action (VLA) utilisées en manipulation robotique. Plutôt que de s'appuyer sur des banques de mémoire externes comme celles de MemoryVLA, il maintient un unique token de mémoire persistant mis à jour par résidus de faible rang et route de façon adaptative les préfixes mis en cache, avec un contrôleur sans entraînement ajustant le seuil en ligne et une correction rapide compensant la dérive des données en cache. Sur le benchmark LIBERO, StateMem atteint 97,6% de réussite moyenne tout en réduisant de 20,25% la fréquence de rafraîchissement complet du préfixe du modèle vision-langage. Sur RoboMemArena, catégorie Occlusion, il devance les autres méthodes VLA isolées avec 21,8% de taux de succès par tâche et 44,3% de taux de succès cumulé, et gagne 21 points de réussite moyenne sur six tâches de manipulation réelle. L'enjeu est concret pour l'industrie: la manipulation robotique dépendante de la mémoire, où une action tardive doit exploiter une information vue plus tôt, comme un objet temporairement caché, reste un point faible des VLA qui ne regardent que l'observation courante. En évitant le stockage et la récupération explicites d'une mémoire externe, StateMem allège le pipeline d'inférence et réduit le calcul redondant, un critère décisif pour la latence et le coût de calcul embarqué en déploiement temps réel. Les gains en environnement d'occlusion sont particulièrement significatifs car ils ciblent l'écart entre démonstrations de laboratoire et conditions réelles d'usine ou d'entrepôt, où l'occlusion visuelle est fréquente. Le travail s'inscrit dans la lignée des politiques VLA qui cherchent à dépasser la réaction à l'instant présent pour intégrer un raisonnement temporel, en se positionnant comme alternative plus légère aux architectures à mémoire externe explicite telles que MemoryVLA. Les auteurs valident leur approche sur trois terrains complémentaires, la suite standardisée LIBERO, le benchmark récent RoboMemArena axé sur mémoire et occlusion, et des tâches réelles sur robot physique, limitant le risque de sur-optimisation à un seul environnement simulé. Déposé en pré-publication sans mention de licence commerciale ni de partenariat industriel, StateMem reste à ce stade une contribution de recherche dont l'adoption en production dépendra de sa reproduction indépendante.

RechercheActu
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
3arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire
4arXiv cs.RO 

VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire

Des chercheurs universitaires publient une architecture baptisée AEGIS, décrite dans un article arXiv (identifiant 2512.11891, version 2) consacré aux modèles vision-langage-action (VLA), ces systèmes qui permettent à un robot de traduire une instruction en langage naturel et une image en mouvement physique. AEGIS ajoute une couche de contrainte de sécurité "plug-and-play", construite à partir de fonctions de barrière de contrôle (control barrier functions), que l'on peut greffer sur un modèle VLA existant sans le réentraîner ni dégrader ses performances d'origine. Pour évaluer l'approche, les auteurs ont conçu un benchmark dédié, SafeLIBERO, qui multiplie les scénarios de manipulation avec des obstacles et des niveaux de complexité spatiale variables. Résultat annoncé: plus de 50% d'amélioration du taux d'évitement d'obstacles et près de 10% de hausse du taux de réussite des tâches, comparé aux meilleures méthodes existantes. Code et données sont publiés en accès libre. L'enjeu dépasse la prouesse technique isolée. Les modèles VLA généralistes, popularisés par des architectures comme Pi-0, GR00T N2 ou Helix, excellent à généraliser des instructions à de nouvelles tâches de manipulation, mais leur talon d'Achille reste la sécurité physique: rien ne garantit qu'un bras robotique évite une collision en environnement non structuré, un frein majeur au déploiement en usine ou en logistique. En proposant une couche de sécurité modulaire avec garanties théoriques plutôt qu'un simple filtrage heuristique, AEGIS répond directement à ce point de blocage identifié par les intégrateurs, sans nécessiter de repenser chaque modèle VLA au cas par cas. Ce travail s'inscrit dans la vague de recherche qui a suivi l'essor des VLA depuis RT-2 et OpenVLA, où l'accent s'est progressivement déplacé de la généralisation pure vers la fiabilité et la certifiabilité. Il faut toutefois noter que ces résultats proviennent d'un benchmark de simulation dérivé de LIBERO, pas d'un déploiement industriel réel: le passage à l'échelle sur du matériel physique et dans des environnements réellement non structurés reste l'étape suivante à observer, comme pour la plupart des publications de ce type avant adoption commerciale.

RechercheActu
1 source