
SmoLSTM : un modèle vision-langage-action compact à mémoire récurrente persistante
Un modèle vision-langage-action baptisé SmoLSTM vise à résoudre un problème classique des politiques robotiques actuelles : lorsque l'action est prédite uniquement à partir de l'observation courante, une tâche impliquant un objet occulté ou plusieurs objets visuellement identiques devient ambiguë sans historique de l'épisode. La parade habituelle, élargir la fenêtre d'observation, transforme cet horizon en hyperparamètre et fait croître le coût de calcul à chaque pas de temps. L'équipe à l'origine du papier, publié le 22 septembre 2026 sur arXiv (2609.22854), propose à la place de stocker l'épisode dans un état récurrent. SmoLSTM associe un backbone SmolVLM gelé de 256 millions de paramètres à une couche de contrôle LSTM à mémoire matricielle, où jetons d'observation et requêtes d'action circulent dans un unique flux causal jamais réinitialisé sur toute la durée de l'épisode, ce qui rend le stockage de l'état en O(1) quelle que soit la longueur de l'épisode. Une tête d'action par flow-matching prédit à chaque pas des séquences de 10 deltas de pose de l'effecteur et des commandes de préhenseur. Entraînée conjointement sur 7 461 démonstrations couvrant 140 tâches, la politique unique atteint 85,1% de couverture de sous-objectifs et 77,5% de réussite complète sur le benchmark LIBERO-Mem, avec seulement 40 millions de paramètres entraînables, dépassant à la fois la baseline object-centric du benchmark et les approches à mémoire récentes.
Cette architecture répond directement à une limite documentée des VLA en environnement industriel: la mémoire d'épisode conditionne la fiabilité en manipulation, notamment quand un capteur perd temporairement la vue d'un objet ou face à des pièces indiscernables sur une ligne. Pour les intégrateurs, l'intérêt tient surtout au ratio performance/coût: la quasi-totalité du réseau reste gelée, seuls 40 millions de paramètres sont ajustés, ce qui limite le coût d'entraînement sans faire exploser le calcul par pas comme le ferait un contexte élargi. Une expérience de contrôle renforce la démonstration: réinitialiser l'état récurrent à chaque pas de contrôle fait chuter le taux de réussite complète à 7,0%, preuve que les gains proviennent bien du contexte transporté entre décisions et non d'un artefact d'entraînement.
L'architecture s'inscrit dans la lignée des VLA compacts dérivés de SmolVLM, en réaction aux modèles à fenêtre de contexte élargie qui dominent le paysage actuel, aux côtés d'approches comme Pi-0 ou GR00T N2. Les auteurs comparent leur méthode à la fois à la baseline object-centric propre à LIBERO-Mem et à d'autres approches à mémoire récentes, et valident sa généralité en obtenant aussi 79,6% de réussite moyenne sur le benchmark standard LIBERO, sans mémoire d'occlusion particulière à exploiter. Ces résultats restent toutefois obtenus en simulation, sur des tâches de manipulation de table type LIBERO, et non sur un déploiement robotique réel: il s'agit d'un travail de recherche fraîchement publié, sans annonce de portage matériel ni de calendrier de test physique à ce stade.
Dans nos dossiers




