La modélisation Mamba à espace d'états sélectif améliore le compromis précision-complexité des experts VLA de SmolVLA
Des chercheurs ont mis en ligne le 25 août 2026 un article arXiv (2608.21407v1) proposant de remplacer l'attention causale de l'expert d'action du modèle SmolVLA par une modélisation d'espace d'état sélectif de type Mamba. SmolVLA est un modèle vision-langage-action (VLA) de référence, réputé pour sa précision élevée à faible complexité de calcul. Les deux variantes, Mamba et Transformer, ont été évaluées sur la suite de benchmarks LIBERO selon trois horizons d'exécution avant replanification: N=1, N=25 et N=50 actions, correspondant respectivement à une complexité de calcul élevée, modérée et faible. À N=50, horizon jugé compatible avec un déploiement temps réel, l'expert Mamba dépasse le Transformer de 7,8 points de taux de réussite. À N=25, l'écart est de 3,7 points. À N=1, avec une replanification à chaque action, les deux variantes obtiennent un taux de réussite équivalent, mais Mamba réduit le nombre de paramètres du modèle de 24%.
Le compromis entre précision et fréquence d'appel du modèle est un frein central au déploiement industriel des VLA: replanifier à chaque action donne le meilleur contrôle mais génère une latence incompatible avec le temps réel, tandis qu'espacer les replanifications allège le calcul au prix d'une fiabilité dégradée. Ce résultat montre qu'un changement d'architecture au niveau de l'expert d'action, sans toucher aux données d'entraînement ni à la taille globale du modèle, peut atténuer cette dégradation sur les horizons longs. Pour les intégrateurs robotiques qui doivent faire tourner ces politiques sur du calcul embarqué à ressources limitées, cela ouvre une piste concrète pour rapprocher les VLA d'un fonctionnement en cadence réelle, plutôt que de rester cantonnés à des démonstrations en laboratoire à faible vitesse d'exécution.
SmolVLA, développé par Hugging Face, sert de modèle de référence léger et ouvert dans la famille des VLA, aux côtés d'architectures plus lourdes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, ces dernières associées à des plateformes comme Figure 03 ou Optimus. Mamba, architecture d'espace d'état sélectif conçue comme alternative moins coûteuse à l'attention pour le traitement séquentiel, avait déjà fait ses preuves en traitement du langage; son application à l'expert d'action d'un VLA reste un axe de recherche récent. Les auteurs positionnent leurs résultats comme une base à valider au-delà du benchmark simulé LIBERO, sur des tâches robotiques réelles et sur d'autres modèles VLA de plus grande taille.
SmolVLA, modèle ouvert développe par Hugging Face (fortement implante a Paris), sert de référence pour les intégrateurs robotiques européens a ressources de calcul limitées, qui pourraient bénéficier de cet allègement architectural.
Dans nos dossiers




