Aller au contenu principal
StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D
RecherchearXiv cs.RO 

StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

StemVLA est un nouveau modèle vision-langage-action (VLA) open source destiné à la manipulation robotique, présenté dans un article arXiv (2602.23721v2, version révisée). Contrairement à la plupart des VLA existants, qui mappent directement des images 2D vers des séquences d'actions sans modéliser la structure spatiale sous-jacente, StemVLA intègre explicitement deux briques supplémentaires : une anticipation de la géométrie 3D future de la scène (pour prévoir la configuration des objets à venir) et une représentation spatiotemporelle 4D construite à partir de l'historique des images, extraite via un transformeur vidéo-géométrie pré-entraîné et agrégée dans le temps par un module d'attention temporelle baptisé VideoFormer. Sur la suite de benchmarks de simulation LIBERO, le modèle atteint une précision moyenne de 92,0 %, et 86,0 % sur le sous-ensemble LIBERO-Long, dédié aux tâches à horizon long.

L'enjeu dépasse la simple performance chiffrée : les VLA actuels peinent souvent sur le raisonnement spatial fin et la planification à long terme, précisément parce qu'ils ignorent la géométrie 3D et la dynamique temporelle de la scène. En forçant le modèle à prédire explicitement l'évolution future de l'espace 3D plutôt qu'à réagir à des images plates, StemVLA cherche à combler un des angles morts identifiés dans la littérature récente sur les modèles fondation pour la robotique, celui de la cohérence temporelle et de la généralisation dans des environnements dynamiques. Les gains observés sur LIBERO-Long, sous-ensemble réputé plus exigeant, suggèrent que l'ajout de connaissances géométriques structurées améliore la robustesse sur des tâches multi-étapes, un point sensible pour les intégrateurs qui cherchent à dépasser les démonstrations de laboratoire.

Ce travail s'inscrit dans une vague de recherche VLA qui, après les architectures pionnières fondées sur des mappings image-action directs, cherche à enrichir la représentation du monde interne des modèles, en écho aux approches combinant perception géométrique et politiques d'action explorées par d'autres laboratoires du secteur. Les résultats restent pour l'instant limités à la simulation LIBERO ; l'étape suivante attendue par la communauté sera la validation sur robots physiques réels, où l'écart entre performance simulée et transfert sim-to-real demeure le principal obstacle à la généralisation des VLA.

À lire aussi

StrataVLA : ancrage géométrique 3D hiérarchique et efficace pour les modèles vision-langage-action
1arXiv cs.RO 

StrataVLA : ancrage géométrique 3D hiérarchique et efficace pour les modèles vision-langage-action

Une équipe de recherche présente StrataVLA, un framework pour les modèles Vision-Language-Action (VLA) utilisés en manipulation robotique, dans un preprint mis en ligne sur arXiv en septembre 2026 (référence 2609.26071v1). Le système cible le manque de conscience spatiale en 3D des VLA, qui héritent de solides priors sémantiques du préentraînement vision-langage mais restent limités en manipulation faute d'accès continu à l'information géométrique. Il associe un modèle de géométrie figé, qui extrait des caractéristiques à partir d'images RGB, à des Geometry Adapters épars insérés à des profondeurs choisies du réseau et récupérant cette information par attention croisée, complété par un routage sensible à la tâche et un cache LRU exploitant la redondance temporelle pour limiter le coût de calcul. Testé sur LIBERO, SimplerEnv et en manipulation réelle, StrataVLA atteint 98,53 % de réussite moyenne sur les suites LIBERO tout en réduisant jusqu'à 88 % les appels au modèle de géométrie. Pour les intégrateurs robotiques, cette approche plug-and-play promet d'ajouter une compréhension 3D fiable à un VLA existant sans multiplier les capteurs de profondeur ni réentraîner tout le réseau, le tronc vision-langage préentraîné restant gelé. La réduction de 88 % des appels au modèle de géométrie vise directement le coût de calcul qui freine le déploiement temps réel de politiques conscientes de la géométrie. Le chiffre de 98,53 % reste toutefois un résultat de simulation sur LIBERO ; les gains rapportés sur SimplerEnv et en conditions réelles ne sont pas quantifiés de la même manière, ce qui invite à la prudence avant d'extrapoler cette performance à des environnements industriels variés. Ce travail s'inscrit dans une recherche sur les VLA qui, depuis des modèles comme Pi-0 ou GR00T N2, cherchent à unifier perception, langage et action dans un seul réseau de bout en bout, tout en se heurtant à la même limite : un raisonnement spatial 3D précis, nécessaire pour saisir et positionner des objets, que les représentations purement 2D ne capturent pas nativement. Plutôt que de créer un nouveau modèle de fondation, StrataVLA propose d'injecter la géométrie de manière hiérarchique et distribuée dans le tronc existant. L'article ne mentionne ni entreprise ni site de déploiement industriel : il s'agit d'un preprint de recherche, non encore évalué par les pairs, sans code ni robot commercial associé à ce stade.

RechercheOpinion
1 source
GaussVLA : un raisonnement spatial géométrique pour les modèles vision-langage-action
2arXiv cs.RO 

GaussVLA : un raisonnement spatial géométrique pour les modèles vision-langage-action

Un preprint arXiv (2608.24959v1) présente GaussVLA, un modèle Vision-Language-Action fondé sur une architecture Mamba, doté de deux modules : le Gaussian Spatial Tokenizer (GST), qui convertit des caractéristiques sémantiques et de profondeur figées en tokens 3D gaussiens compacts en agrégeant les zones géométriquement saillantes via des requêtes apprises, et le Depth-Aware Chain-of-Thought (DA-CoT), un raisonnement géométrique structuré et non autorégressif conditionné par le langage. Testé en simulation sur le benchmark LIBERO et en conditions réelles, il atteint 93,5 % de réussite moyenne et 100,0 % sur la suite Spatial avec seulement 200 millions de paramètres, soit 19,7 % de mieux que SpatialVLA, sa référence de comparaison directe, tout en restant nettement plus économique en paramètres. Le problème visé est connu : les observations visuelles des modèles VLA sont d'ordinaire encodées en tokens 2D plats sans structure géométrique, et une carte de profondeur monoculaire n'ajoute que des valeurs scalaires par pixel, sans orientation de surface ni confiance géométrique. En dotant le modèle d'une représentation 3D explicite, GaussVLA améliore le raisonnement spatial requis pour la manipulation fine, un des écarts récurrents entre démonstrations de laboratoire et déploiement réel. Pour les intégrateurs, le signal le plus utile reste l'efficacité paramétrique : un modèle de 200 millions de paramètres qui surpasse une référence plus lourde suggère que la qualité du raisonnement spatial tient davantage à la structure de la représentation qu'à la taille du modèle, contredisant l'hypothèse du "plus gros VLA égale meilleure généralisation" et laissant entrevoir des coûts d'inférence embarquée réduits pour des politiques déployées directement sur des contrôleurs de robots. GaussVLA se positionne explicitement comme une amélioration de SpatialVLA, dans une course d'architectures VLA qui cherche depuis plusieurs générations à résoudre le raisonnement spatial en manipulation robotique. Le travail reste un preprint non encore revu par les pairs, validé sur LIBERO, un benchmark de simulation standard, complété par des essais réels dont l'ampleur n'est pas précisée dans le résumé. Aucun partenaire industriel, calendrier de déploiement ou prix n'est mentionné : il s'agit d'une contribution de recherche sur l'architecture des tokenizers spatiaux, et non d'un produit ou d'un pilote commercial, dont les suites attendues seraient des tests sur des tâches de manipulation plus longues et des plateformes robotiques variées.

RechercheOpinion
1 source
MotionVLA : intégration du mouvement géométrique dans un modèle vision-langage-action (VLA)
3arXiv cs.RO 

MotionVLA : intégration du mouvement géométrique dans un modèle vision-langage-action (VLA)

Un preprint déposé sur arXiv le 9 juin 2026 (arXiv:2606.08288) introduit MotionVLA, une interface de mémoire motrice conçue pour améliorer les modèles vision-language-action appliqués à la manipulation robotique longue portée. Le principe : plutôt qu'alimenter le modèle avec une séquence d'images passées traitées indépendamment, MotionVLA convertit une courte fenêtre vidéo récente en tokens de champ de trajectoire (trajectory-field tokens), compacts et temporellement continus. Ces tokens encodent le mouvement cohérent entre les observations, et les tokens visuels courants les interrogent pour extraire les informations de mouvement pertinentes à la tâche en cours. Le tout est réinjecté dans le flux VLA via une supervision ancrée sur les trajectoires. Les auteurs rapportent des améliorations sur des benchmarks de simulation ainsi que des essais préliminaires sur robot réel, avec des exécutions décrites comme plus fluides et plus directes. L'enjeu est théorique, mais les implications pratiques sont directes. Les VLA actuels -- pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure) -- cherchent à résoudre l'ambiguïté des tâches longues en injectant toujours plus de contexte : historique d'images, profondeur, features 4D. L'hypothèse implicite est "plus de contexte spatio-temporel équivaut à une meilleure politique". MotionVLA conteste cette hypothèse : un contexte incohérent en termes de mouvement introduit de la dérive géométrique, des indices temporels fragmentés et une génération d'actions instable. Reformuler la mémoire comme un champ de mouvement plutôt que comme un empilement de frames résout le problème à la source, ce qui intéresse directement les équipes cherchant à stabiliser des VLA en déploiement industriel sans exploser le budget de calcul. Ce travail s'inscrit dans une course intense à l'architecture VLA optimale. Les approches concurrentes incluent les modèles à base de profondeur (SpatialVLA), de features 4D (CogACT), ou de diffusion de trajectoires (pi-0). MotionVLA se rapproche davantage des travaux sur le flot optique dense et les représentations de mouvement continu. Deux mises en garde s'imposent : les résultats sur robot réel sont explicitement qualifiés de "préliminaires" par les auteurs, et aucun chiffre de benchmark précis n'est disponible dans la publication actuelle. À ce stade, il s'agit d'une contribution de recherche, non d'un produit industrialisé ni d'une démonstration validée à l'échelle.

RechercheOpinion
1 source
VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
4arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source