Aller au contenu principal
DeicticVLA : unifier les instructions vocales et gestuelles dans un seul modèle VLA
RecherchearXiv cs.RO 

DeicticVLA : unifier les instructions vocales et gestuelles dans un seul modèle VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent DeicticVLA (arXiv:2608.28108v1), un modèle vision-langage-action (VLA) unifiant trois modes d'instruction dans une seule politique préentraînée : le langage pur (LI), le vision-langage (VLI), et l'instruction visuelle par gestes déictiques comme le pointage (VI). La méthode convertit ces trois formats en un prompt textuel commun associé à des masques déictiques, appris par un backbone partagé avec les mêmes démonstrations. Après comparaison en simulation de deux méthodes de prompting visuel RGB, deux méthodes de masquage et trois stratégies d'entraînement, les auteurs valident l'approche sur trois tâches robotiques réelles avec une seule politique gérant les trois modes. Sur des catégories d'objets jamais vues, VLI et VI atteignent 100 % de réussite contre seulement 16,7 % pour une politique LI classique, et un entraînement en deux étapes améliore l'usage des masques dans des configurations inédites.

Ce résultat cible une friction concrète pour l'industrie : distinguer "la boîte" parmi plusieurs objets identiques, ou désigner un point de pose précis, exige des descriptions détaillées que les VLA actuels suivent mal face à des objets ou formulations absents de l'entraînement. En montrant qu'une seule politique gère sans réentraînement le langage, le pointage et leur combinaison, DeicticVLA comble un écart souvent cité entre démonstrations scriptées et usage réel, où les opérateurs pointent naturellement plutôt que de formuler des phrases exhaustives. Pour les intégrateurs de bras manipulateurs en tri ou assemblage à forte variabilité d'objets, cela ouvre une voie pour réduire l'ingénierie de prompt. L'écart de 100 % contre 16,7 % pointe directement la fragilité hors distribution reprochée aux VLA entraînés seulement sur texte.

Ces travaux s'inscrivent dans une recherche plus large visant à rendre les VLA plus robustes, alors que des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont déjà montré la capacité de ces architectures à généraliser des tâches de manipulation par langage naturel, sans toujours lever l'ambiguïté entre objets similaires. DeicticVLA intègre le geste comme canal d'instruction à part entière, plutôt que comme simple ajout au langage. L'étude reste un travail de recherche publié sur arXiv, validé en simulation et sur trois tâches physiques seulement, non un produit déployé ; les auteurs le présentent comme des lignes directrices de conception plutôt qu'un système prêt à l'intégration.

À lire aussi

CAST : les étiquettes contrefactuelles améliorent le suivi d'instructions dans les modèles VLA
1arXiv cs.RO 

CAST : les étiquettes contrefactuelles améliorent le suivi d'instructions dans les modèles VLA

Des chercheurs ont publié sur arXiv (réf. 2508.13446, juin 2025) une méthode appelée CAST, Counterfactual Augmentation for Semantic Tracking, qui cible l'un des angles morts majeurs des modèles VLA (Vision-Language-Action) : leur incapacité à suivre des instructions linguistiques fines. L'approche ne nécessite aucune collecte de nouvelles données robot. Elle s'appuie sur des modèles de vision-langage (VLM) pour reannoter automatiquement les trajectoires existantes avec des labels contrefactuels, c'est-à-dire des descriptions alternatives de ce qui aurait pu se passer si l'instruction avait été différente. Les modèles entraînés sur ces données augmentées sont évalués sur des tâches de navigation visuo-linguistique dans trois environnements distincts (intérieur et extérieur) ainsi que sur des tâches de manipulation avec distracteurs. Le résultat clé : doublement du taux de succès par rapport aux VLAs entraînés sur les données brutes non augmentées, avec des performances dépassant les méthodes de l'état de l'art sur des commandes référentielles complexes. Ce résultat est significatif parce qu'il attaque directement le problème du language grounding dans les datasets robotiques actuels, jugé pauvre en diversité sémantique pour des observations similaires. Le fait d'obtenir ces gains sans collecte additionnelle réduit drastiquement le coût d'amélioration des politiques robot, un levier critique pour les équipes qui opèrent avec des budgets de téléopération limités. Plus structurellement, CAST valide l'hypothèse que la qualité du signal de supervision linguistique pèse autant que le volume de données brutes, une nuance souvent sous-estimée dans la course au scaling des VLAs. Les VLAs de type généraliste ont émergé comme paradigme dominant depuis 2023-2024, portés par des systèmes comme OpenVLA (Stanford), pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind). Tous partagent la même tension : un corpus de démonstrations robot coûteux à collecter, annotées en langage naturel souvent trop homogène. CAST s'inscrit dans un courant de recherche sur l'augmentation synthétique des annotations, concurrent des approches basées sur la simulation procédurale ou le re-labeling par LLM pur. Il s'agit d'un preprint arXiv, pas encore d'un système déployé, les résultats restent à confirmer sur des robots physiques à grande échelle.

RechercheOpinion
1 source
Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action
2arXiv cs.RO 

Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action

Un article publié le 12 août 2026 sur arXiv (2608.10484) s'attaque à la tokenisation des trajectoires de mouvement dans les modèles vision-langage-action, ou VLA. Sur le jeu de données BridgeV2, les auteurs montrent que ces trajectoires portent des informations liées au sens des verbes d'instruction, au-delà des simples changements d'état visuel, et que les tokenizers classiques, entraînés à reconstruire le geste via des pertes L1/L2, effacent systématiquement cette information linguistique. Leur méthode, baptisée SALT pour Semantically ALigned action Tokenizer, ajoute à un tokenizer de type VQ-VAE un objectif auxiliaire: un modèle vision-langage figé doit retrouver l'instruction textuelle de l'épisode à partir des seuls latents d'action quantifiés. Sur le benchmark de simulation SimplerEnv, les politiques entraînées avec SALT atteignent 71,9% de réussite moyenne, contre 42,7% pour un VQ-VAE classique et 31,2% pour FAST. Ce résultat touche un choix de conception central pour toute la famille des VLA, celle qui sous-tend des systèmes comme Pi-0, GR00T ou Helix: comment découper des actions continues en tokens discrets avant l'entraînement. Jusqu'ici, la priorité allait à la fidélité de reconstruction du geste, sous l'hypothèse que minimiser l'erreur numérique suffisait à préserver le sens de l'instruction en langage naturel. L'écart de près de 30 points entre SALT et un VQ-VAE standard suggère qu'une part importante du sens se perd dès la tokenisation, indépendamment de la taille du modèle ou du volume de données. Pour les équipes qui construisent des politiques de contrôle conditionnées par le langage, obtenir un tel gain par un simple changement d'objectif d'entraînement du tokenizer, sans toucher à l'architecture principale, constitue un signal fort. Le travail s'inscrit dans le débat sur la tokenisation des actions robotiques, partagé entre les tokenizers de reconstruction type VQ-VAE et des approches comme FAST, développée par Physical Intelligence et utilisée dans la lignée Pi-0. SALT s'en distingue en conservant la fidélité de reconstruction tout en développant des codes discrets spécialisés par verbe d'action. Publié comme nouvelle soumission arXiv, le travail est validé uniquement en simulation via SimplerEnv, sans démonstration sur robot physique, laissant ouverte la question du transfert sim-to-real.

UEAucun acteur ni deploiement francais/europeen n'est implique; il s'agit d'un resultat de recherche generique pouvant interesser les equipes europeennes travaillant sur des modeles VLA.

RechercheOpinion
1 source
StageCraft : atténuation, sensible à l'exécution, des échecs de distraction et d'obstruction dans les modèles VLA
3arXiv cs.RO 

StageCraft : atténuation, sensible à l'exécution, des échecs de distraction et d'obstruction dans les modèles VLA

Des chercheurs proposent StageCraft, une méthode qui améliore les performances des modèles VLA (Vision-Language-Action) sans réentraînement, en s'appuyant sur le raisonnement en contexte de grands modèles vision-langage (VLM) préentraînés sur des données à l'échelle d'internet. Le système prend en entrée des vidéos d'exécution de la politique robotique ainsi que des étiquettes de succès ou d'échec, puis identifie quels objets dans l'état initial de l'environnement doivent être déplacés ou retirés pour éviter les échecs anticipés liés à des distracteurs ou des obstructions physiques. Conçu comme un module plug-and-play, StageCraft ne nécessite que quelques essais de la politique pour fonctionner et n'impose aucune contrainte supplémentaire sur le modèle VLA sous-jacent. Les auteurs rapportent un gain de performance absolu de 40% sur trois domaines de tâches réelles impliquant des distracteurs et obstructions variés, ainsi que des résultats complémentaires en simulation sur RLBench. Cette approche s'attaque à un point de friction concret pour le déploiement industriel des VLA: ces modèles généralisent bien à de nouvelles tâches, objets et scènes grâce au préentraînement massif, mais restent fragiles dès que l'environnement réel introduit des éléments perturbateurs non anticipés, l'écart classique entre démonstration contrôlée et conditions réelles de production. Les méthodes existantes de finetuning peinent encore face à des distracteurs inédits. En proposant une correction au niveau de l'état initial de la scène plutôt qu'au niveau des poids du modèle, StageCraft ouvre une voie moins coûteuse pour fiabiliser des politiques déjà déployées, un argument qui intéressera directement les intégrateurs cherchant à éviter des cycles de réentraînement à chaque changement d'environnement de production. Le travail s'inscrit dans la lignée des efforts pour combler l'écart entre capacités démontrées en laboratoire et robustesse en conditions réelles des modèles VLA, une préoccupation centrale du secteur alors que ces architectures se multiplient. Les auteurs montrent aussi que l'intervention de StageCraft s'adapte à la force de la politique sous-jacente et s'améliore avec davantage d'exemples en contexte, suggérant une piste d'amélioration continue sans réentraînement lourd. Des vidéos de démonstration sont disponibles sur le site dédié au projet.

RechercheActu
1 source
Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action
4arXiv cs.RO 

Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action

Publiée le 4 août 2026 sur arXiv (2608.04633), une méthode baptisée Mind-VLA corrige un défaut des modèles vision-langage-action (VLA) en robotique: les approches existantes alignent leur représentation avec la géométrie 3D de toute la scène de façon uniforme, sans isoler l'objet désigné par l'instruction, d'où des échecs en manipulation fine ou en cas d'occlusion. Mind-VLA identifie d'abord cet objet cible, en génère une vue à trois angles, en extrait des caractéristiques VAE et VGGT, puis aligne la représentation latente du modèle dessus. Avec un backbone compact de 345 millions de paramètres, le système atteint 93,9% de réussite sur LIBERO, 4,47 sur CALVIN, et 54% de succès moyen sur robot réel en situation d'occlusion, soit 32 points de plus que la meilleure méthode instruction-agnostique comparée. Le code sera publié en open source. Le résultat vise un problème concret pour les intégrateurs déployant bras manipulateurs ou humanoïdes: les démonstrations de laboratoire s'effondrent souvent dès que l'objet à saisir est partiellement caché par un carton, une pièce voisine ou l'angle de la caméra. En conditionnant la représentation 3D sur l'objet réellement visé plutôt que sur la scène entière, Mind-VLA cible directement l'écart entre démo et réalité industrielle. Le gain de 32 points obtenu sur robot réel, pas seulement en simulation, compte dans un domaine où les progrès annoncés reposent souvent sur des vidéos sélectionnées ou des métriques peu transposables. Mind-VLA s'inscrit dans la lignée des travaux sur l'alignement géométrique des VLA, qui injectent une compréhension 3D explicite dans des modèles entraînés sur images et texte, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sans qu'aucun ne cible spécifiquement l'objet d'intérêt. Le résumé ne nomme pas la méthode instruction-agnostique servant de référence, ce qui invite à la prudence tant que l'article complet et le code promis ne sont pas vérifiables. La piste, aligner la représentation sur l'objet désigné plutôt que sur toute la scène, devrait néanmoins intéresser d'autres laboratoires travaillant sur la manipulation fine.

RechercheOpinion
1 source