
DeicticVLA : unifier les instructions vocales et gestuelles dans un seul modèle VLA
Des chercheurs présentent DeicticVLA (arXiv:2608.28108v1), un modèle vision-langage-action (VLA) unifiant trois modes d'instruction dans une seule politique préentraînée : le langage pur (LI), le vision-langage (VLI), et l'instruction visuelle par gestes déictiques comme le pointage (VI). La méthode convertit ces trois formats en un prompt textuel commun associé à des masques déictiques, appris par un backbone partagé avec les mêmes démonstrations. Après comparaison en simulation de deux méthodes de prompting visuel RGB, deux méthodes de masquage et trois stratégies d'entraînement, les auteurs valident l'approche sur trois tâches robotiques réelles avec une seule politique gérant les trois modes. Sur des catégories d'objets jamais vues, VLI et VI atteignent 100 % de réussite contre seulement 16,7 % pour une politique LI classique, et un entraînement en deux étapes améliore l'usage des masques dans des configurations inédites.
Ce résultat cible une friction concrète pour l'industrie : distinguer "la boîte" parmi plusieurs objets identiques, ou désigner un point de pose précis, exige des descriptions détaillées que les VLA actuels suivent mal face à des objets ou formulations absents de l'entraînement. En montrant qu'une seule politique gère sans réentraînement le langage, le pointage et leur combinaison, DeicticVLA comble un écart souvent cité entre démonstrations scriptées et usage réel, où les opérateurs pointent naturellement plutôt que de formuler des phrases exhaustives. Pour les intégrateurs de bras manipulateurs en tri ou assemblage à forte variabilité d'objets, cela ouvre une voie pour réduire l'ingénierie de prompt. L'écart de 100 % contre 16,7 % pointe directement la fragilité hors distribution reprochée aux VLA entraînés seulement sur texte.
Ces travaux s'inscrivent dans une recherche plus large visant à rendre les VLA plus robustes, alors que des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont déjà montré la capacité de ces architectures à généraliser des tâches de manipulation par langage naturel, sans toujours lever l'ambiguïté entre objets similaires. DeicticVLA intègre le geste comme canal d'instruction à part entière, plutôt que comme simple ajout au langage. L'étude reste un travail de recherche publié sur arXiv, validé en simulation et sur trois tâches physiques seulement, non un produit déployé ; les auteurs le présentent comme des lignes directrices de conception plutôt qu'un système prêt à l'intégration.
Dans nos dossiers




