Pointing-VLA : interfaces d'ancrage spatial typées pour la manipulation vision-langage-action
Des chercheurs ont publié le 23 août 2026 sur arXiv (2608.23138) Pointing-VLA, une architecture bâtie sur Embodied-R1 qui remplace les coordonnées textuelles et les jetons d'action opaques par des têtes de réseau dédiées prédisant directement des points normalisés, des cartes d'ancrage fonctionnel des objets (OFG) et des trajectoires visuelles ; un contrat d'exécution assigne la prise (PICK) à l'OFG et la dépose (PLACE) au pointage. Sur le banc Bridge/WidowX, sous exécution CuRobo avec gestion des collisions, le système atteint un score état de l'art de 72,9% de réussite moyenne sur quatre tâches, sans réglage spécifique. Transféré à NORA-1.5, il réduit de plus de 20 fois le temps de contrôleur en préservant la performance, avec des têtes typées 6,68 à 6,90 fois plus rapides que le décodage textuel d'Embodied-R1. Couplé à une politique π0.5, il porte le taux de réussite autonome sur robot réel de 52,7% à 80,7% sur trois contextes visuels.
Le résultat vise un point de friction connu des modèles VLA : la plupart expriment encore les cibles spatiales via des coordonnées textuelles générées token par token, une interface lente et fragile entre raisonnement multimodal et exécution robotique. En la remplaçant par des têtes géométriques inspectables, Pointing-VLA promet aux intégrateurs un gain de latence important sans perte de fiabilité. Le saut de 52,7% à 80,7% en conditions réelles touche directement l'écart persistant entre démonstrations en environnement contrôlé et déploiement effectif, un enjeu central pour qui veut commercialiser des politiques VLA plutôt que les montrer en vidéo ; ces chiffres restent issus des propres bancs d'essai des auteurs et demandent confirmation sur des scénarios industriels plus variés.
Le travail s'inscrit dans la lignée des modèles vision-langage-action comme GR00T N2, Helix ou Pi-0, qui traduisent des instructions en langage naturel en commandes motrices pour bras et humanoïdes. Pointing-VLA se positionne en alternative aux interfaces par coordonnées textuelles héritées des grands modèles de langage, s'appuyant sur Embodied-R1 et démontrant sa portabilité vers NORA-1.5 et son intégration comme guidage pour π0.5. Il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, validée sur Bridge/WidowX et sur des déploiements physiques de prise-dépose, sans annonce de partenariat industriel ni de calendrier de commercialisation, mais ouvrant la voie à des évaluations sur d'autres politiques et plateformes robotiques.
Dans nos dossiers




