Aller au contenu principal
Pointing-VLA : interfaces d'ancrage spatial typées pour la manipulation vision-langage-action
IA physiquearXiv cs.RO 

Pointing-VLA : interfaces d'ancrage spatial typées pour la manipulation vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 23 août 2026 sur arXiv (2608.23138) Pointing-VLA, une architecture bâtie sur Embodied-R1 qui remplace les coordonnées textuelles et les jetons d'action opaques par des têtes de réseau dédiées prédisant directement des points normalisés, des cartes d'ancrage fonctionnel des objets (OFG) et des trajectoires visuelles ; un contrat d'exécution assigne la prise (PICK) à l'OFG et la dépose (PLACE) au pointage. Sur le banc Bridge/WidowX, sous exécution CuRobo avec gestion des collisions, le système atteint un score état de l'art de 72,9% de réussite moyenne sur quatre tâches, sans réglage spécifique. Transféré à NORA-1.5, il réduit de plus de 20 fois le temps de contrôleur en préservant la performance, avec des têtes typées 6,68 à 6,90 fois plus rapides que le décodage textuel d'Embodied-R1. Couplé à une politique π0.5, il porte le taux de réussite autonome sur robot réel de 52,7% à 80,7% sur trois contextes visuels.

Le résultat vise un point de friction connu des modèles VLA : la plupart expriment encore les cibles spatiales via des coordonnées textuelles générées token par token, une interface lente et fragile entre raisonnement multimodal et exécution robotique. En la remplaçant par des têtes géométriques inspectables, Pointing-VLA promet aux intégrateurs un gain de latence important sans perte de fiabilité. Le saut de 52,7% à 80,7% en conditions réelles touche directement l'écart persistant entre démonstrations en environnement contrôlé et déploiement effectif, un enjeu central pour qui veut commercialiser des politiques VLA plutôt que les montrer en vidéo ; ces chiffres restent issus des propres bancs d'essai des auteurs et demandent confirmation sur des scénarios industriels plus variés.

Le travail s'inscrit dans la lignée des modèles vision-langage-action comme GR00T N2, Helix ou Pi-0, qui traduisent des instructions en langage naturel en commandes motrices pour bras et humanoïdes. Pointing-VLA se positionne en alternative aux interfaces par coordonnées textuelles héritées des grands modèles de langage, s'appuyant sur Embodied-R1 et démontrant sa portabilité vers NORA-1.5 et son intégration comme guidage pour π0.5. Il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, validée sur Bridge/WidowX et sur des déploiements physiques de prise-dépose, sans annonce de partenariat industriel ni de calendrier de commercialisation, mais ouvrant la voie à des évaluations sur d'autres politiques et plateformes robotiques.

À lire aussi

SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage
1arXiv cs.RO 

SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage

Des chercheurs ont déposé SSI-Policy sur arXiv (2606.26800, juin 2026), un framework modulaire pour la manipulation robotique en régime de faibles données. Le système repose sur une représentation intermédiaire appelée Structured Scene Interface (SSI), une couche RGB-only qui encode simultanément des caractéristiques de profondeur monoculaire, des dispositions spatiales d'objets ancrées dans le langage naturel, et des trajectoires 2D conditionnées par instruction. Sur le benchmark LIBERO avec seulement 10 démonstrations par tâche, SSI-Policy dépasse la meilleure méthode concurrente de près de 15 points, et reste compétitif face aux approches à 50 démonstrations recourant au préentraînement externe à large échelle. Les auteurs valident également sur 13 tâches réelles : raisonnement spatial, transfert cross-embodiment et manipulation avec contact. L'apport central est architectural : en découplant la perception du contrôle via l'interface SSI, la politique aval peut apprendre à partir de très peu de démonstrations. Que l'interface soit entraînable sur des vidéos sans annotation d'action est particulièrement précieux pour les intégrateurs industriels qui peinent à collecter des données de téléopération à grande échelle. L'absence de capteur de profondeur, le système fonctionnant en pure RGB, réduit les prérequis matériels et facilite le déploiement sur des bras standards. Le caractère robot-agnostique de SSI cible directement la faiblesse récurrente des VLA (Vision-Language Action models) comme Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA : leur difficulté à transférer vers de nouveaux embodiments sans réentraînement coûteux. SSI-Policy se positionne face à trois familles de méthodes : les approches vidéo (SuSIE, UniSim), sujettes à dérive géométrique sur les horizons longs ; les méthodes 3D (Act3D, RoboPoint), qui exigent du RGB-D ; et les interfaces de flux optique, sans structure géométrique explicite. SSI-Policy prétend en combiner les avantages, affirmation partiellement étayée par les ablations publiées mais restant à confirmer sur des benchmarks plus larges comme RLBench ou DROID. L'article est un preprint, non soumis à évaluation par les pairs. La suite logique : validation sur plateformes humanoïdes complètes et pilotes industriels réels, deux domaines où la robustesse en faible nombre d'exemples reste le verrou commercial principal.

IA physiqueOpinion
1 source
VP-VLA : le prompting visuel comme interface pour les modèles vision-langage-action
2arXiv cs.RO 

VP-VLA : le prompting visuel comme interface pour les modèles vision-langage-action

Publiée en mars 2026 sur arXiv (référence 2603.22003v3), VP-VLA est une architecture à deux systèmes qui dissocie raisonnement de haut niveau et exécution motrice dans les modèles Vision-Language-Action. Le problème adressé est structurel : les VLA actuels effectuent un unique passage en avant (forward pass) censé gérer simultanément l'interprétation d'instructions, l'ancrage spatial et le contrôle moteur de bas niveau, ce qui dégrade la précision spatiale et la robustesse hors distribution. VP-VLA sépare ces responsabilités via une interface de prompts visuels : un "Planificateur Système 2" décompose les instructions en sous-tâches et localise objets et positions cibles, puis rend ces ancres spatiales directement dans l'espace RGB natif sous forme de réticules et boîtes englobantes. Un "Contrôleur Système 1", entraîné avec un objectif auxiliaire d'ancrage visuel, génère ensuite les trajectoires de bas niveau à partir de ces prompts. En simulation et en environnement réel, VP-VLA surpasse les baselines end-to-end QwenOFT (basé sur les modèles Qwen d'Alibaba) et GR00T-N1.6 (NVIDIA), les deux références industrielles les plus avancées du moment. L'intérêt architectural tient à l'évitement du mismatch de modalité que créent les représentations intermédiaires denses -- masques d'affordance, cartes de contrôle spécialisées -- qui obligent les modèles à jongler entre espaces de représentation hétérogènes. En substituant des annotations légères directement dans l'espace RGB natif, VP-VLA maintient une cohérence de modalité tout au long du pipeline. Pour les intégrateurs industriels et les équipes de déploiement robotique, cela se traduit concrètement par une meilleure robustesse aux configurations non vues à l'entraînement et une précision spatiale accrue sur les tâches de manipulation. La séparation explicite planification/exécution faciliterait aussi la mise à jour ou le remplacement indépendant de chaque composant, un avantage non négligeable en contexte de déploiement itératif. VP-VLA s'inscrit dans un mouvement plus large de déconstruction des VLA monolithiques, après RT-2, OpenVLA, et les architectures GR00T de NVIDIA. La publication en version v3 indique des révisions successives, signe probable d'une soumission à une conférence de premier rang (IROS 2026, CoRL 2026 ou RSS 2026). Le choix de GR00T-N1.6 et QwenOFT comme baselines positionne explicitement VP-VLA face aux approches portées par des acteurs industriels majeurs. Aucun déploiement physique industriel ni partenariat de production n'est annoncé à ce stade : les expériences réelles restent en environnement de laboratoire. La page projet ouverte (visualprompt-vla.github.io) laisse présager une publication du code, ce qui favoriserait une adoption rapide et une validation indépendante par la communauté robotique.

UELes laboratoires européens actifs en VLA (INRIA, CEA-List) pourraient bénéficier d'une architecture open-source plus robuste hors distribution si le code est publié, mais aucun acteur ou déploiement européen n'est impliqué à ce stade.

IA physiqueOpinion
1 source
S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon
3arXiv cs.RO 

S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon

Un groupe de chercheurs a publié S²-VLA (State-Space Guided Vision-Language-Action), une architecture destinée à résoudre l'une des limitations structurelles des modèles VLA en manipulation robotique : la dégradation des performances sur les tâches longues due à la propagation cumulative des erreurs. Le coeur du système est le mécanisme SSGAA (State-Space Guided Adaptive Attention), qui maintient un "état de croyance" (belief state) actualisé à chaque étape de la tâche et génère des poids de fusion dynamiques, là où les architectures VLA existantes utilisent des poids fixes. Ces poids adaptatifs combinent trois sources : les caractéristiques visuelles pour la perception spatiale, les intentions de haut niveau pour la planification, et les séquences d'actions temporelles pour la cohérence d'exécution. Avec 2 milliards de paramètres seulement, S²-VLA surpasse des modèles de 7 milliards sur les benchmarks LIBERO et SimplerEnv, deux références pour l'évaluation des tâches de manipulation longue séquence. Le résultat le plus saillant est l'efficacité paramétrique : battre des modèles 7B avec un modèle 2B remet en question l'hypothèse selon laquelle la performance sur des tâches complexes serait avant tout une affaire de scaling. Pour les intégrateurs industriels et les équipes déployant des robots manipulateurs, cela ouvre la voie à une inférence embarquée sur des plateformes aux ressources limitées. Sur le plan de la recherche, le papier formalise un point de friction bien identifié : la fusion statique des représentations visuelles, linguistiques et motrices crée une rigidité qui amplifie les erreurs au fil des étapes. L'emprunt aux modèles d'espace d'états (State Space Models, d'où "S²") pour introduire une mémoire adaptative dans la fusion est l'apport architectural central. Les modèles VLA ont connu une accélération significative depuis 2024, avec Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA) comme jalons récents, tous confrontés à la même limite sur les longs horizons de tâches. S²-VLA s'inscrit dans un courant de recherche cherchant à résoudre ce "long-horizon gap" par l'architecture plutôt que par l'échelle. Le papier est disponible sur arXiv (référence 2606.27872v1) et reste un preprint non évalué par les pairs : les résultats annoncés sont à confirmer indépendamment. Aucun code ni dataset n'est encore annoncé publiquement, et les affiliations institutionnelles des auteurs ne figurent pas dans le résumé disponible.

💬 Un modèle de 2 milliards qui bat des modèles de 7 milliards sur les tâches longues, c'est le genre de résultat qui remet en question l'obsession du scaling. L'astuce : une attention adaptative qui maintient un état de croyance continu entre chaque étape de la tâche, là où les VLA existants utilisent encore des poids fixes et accumulent les erreurs au fil des actions. C'est un preprint sans code pour l'instant, mais si ça se confirme, les robots embarqués sur hardware limité deviennent soudainement une option sérieuse.

IA physiqueOpinion
1 source
sensVLA : un modèle vision-langage-action à ancrage spatial pour chargeuse à roues autonome
4arXiv cs.RO 

sensVLA : un modèle vision-langage-action à ancrage spatial pour chargeuse à roues autonome

Un article de recherche publié sur arXiv le 17 septembre 2026 (référence 2609.17021) présente sensVLA, un modèle Vision-Language-Action (VLA) conçu pour piloter de façon autonome une chargeuse sur roues. L'architecture combine un modèle vision-langage Qwen3-2B avec un "action expert" transformer entièrement entraînable, optimisé par régression de vitesse en flow-matching. Particularité du système : les données lidar avant et arrière sont fusionnées en une carte en vue aérienne (Bird's-Eye-View) acheminée directement vers l'action expert via un canal de cross-attention dédié, tandis que le VLM ne traite que les flux vidéo RGB avant/arrière pour fournir le contexte sémantique de la tâche. Le modèle prédit six dimensions d'action : vitesse longitudinale, braquage, déplacement dans le référentiel du châssis, vitesse du bras et vitesse du godet. Testé sur un jeu de données réel issu d'une chargeuse, sensVLA égale une base de référence caméra seule en précision globale par pas de temps, réduit de 28% l'erreur RMSE sur la vitesse longitudinale et de 9% l'erreur de déplacement sur les scénarios de chargement. Quand le flux caméra est corrompu ou supprimé, la dégradation de performance est 29% moindre qu'avec un système sans lidar. Pour l'industrie des engins de chantier et de manutention, ce travail illustre une tendance clé : ajouter un ancrage spatial explicite via lidar et BEV à des architectures VLA pensées à l'origine pour la vision monoculaire améliore la précision, mais surtout la tolérance aux pannes, un critère décisif pour des équipements lourds opérant en extérieur, dans la poussière ou avec occlusion de caméra. Cela nuance l'hypothèse selon laquelle des VLA purement caméra suffiraient à généraliser à toutes les formes de robotique physique : pour des machines à fort payload et cinématique complexe comme une chargeuse, la fusion multimodale avec géométrie 3D explicite reste nécessaire. Pour les intégrateurs et décideurs B2B du BTP et des mines, c'est un signal que l'autonomie des engins lourds progresse sur des bases académiques solides, mais reste au stade recherche : les résultats reposent sur un seul jeu de données réel, sans précision sur le volume d'heures d'opération ni sur un déploiement en production. Ce travail s'inscrit dans la vague plus large des modèles VLA appliqués à la robotique physique, popularisée par des systèmes comme Pi-0 ou GR00T N2 pour la manipulation en bras robotique, mais ici transposée à un engin de chantier à fort tonnage et six degrés de liberté d'action, un segment encore peu couvert par une littérature VLA dominée par les manipulateurs et les humanoïdes. L'article ne précise ni affiliation institutionnelle claire, ni partenaire industriel, ni calendrier de déploiement pilote, ce qui le situe pour l'instant comme une preuve de concept académique plutôt qu'un produit prêt à l'emploi. Il ouvre néanmoins une piste concrète pour les fabricants d'équipements lourds et les fournisseurs de kits d'autonomie rétrofit, susceptibles de s'appuyer sur cette architecture hybride lidar-caméra pour renforcer la robustesse de leurs piles de perception, alors que la course à l'autonomie s'étend au-delà des humanoïdes vers les machines industrielles spécialisées.

IA physiqueOpinion
1 source