Aller au contenu principal
Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace
IA physiquearXiv cs.RO 

Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UEPourquoi ça compte

Une équipe de chercheurs propose, dans un preprint arXiv (référence 2603.06480, version 2, 2026), un framework de pruning spatio-temporel des tokens visuels conçu pour réduire la latence d'inférence des modèles Vision-Language-Action (VLA) appliqués à la navigation robotique guidée par langage naturel (Vision-Language Navigation, VLN). L'approche est sans réentraînement : elle ne modifie pas les poids des modèles sources et s'intègre en plug-and-play dans tout pipeline VLA existant. Deux mécanismes la composent : une sélection spatiale des tokens sur la vue courante, pilotée par les scores d'attention interne du modèle, et une compression spatio-temporelle des mémoires visuelles historiques accumulées au fil du déplacement. Les expériences sur les benchmarks VLN standards montrent une supériorité sur les stratégies de pruning existantes, y compris sous compression extrême où la majorité des tokens sont éliminés. Un déploiement en conditions réelles sur un robot quadrupède commercial Unitree Go2 valide la fiabilité et la faible latence du suivi d'instructions.

Le verrou industriel que cette méthode adresse est bien identifié : les grands modèles VLA, dont les performances sur benchmark sont désormais reconnues (Pi-0 de Physical Intelligence, GR00T N2 de Nvidia), génèrent des délais d'inférence souvent incompatibles avec un déploiement embarqué en temps réel. Ni la quantification post-training ni la distillation de modèles ne permettent d'éviter un réentraînement coûteux, ce qui freine l'industrialisation. La compatibilité plug-and-play de cette approche constitue un levier concret pour les intégrateurs souhaitant réduire le délai entre prototype de recherche et déploiement terrain, sans dépendance à l'équipe ayant entraîné le modèle source.

La VLN est l'une des capacités les plus exigeantes de la robotique embodied, car elle suppose qu'un robot navigue dans un espace non balisé en interprétant des consignes verbales ambiguës et changeantes, sans cartographie prédéfinie. Le Unitree Go2, quadrupède commercialisé à moins de 20 000 dollars par Unitree Robotics (Shenzhen, Chine), s'est imposé comme un banc de test de référence dans la recherche académique grâce à son coût d'accès. Les approches concurrentes pour atténuer la latence des VLA, dont l'attention sparse et la distillation, restent plus intrusives sur les architectures sources. Les prochaines étapes logiques incluront l'extension du framework à des modèles VLA plus larges et à des scénarios de navigation longue distance en environnement extérieur non contrôlé.

💬 Le point de vue du dev

Les grands modèles VLA (Pi-0, GR00T...) cartonnent sur benchmark, mais tu sais ce que ça donne en temps réel sur du matériel embarqué : latence incompatible, déploiement impossible. Ce framework de pruning corrige ça sans retoucher les poids, plug-and-play, et j'aime qu'ils aient validé sur un Go2 à 20k€ plutôt que dans un labo sous vide. Pour les intégrateurs, c'est enfin une brique qui permet de passer d'un proto de recherche au terrain sans dépendre de l'équipe qui a entraîné le modèle source.

À lire aussi

SparseNav : perception sémantique sparse conditionnée par instruction pour la navigation vision-langage sans entraînement
1arXiv cs.RO 

SparseNav : perception sémantique sparse conditionnée par instruction pour la navigation vision-langage sans entraînement

SparseNav, un système de navigation vision-langage sans entraînement, vient d'être présenté dans un article publié sur arXiv (référence 2609.26408v1). Le framework s'appuie sur un principe de sobriété perceptive plutôt que d'accumulation systématique de sémantique. Il maintient une carte géométrique légère en vue aérienne (BEV) et une mémoire éparse de repères, alimentée uniquement à la demande selon la sous-instruction active. Un gestionnaire d'instructions suit la progression et identifie le repère recherché, puis un mécanisme de perception conditionné par l'instruction déclenche une segmentation à vocabulaire ouvert seulement quand ce repère est visible et que sa position peut orienter la décision suivante. Sans aucun entraînement supplémentaire, SparseNav atteint 42,8% de taux de réussite sur le benchmark R2R-CE et 40,7% sur RxR-CE, sur les splits Val-Unseen. L'équipe l'a aussi déployé sur un robot quadrupède Unitree Go2, équipé d'une caméra RGB-D Intel RealSense D455 pour la cartographie géométrique et l'ancrage des repères, et d'un LiDAR Livox MID-360 pour la localisation, sans carte préconstruite, validant l'approche dans plusieurs environnements intérieurs. L'intérêt pour l'industrie robotique tient au fait que SparseNav évite l'écueil classique des méthodes de VLN basées sur des cartes: accumuler des objets et annotations non pertinents, ce qui alourdit le calcul et brouille la représentation visuo-spatiale exploitée par le modèle vision-langage planificateur. En s'affranchissant de tout entraînement dédié, l'approche réduit le coût d'intégration pour les équipes robotiques qui veulent déployer de la navigation instruite en langage naturel sans pipeline de fine-tuning ni cartographie sémantique dense préalable. Le passage réussi d'un banc d'essai en simulation à un robot réel sans carte préconstruite illustre une piste concrète pour réduire l'écart simulation-réel qui freine encore l'adoption de la navigation VLN en conditions industrielles ou logistiques. Ce travail s'inscrit dans la lignée des recherches sur la navigation vision-langage en environnement continu, un champ où les cartes sémantiques exhaustives sont la norme mais où leur coût de calcul et de maintenance reste un frein. Les benchmarks R2R-CE et RxR-CE servent de référence standard pour comparer ces approches, généralement plus gourmandes en entraînement ou en annotation. Les auteurs présentent des ablations contrôlées pour isoler la contribution de chaque composant du framework, et la démonstration sur Unitree Go2 laisse entrevoir des tests élargis à d'autres plateformes et environnements comme prochaine étape logique.

IA physiquePaper
1 source
AutoSpatial : raisonnement vision-langage pour la navigation sociale des robots humanoïdes par apprentissage spatial efficace
2arXiv cs.RO 

AutoSpatial : raisonnement vision-langage pour la navigation sociale des robots humanoïdes par apprentissage spatial efficace

Une équipe de recherche a publié AutoSpatial (arXiv:2503.07557), une méthode destinée à améliorer la capacité des modèles de vision-langage (VLM) à raisonner dans l'espace pour la navigation sociale des robots, c'est-à-dire la capacité d'un robot à se déplacer en présence d'humains de façon naturelle et sûre. La technique combine une supervision manuelle minimale avec un étiquetage automatique à grande échelle de paires de questions-réponses visuelles (VQA). Un protocole d'entraînement en deux rounds hiérarchiques permet au modèle d'acquérir à la fois une compréhension globale d'une scène et une analyse fine des détails. L'évaluation a mobilisé trois juges LLM (GPT-4o, Gemini 2.0 Flash et Claude 3.5 Sonnet) en validation croisée, complétés par des évaluateurs humains. Les gains mesurés sur les bases de référence sont de +10,71% en perception et prédiction, +16,26% en raisonnement, +20,50% en sélection d'action et +18,73% en capacité d'explication, par rapport à des modèles entraînés uniquement sur données annotées manuellement. Le résultat le plus pertinent pour les intégrateurs et les décideurs industriels est celui sur l'action : +20,50%, qui est le composant directement lié au comportement réel du robot. Le goulot d'étranglement classique de la navigation sociale reste l'annotation manuelle, coûteuse et peu scalable. AutoSpatial propose une voie d'auto-étiquetage qui réduit significativement ce frein, ce qui ouvre la possibilité de monter en volume de données sans exploser les coûts. Cela renforce également l'hypothèse que les VLA (Vision-Language-Action models) peuvent progresser par la donnée synthétique plutôt que par la seule supervision humaine. Un point de prudence méthodologique : les scores de performance sont évalués par d'autres LLM, ce qui introduit un biais circulaire potentiel que l'article ne discute pas en profondeur. La navigation sociale est un problème ouvert depuis plusieurs années, au croisement de la robotique de service et des modèles fondation. Les VLM ont montré des lacunes persistantes en raisonnement spatial, notamment pour estimer des distances, anticiper les trajectoires humaines ou interpréter des scènes encombrées. AutoSpatial s'inscrit dans une dynamique plus large incluant des travaux comme RT-2, OpenVLA ou le récent GR00T N2 de NVIDIA, qui cherchent tous à injecter du raisonnement langagier dans la boucle de contrôle robot. La méthode présentée reste pour l'instant un résultat de recherche sans déploiement terrain annoncé. Les prochaines étapes naturelles seraient une validation dans des environnements réels peuplés et une comparaison directe avec des architectures VLA de type diffusion comme Pi-0 de Physical Intelligence.

IA physiqueActu
1 source
VeriSpace : une méthode de vérification spatiale des actions pour les modèles vision-langage-action
3arXiv cs.RO 

VeriSpace : une méthode de vérification spatiale des actions pour les modèles vision-langage-action

Un préprint déposé sur arXiv le 10 juin 2026 (identifiant 2606.10568) présente VeriSpace, un vérificateur d'actions tridimensionnel conçu pour renforcer la fiabilité des modèles VLA (Vision-Language-Action) en robotique de manipulation. Ces modèles interprètent une scène visuelle et un objectif en langage naturel pour générer des commandes motrices, mais souffrent d'une limite structurelle : la prédiction se fait en un seul coup, sans réévaluation avant exécution. La moindre imprécision sur la position de préhension peut provoquer un échec de saisie, une collision ou une progression erronée dans la tâche. VeriSpace propose une vérification au moment du test (test-time verification) : le système génère plusieurs actions candidates que le vérificateur évalue avant d'en sélectionner une pour exécution. Il s'appuie sur deux composants : un encodage de scène à double chemin intégrant la géométrie 3D explicite (Dual-Path 3D-Injected Scene Encoding), et un raisonnement spatial sur les relations géométriques, la validité de chaque action et sa progression attendue vers l'objectif. Les expériences couvrent des benchmarks publics et des tâches de manipulation réelles, avec des gains rapportés en distribution et hors distribution, bien que les valeurs précises ne figurent pas dans le résumé du preprint. Cette approche répond à une fragilité bien documentée : les VLA, malgré les progrès de modèles comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), restent vulnérables dès que la scène présente une ambiguïté géométrique subtile. La vérification au test-time n'est pas une idée nouvelle, mais VeriSpace la rend opérationnelle sur des scènes 3D réelles, là où les approches précédentes peinent à distinguer des actions candidates géométriquement proches aux conséquences pourtant très différentes. Son mode d'intégration plug-in, compatible avec les politiques VLA existantes sans modification, facilite l'adoption dans des pipelines déjà déployés. Pour les équipes robotique industrielle, c'est un mécanisme potentiellement utile pour réduire les taux d'échec sans requalifier les modèles sous-jacents. Le contexte est celui d'une compétition intense autour de la robustesse des VLA. Physical Intelligence, Google DeepMind (RT-2), NVIDIA et plusieurs équipes académiques de Berkeley, Stanford et CMU investissent massivement dans la généralisation et la réduction du sim-to-real gap. La vérification d'actions au test-time est une direction en émergence, distincte du fine-tuning continu ou de l'augmentation de données d'entraînement. VeriSpace reste pour l'instant au stade de préprint académique, sans annonce de déploiement industriel ni partenariat commercial associé. Les prochaines étapes naturelles seraient une évaluation chiffrée sur des benchmarks standardisés comme RoboSuite ou Open X-Embodiment, et une intégration dans des pipelines open-source pour validation par la communauté.

IA physiqueOpinion
1 source
GemNav : navigation robotique visuelle par tokens discrets via un grand modèle de langage multimodal
4arXiv cs.RO 

GemNav : navigation robotique visuelle par tokens discrets via un grand modèle de langage multimodal

GemNav, une nouvelle politique de navigation visuelle pour robots, s'écarte de la recette habituelle du secteur : un encodeur visuel dédié, une tête d'action sur mesure, et un entraînement sur des milliers d'heures de données cross-embodiment. À la place, l'équipe adapte un Modèle de Langage Multimodal (MLLM) figé via LoRA appliqué uniquement à la tour langage, sans encodeur visuel auxiliaire ni tête de régression continue. Les waypoints et les signaux de navigation catégoriels partagent un unique vocabulaire de tokens discrets généré par la tête du modèle de langage, et une perte auxiliaire "soft-decoded" permet de récupérer la structure métrique que l'entropie croisée pure perdrait autrement. Entraîné sur un seul corpus ouvert de 8,7 heures, soit environ mille fois moins de données que les jeux d'entraînement concurrents, GemNav transfère en zero-shot vers quatre environnements physiquement distincts et inédits. Sur 20 essais réels, le robot s'arrête entre 0,25 et 0,42 mètre de l'objectif, couvrant un parking extérieur, un parking avec obstacles, une longue cour industrielle chimique en extérieur et un entrepôt intérieur. Ce résultat pèse sur un débat central de la robotique fondée sur les modèles de fondation : faut-il vraiment des encodeurs visuels spécialisés et des volumes massifs de données pour obtenir une navigation robuste et généralisable ? En montrant qu'une simple adaptation par tokens discrets d'un MLLM déjà pré-entraîné suffit à atteindre une précision d'arrivée sous le demi-mètre sur des terrains variés jamais vus à l'entraînement, GemNav suggère une voie plus économe en données et en calcul pour déployer des politiques de navigation, un argument qui parlera directement aux intégrateurs et décideurs B2B soucieux du coût d'entraînement et de collecte de données. L'étude apporte aussi une nuance utile : ajouter un historique d'images courtes améliore les métriques hors ligne mais n'apporte aucun bénéfice mesurable sur le robot réel, ce qui indique un plafond sur l'utilité du contexte temporel une fois que les features visuelles pré-entraînées sont en place. Le travail s'inscrit dans la lignée des politiques de navigation dites "VLA" (vision-language-action) qui cherchent à réutiliser des modèles de fondation existants plutôt que d'entraîner des architectures spécialisées from scratch, une tendance également explorée par des approches comme GR00T N2 ou Pi-0 dans le domaine de la manipulation. En limitant drastiquement la taille du corpus d'entraînement nécessaire, GemNav ouvre la voie à des déploiements plus rapides et moins coûteux pour des flottes de robots mobiles autonomes (AMR) en environnement industriel ou logistique, même si la validation reste pour l'instant limitée à des essais ponctuels plutôt qu'à un déploiement à grande échelle.

IA physiqueOpinion
1 source