Aller au contenu principal
SparseNav : perception sémantique sparse conditionnée par instruction pour la navigation vision-langage sans entraînement
IA physiquearXiv cs.RO 

SparseNav : perception sémantique sparse conditionnée par instruction pour la navigation vision-langage sans entraînement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SparseNav, un système de navigation vision-langage sans entraînement, vient d'être présenté dans un article publié sur arXiv (référence 2609.26408v1). Le framework s'appuie sur un principe de sobriété perceptive plutôt que d'accumulation systématique de sémantique. Il maintient une carte géométrique légère en vue aérienne (BEV) et une mémoire éparse de repères, alimentée uniquement à la demande selon la sous-instruction active. Un gestionnaire d'instructions suit la progression et identifie le repère recherché, puis un mécanisme de perception conditionné par l'instruction déclenche une segmentation à vocabulaire ouvert seulement quand ce repère est visible et que sa position peut orienter la décision suivante. Sans aucun entraînement supplémentaire, SparseNav atteint 42,8% de taux de réussite sur le benchmark R2R-CE et 40,7% sur RxR-CE, sur les splits Val-Unseen. L'équipe l'a aussi déployé sur un robot quadrupède Unitree Go2, équipé d'une caméra RGB-D Intel RealSense D455 pour la cartographie géométrique et l'ancrage des repères, et d'un LiDAR Livox MID-360 pour la localisation, sans carte préconstruite, validant l'approche dans plusieurs environnements intérieurs.

L'intérêt pour l'industrie robotique tient au fait que SparseNav évite l'écueil classique des méthodes de VLN basées sur des cartes: accumuler des objets et annotations non pertinents, ce qui alourdit le calcul et brouille la représentation visuo-spatiale exploitée par le modèle vision-langage planificateur. En s'affranchissant de tout entraînement dédié, l'approche réduit le coût d'intégration pour les équipes robotiques qui veulent déployer de la navigation instruite en langage naturel sans pipeline de fine-tuning ni cartographie sémantique dense préalable. Le passage réussi d'un banc d'essai en simulation à un robot réel sans carte préconstruite illustre une piste concrète pour réduire l'écart simulation-réel qui freine encore l'adoption de la navigation VLN en conditions industrielles ou logistiques.

Ce travail s'inscrit dans la lignée des recherches sur la navigation vision-langage en environnement continu, un champ où les cartes sémantiques exhaustives sont la norme mais où leur coût de calcul et de maintenance reste un frein. Les benchmarks R2R-CE et RxR-CE servent de référence standard pour comparer ces approches, généralement plus gourmandes en entraînement ou en annotation. Les auteurs présentent des ablations contrôlées pour isoler la contribution de chaque composant du framework, et la démonstration sur Unitree Go2 laisse entrevoir des tests élargis à d'autres plateformes et environnements comme prochaine étape logique.

Dans nos dossiers

À lire aussi

Raisonnement par modèle vision-langage pour la cartographie sémantique contextuelle en intralogistique
1arXiv cs.RO 

Raisonnement par modèle vision-langage pour la cartographie sémantique contextuelle en intralogistique

Des chercheurs ont publié le 24 juin 2026 (arXiv:2606.24814v1) un pipeline de cartographie sémantique contextuelle destiné aux robots mobiles autonomes (AMR) opérant en environnements intralogistiques. Le système enchaîne quatre briques : cartographie géométrique par SLAM, segmentation d'instances via SAM (Segment Anything Model de Meta), clustering d'instances multi-vues, puis raisonnement contextuel par un modèle vision-langage (VLM) interrogé en mode zero-shot à vocabulaire ouvert. L'application démontrée porte sur l'estimation de la mobilité des objets -- distinguer ce qui peut être déplacé de ce qui est fixe. Sur les benchmarks rapportés, le pipeline atteint 98,93 % de mIoU en classification sémantique et 89,17 % de précision (mAcc) pour l'estimation de mobilité. Trois VLMs distincts ont été évalués selon deux stratégies de prompting, et une analyse composant par composant complète les résultats. L'enjeu industriel est direct : les AMR en entrepôt naviguent aujourd'hui sur des cartes purement géométriques -- ils localisent les obstacles mais ignorent leur nature et leur statut. Un robot ne distingue pas une palette temporaire d'un rayonnage fixe, ni une cage de manutention mobile d'une infrastructure permanente. Ce travail démontre qu'un VLM généraliste, sans entraînement supervisé ni ontologie prédéfinie, peut inférer ces propriétés contextuelles à partir d'observations multi-vues agrégées. Pour un intégrateur ou un COO d'entrepôt, cela signifie potentiellement une planification de trajectoire et une gestion des obstacles plus robuste face aux environnements dynamiques -- sans reconfiguration manuelle de la carte à chaque réorganisation du sol. Il faut noter que le 89 % de précision sur la mobilité reste perfectible, et que les chercheurs eux-mêmes identifient le raisonnement VLM comme le goulot principal, non la perception bas niveau. Le secteur de l'intralogistique autonome regroupe des acteurs comme Exotec (FR, systèmes Skypod), Mobile Industrial Robots (MiR, groupe Teradyne), Geek+ ou Boston Dynamics (Stretch). La cartographie sémantique y est un problème ouvert depuis plusieurs années : les approches antérieures exigeaient des ontologies d'objets prédéfinies ou un fine-tuning supervisé coûteux pour chaque nouvel environnement. L'utilisation de SAM et de VLMs généralistes en zero-shot s'inscrit dans une tendance plus large -- portée aussi par des travaux comme SayPlan ou ConceptGraphs -- qui cherche à rendre les robots industriels reconfigurables sans réentraînement. Les auteurs ne mentionnent pas de déploiement réel ni de partenaire industriel associé ; il s'agit à ce stade d'un résultat de laboratoire, validé en simulation ou environnement contrôlé, dont la robustesse en entrepôt opérationnel reste à démontrer.

UEExotec (FR) et les intégrateurs AMR européens sont directement concernés : cette approche zero-shot pourrait rendre leurs flottes reconfigurables sans réentraînement coûteux à chaque réorganisation d'entrepôt, sous réserve de validation en environnement opérationnel réel.

💬 Un robot qui distingue une palette temporaire d'un rayonnage fixe sans entraînement supervisé, c'est le chaînon manquant pour que les flottes AMR s'adaptent enfin à l'entrepôt réel, pas à l'entrepôt figé du jour de la mise en service. Le 89 % de précision sur la mobilité, c'est encore loin du prod. Mais zéro ontologie prédéfinie, zéro fine-tuning, ça change le calcul pour un intégrateur comme Exotec qui reconfigurait ses déploiements à la main.

IA physiquePaper
1 source
Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace
2arXiv cs.RO 

Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace

Une équipe de chercheurs propose, dans un preprint arXiv (référence 2603.06480, version 2, 2026), un framework de pruning spatio-temporel des tokens visuels conçu pour réduire la latence d'inférence des modèles Vision-Language-Action (VLA) appliqués à la navigation robotique guidée par langage naturel (Vision-Language Navigation, VLN). L'approche est sans réentraînement : elle ne modifie pas les poids des modèles sources et s'intègre en plug-and-play dans tout pipeline VLA existant. Deux mécanismes la composent : une sélection spatiale des tokens sur la vue courante, pilotée par les scores d'attention interne du modèle, et une compression spatio-temporelle des mémoires visuelles historiques accumulées au fil du déplacement. Les expériences sur les benchmarks VLN standards montrent une supériorité sur les stratégies de pruning existantes, y compris sous compression extrême où la majorité des tokens sont éliminés. Un déploiement en conditions réelles sur un robot quadrupède commercial Unitree Go2 valide la fiabilité et la faible latence du suivi d'instructions. Le verrou industriel que cette méthode adresse est bien identifié : les grands modèles VLA, dont les performances sur benchmark sont désormais reconnues (Pi-0 de Physical Intelligence, GR00T N2 de Nvidia), génèrent des délais d'inférence souvent incompatibles avec un déploiement embarqué en temps réel. Ni la quantification post-training ni la distillation de modèles ne permettent d'éviter un réentraînement coûteux, ce qui freine l'industrialisation. La compatibilité plug-and-play de cette approche constitue un levier concret pour les intégrateurs souhaitant réduire le délai entre prototype de recherche et déploiement terrain, sans dépendance à l'équipe ayant entraîné le modèle source. La VLN est l'une des capacités les plus exigeantes de la robotique embodied, car elle suppose qu'un robot navigue dans un espace non balisé en interprétant des consignes verbales ambiguës et changeantes, sans cartographie prédéfinie. Le Unitree Go2, quadrupède commercialisé à moins de 20 000 dollars par Unitree Robotics (Shenzhen, Chine), s'est imposé comme un banc de test de référence dans la recherche académique grâce à son coût d'accès. Les approches concurrentes pour atténuer la latence des VLA, dont l'attention sparse et la distillation, restent plus intrusives sur les architectures sources. Les prochaines étapes logiques incluront l'extension du framework à des modèles VLA plus larges et à des scénarios de navigation longue distance en environnement extérieur non contrôlé.

💬 Les grands modèles VLA (Pi-0, GR00T...) cartonnent sur benchmark, mais tu sais ce que ça donne en temps réel sur du matériel embarqué : latence incompatible, déploiement impossible. Ce framework de pruning corrige ça sans retoucher les poids, plug-and-play, et j'aime qu'ils aient validé sur un Go2 à 20k€ plutôt que dans un labo sous vide. Pour les intégrateurs, c'est enfin une brique qui permet de passer d'un proto de recherche au terrain sans dépendre de l'équipe qui a entraîné le modèle source.

IA physiqueOpinion
1 source
MapNav : une nouvelle représentation mémoire par cartes sémantiques annotées pour la navigation vision-langage
3arXiv cs.RO 

MapNav : une nouvelle représentation mémoire par cartes sémantiques annotées pour la navigation vision-langage

MapNav est un modèle de navigation guidée par le langage naturel (Vision-and-Language Navigation, VLN) publié sur arXiv (identifiant 2502.13451, version 5). L'idée centrale est de remplacer la mémoire par images historiques, habituellement conservée par les agents VLN pour contextualiser leurs décisions, par une carte sémantique annotée (Annotated Semantic Map, ASM). À chaque épisode de navigation, le système construit une vue de dessus (top-down) de l'environnement, la met à jour à chaque pas de temps, puis y appose des étiquettes textuelles explicites sur les objets et régions clés. Ce flux structuré est ensuite interprété par un modèle vision-langage (VLM) de grande taille dans une architecture end-to-end. Les auteurs annoncent des performances état de l'art sur benchmarks simulés et en environnement réel, et prévoient de publier code source et jeu de données associés. L'apport principal est architectural : substituer les trames brutes par une carte compacte et annotée réduit la charge mémoire et le coût de calcul, deux obstacles concrets à l'embarquement sur plateformes robotiques à ressources limitées. Les étiquettes textuelles directement inscrites sur la carte transforment une représentation abstraite en signal interprétable par un VLM sans reformater les données brutes, ce qui permet d'exploiter le raisonnement des grands modèles de façon plus directe. La validation en environnement réel, si elle est confirmée par des reproductions indépendantes, représenterait un progrès tangible dans la réduction du sim-to-real gap qui pénalise encore la majorité des agents VLN. Pour les intégrateurs de robots de service (logistique, hospitalier, résidentiel), une représentation aussi compacte facilite l'interfaçage avec des systèmes d'instruction en langage naturel. La navigation par instruction verbale en environnement inconnu est un problème de référence depuis le benchmark R2R (Room-to-Room, 2018). Les approches récentes (ETPNav, BEVBert, NavGPT) ont progressivement intégré des cartes métriques et des LLM, mais maintiennent souvent une fenêtre d'historique visuel coûteuse. MapNav s'inscrit dans la lignée des méthodes map-centric tout en capitalisant sur les VLM modernes. Cette publication est un preprint arXiv en cinquième révision, sans affiliation industrielle identifiée, et ses revendications SOTA devront être validées sur benchmarks standardisés par des équipes tierces, étape non négligeable dans une littérature VLN où les comparaisons sont souvent contestées.

IA physiqueOpinion
1 source
AnySlot : politiques vision-langage-action conditionnées par objectif pour le placement zéro-shot par emplacement
4arXiv cs.RO 

AnySlot : politiques vision-langage-action conditionnées par objectif pour le placement zéro-shot par emplacement

Des chercheurs ont publié sur arXiv (référence 2604.10432v3) un framework baptisé AnySlot, conçu pour permettre à des politiques de contrôle robotique de type Vision-Language-Action (VLA) de placer des objets avec précision dans des emplacements discrets, dits "slots", à partir d'instructions en langage naturel. L'approche introduit un objectif visuel intermédiaire : plutôt que de passer directement de la commande textuelle au mouvement moteur, le système génère d'abord un marqueur spatial rendu sur l'image, indiquant l'emplacement cible exact, puis confie l'exécution à une politique VLA conditionnée par ce but visuel. Cette architecture hiérarchique découple la compréhension sémantique de l'instruction et la précision géométrique de l'exécution. Les auteurs introduisent également SlotBench, un benchmark de simulation structuré autour de neuf catégories de tâches, destiné à évaluer le raisonnement spatial dans des scénarios de placement à l'échelle centimétrique. Les expériences montrent qu'AnySlot surpasse les baselines VLA plates et les méthodes de grounding modulaire en conditions zero-shot. Ce travail s'attaque à l'un des verrous les plus concrets des VLA généralistes : la précision de placement sous contraintes compositionnelles. Les politiques end-to-end peinent à combiner compréhension du langage et précision millimétrique, ce qui freine leur utilisation dans des applications industrielles comme l'assemblage, le tri ou la mise en casier. L'introduction d'un "but visuel" explicite comme couche intermédiaire est une réponse architecturale directe au gap sémantique-géométrique, et les résultats zero-shot suggèrent une meilleure généralisation que les approches purement end-to-end ou modulaires. Pour un intégrateur ou un COO industriel, cela signifie potentiellement réduire le coût de spécification des tâches de placement sans sacrifier la fiabilité. Le contexte est celui d'une intense activité autour des VLA depuis les travaux fondateurs de RT-2 (Google DeepMind, 2023) et des politiques récentes comme pi0 de Physical Intelligence ou OpenVLA. La difficulté du slot-level placement restait un angle mort de ces approches, qui performent mieux sur des tâches de saisie que de dépose précise. AnySlot ne provient pas d'un labo académique nommé explicitement dans l'abstract, et les résultats sont pour l'instant limités à la simulation via SlotBench, sans validation sur robot réel publiée. Les prochaines étapes naturelles seraient des expériences physiques et une comparaison avec des systèmes comme RoboPoint ou SpatialVLA, qui explorent des approches proches du grounding spatial. Ce preprint restera à suivre avant toute intégration industrielle.

IA physiqueOpinion
1 source