Aller au contenu principal
De l'arrivée en zone à l'ancrage au niveau de l'instance en navigation vision-langage
RecherchearXiv cs.RO 

De l'arrivée en zone à l'ancrage au niveau de l'instance en navigation vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche vient de publier sur arXiv un article identifiant une faille méthodologique dans l'évaluation des agents de navigation vision-langage (VLN), ces systèmes qui suivent des instructions en langage naturel pour se déplacer et localiser des objets dans un environnement. Les protocoles actuels valident une navigation comme réussie dès que l'agent s'arrête dans un rayon de 3 mètres de la cible, sans vérifier son orientation finale ni si l'objet est réellement visible depuis sa position d'arrêt. Les auteurs baptisent ce problème le "Last-3-Meter Grounding Gap" et introduisent trois métriques inédites pour le quantifier : précision de proximité, visibilité de la cible et qualité du cadrage final. Pour y remédier, ils proposent REALM (Region-to-Entity Alignment for Last-3-Meter Navigation), un module de raffinement plug-and-play compatible avec n'importe quelle architecture existante, qui sépare la navigation longue distance de l'approche fine du dernier tronçon et intègre une stratégie d'arrêt sensible à la visibilité pour éviter les arrêts prématurés. Un nouveau jeu de données, REVERIE-AIM, apporte 180 000 exemples d'entraînement courte distance avec des objectifs définis à l'échelle de l'instance d'objet, et non plus seulement de la région.

Cette distinction entre "arriver dans la bonne zone" et "voir réellement l'objet visé" touche directement la fiabilité des robots mobiles et humanoïdes appelés à manipuler des objets précis en environnement réel, où un mètre d'erreur ou un mauvais angle de vue peut rendre l'action suivante impossible. Le travail illustre un écart classique entre métriques de démonstration favorables et performance réellement exploitable en production, un point sensible pour les intégrateurs qui évaluent des piles de navigation avant déploiement industriel.

Testé sur quatre architectures VLN différentes, REALM améliore systématiquement la précision de proximité et le taux de succès de l'ancrage visuel, ce qui suggère une adoption possible comme brique additionnelle plutôt que comme refonte complète des systèmes existants, sans calendrier de déploiement commercial annoncé à ce stade.

Dans nos dossiers

À lire aussi

« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »
1arXiv cs.RO 

« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »

Une équipe de recherche (RCI Lab) publie un nouveau framework baptisé Instance-Enriched Semantic Maps pour la navigation par instructions en langage naturel (Visual Language Navigation, VLN), avec trois apports techniques. D'abord, une cartographie 2.5D au niveau instance construite à partir d'images couleur et de profondeur via segmentation panoptique en vocabulaire ouvert, qui préserve les distinctions verticales et capture les petits objets, tout en associant à chaque élément des attributs sémantiques et des descriptions en langage naturel enrichies du contexte de la pièce. Ensuite, un module de traitement des requêtes s'appuyant sur un LLM pour sélectionner la cible, en routant dynamiquement les requêtes vers des experts spécialisés par type et en fusionnant leurs scores pour une sélection d'objectif cohérente quel que soit le formulation de la requête. Enfin, une représentation sémantique nettement plus compacte, avec une réduction de stockage d'environ 96 % par rapport aux approches à scene-graph 3D, tout en conservant l'information spatiale nécessaire à la navigation. Sur le plan des résultats, la représentation 2.5D dépasse la référence 3D de plus de 27 % en AUC normalisée, et le système complet améliore la récupération d'objets de plus de 17 % et le taux de réussite de navigation de plus de 23 % par rapport à la baseline, sur des types de requêtes variés. Pour les robots mobiles autonomes (AMR) et les agents embarqués évoluant en intérieur, ces travaux ciblent un goulot d'étranglement connu des systèmes VLN actuels : la cartographie sémantique existante manque de granularité au niveau des instances individuelles et se montre fragile face à la diversité réelle des formulations utilisateur. En réduisant drastiquement le coût de stockage des cartes tout en gardant leur précision spatiale, l'approche répond à une contrainte concrète de déploiement embarqué, où la mémoire et le calcul restent limités. C'est un signal que la navigation par langage naturel progresse vers une robustesse compatible avec des usages industriels au-delà des démonstrations de laboratoire. Le travail s'inscrit dans la lignée des systèmes VLN combinant cartes spatiales sémantiques et raisonnement par LLM, une direction de recherche active depuis l'essor des modèles de segmentation en vocabulaire ouvert. Les auteurs comparent explicitement leur méthode à des approches de référence en scene-graph 3D, positionnant leur contribution comme une alternative plus légère et plus précise. Le code et les démonstrations sont disponibles sur la page du projet, mais aucun calendrier de déploiement sur robot physique n'est mentionné à ce stade.

RecherchePaper
1 source
C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
2arXiv cs.RO 

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot

Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet. L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle. Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.

RecherchePaper
1 source
VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens
3arXiv cs.RO 

VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens

Une équipe de chercheurs a publié sur arXiv, le 18 septembre 2026 (référence 2609.20191), une étude décrivant "VLN on the Fly", une pile logicielle de navigation par instructions en langage naturel (vision-language navigation, VLN) fonctionnant intégralement à bord d'un robot aérien. Le système enchaîne quatre étages distincts et inspectables plutôt qu'un unique réseau de bout en bout : un modèle vision-langage (VLM) quantifié associe l'instruction textuelle à une cellule grossière de l'image caméra, la carte de profondeur convertit cette cellule en un objectif 3D, un planificateur de trajectoire rapide basé sur des splines B calcule un chemin faisable, puis une politique d'apprentissage par renforcement préentraînée traduit cette trajectoire en commandes moteur pour des quadricoptères. Sur 15 vols embarqués testant trois objets de référence du quotidien dans un volume intérieur contrôlé, le drone atteint sa cible dans 13 cas sur 15, avec une erreur moyenne de 5,72 cm par rapport à l'objectif et une utilisation moyenne du GPU embarqué de 39,3 %. Six essais supplémentaires en environnement encombré montrent des trajectoires sans collision grâce à un filtrage de la perception embarquée. L'intérêt de ces travaux tient à la contrainte de calcul propre aux drones, bien plus sévère que sur des robots au sol ou humanoïdes : grounding, planification et contrôle doivent se partager une puissance embarquée limitée, et une erreur dans un pipeline fusionné en un seul réseau (comme le font la plupart des politiques VLA de bout en bout) est difficile à isoler en vol. En conservant des étages séparés et observables, l'équipe défend une architecture plus sûre et plus facile à diagnostiquer, au prix probable d'une latence ou d'une flexibilité moindre qu'une politique end-to-end. Le chiffre de 39,3 % d'utilisation GPU suggère une marge de calcul disponible, preuve que l'exécution embarquée complète reste viable sans déport vers une station sol ou le cloud, un point clé pour les intégrateurs de drones d'inspection ou de logistique intéressés par un pilotage vocal ou textuel autonome. Il faut toutefois noter la portée limitée de la démonstration : 15 vols, trois objets, un environnement intérieur contrôlé, et un taux d'échec de 2 essais sur 15, loin d'un déploiement industriel validé. Ces travaux s'inscrivent dans le débat plus large opposant les architectures VLA de bout en bout, popularisées par des modèles comme Pi-0 ou GR00T N2 sur des plateformes au sol, à des pipelines modulaires jugés plus sûrs pour des systèmes critiques comme les drones volant à proximité d'humains ou d'obstacles. Aucun acteur français ou européen n'est mentionné dans cette étude, qui reste un prototype de recherche sans annonce de partenariat industriel ni de calendrier de déploiement commercial. Les essais en environnement encombré laissent entrevoir une prochaine étape vers des scénarios plus réalistes, mais aucun pilote opérationnel n'est pour l'instant annoncé.

RecherchePaper
1 source
Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage
4arXiv cs.RO 

Embodied3DBench : évaluation de l'intelligence spatiale incarnée à bas niveau des modèles vision-langage

Une équipe de chercheurs a publié le 29 mai 2026 Embodied3DBench, un benchmark conçu pour évaluer les capacités de perception spatiale bas niveau des modèles de vision-langage (VLMs) dans des environnements 3D incarnés. Le benchmark couvre 6 catégories de tâches réparties en deux groupes : la compréhension structurelle spatiale (ancrage d'objets, prédiction de relations spatiales, correspondance multi-vues) et la perception orientée interaction (prédiction d'affordances, prédiction de points de saisie, prédiction de trajectoires). Il totalise 12 sous-catégories et plus de 21 000 paires questions-réponses annotées. Treize modèles de pointe ont été évalués sur ce corpus. En parallèle, les auteurs ont synthétisé un dataset d'entraînement à grande échelle de 1,3 million de paires QA pour tenter de combler les lacunes identifiées. Les résultats révèlent une dissociation nette dans les capacités des VLMs actuels : ces modèles affichent des performances raisonnables sur le raisonnement spatial de haut niveau, notamment les relations de position entre objets, mais restent très fragiles dès qu'il s'agit de perception orientée interaction, c'est-à-dire prédire où saisir un objet, anticiper une trajectoire de manipulation, ou estimer l'affordance d'une surface. Pour les équipes qui développent des modèles vision-langage-action (VLA) destinés à la manipulation robotique, ce résultat est structurant : il indique que les fondations perceptuelles nécessaires au déploiement réel restent insuffisantes dans les architectures actuelles, y compris les plus récentes. Le fine-tuning sur le dataset de 1,3M paires améliore significativement les scores bas niveau, ce qui suggère que le problème est en partie un déficit de données d'entraînement ciblées plutôt qu'une limite architecturale fondamentale. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour doter les VLMs de capacités d'interaction physique, au-delà de la simple description de scènes. Des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) reposent sur ces mêmes briques perceptuelles pour passer de la compréhension sémantique à l'action motrice. Jusqu'ici, l'évaluation de ces capacités bas niveau manquait d'un cadre standardisé : la plupart des benchmarks existants (ScanQA, EmbodiedScan) ciblent la compréhension de scènes plutôt que la manipulation. Embodied3DBench comble ce vide méthodologique en proposant à la fois un protocole d'évaluation reproductible et un levier de progression via son dataset synthétique. L'article est disponible en preprint (arXiv:2605.29074) et le code devrait être rendu public prochainement.

RechercheActu
1 source