
Navigation Vision-Langage hors ligne avec localisation géométrique d'objectif pour environnements extérieurs
Une équipe de chercheurs présente Edge-BehAV, un système de navigation robotique piloté par instructions en langage naturel capable de fonctionner entièrement en embarqué, sans aucune connexion au cloud. Décrit dans un article arXiv (2607.22226v1), le travail apporte trois contributions concrètes. D'abord, un benchmark systématique comparant 17 modèles de langage compacts (SLM) déployables en embarqué à 4 API en ligne, évalués sur la précision et la latence de décomposition d'instructions de navigation, sur trois plateformes de calcul différentes. Ensuite, un cadre hybride de localisation d'objectif combinant détection d'objets en vocabulaire ouvert, segmentation guidée par prompt et géométrie LiDAR pour estimer des positions métriques précises. Enfin, l'intégration de ces briques dans Edge-BehAV, une extension entièrement embarquée de l'architecture BehAV. Résultats chiffrés : le meilleur SLM égale la performance de la meilleure API cloud pour la décomposition d'instructions, tout en tournant environ 9 fois plus vite et sans réseau. Le module de localisation géométrique réduit l'erreur moyenne de distance à l'objectif de 2,05 mètres à 0,20 mètre, pour un coût de calcul moindre. Le système complet réussit 31 essais sur 32 lors de tests en boucle fermée en extérieur.
L'intérêt principal tient à l'indépendance vis-à-vis du cloud, un verrou concret pour tout déploiement en zone sans connectivité fiable (agriculture, défense, inspection d'infrastructures isolées). Le résultat contredit l'idée reçue selon laquelle seuls les gros modèles cloud garantiraient une compréhension sémantique fiable pour la navigation : ici, un petit modèle embarqué atteint une parité de performance sur une tâche ciblée. Le taux de réussite de 31/32 en conditions réelles suggère un rétrécissement de l'écart simulation-réel typique des systèmes VLN, même si l'échantillon reste modeste et mériterait confirmation sur davantage d'essais et d'environnements.
Ce travail prolonge l'architecture existante BehAV plutôt que de repartir de zéro, en y ajoutant la brique d'autonomie complète. Il se positionne à côté des modèles vision-langage-action orientés manipulation (Pi-0, GR00T N2, Helix), mais sur un terrain différent, celui de la navigation extérieure pour robots mobiles. Il s'agit à ce stade d'une recherche académique validée en essais contrôlés, pas d'un produit commercial ; les suites attendues portent sur l'élargissement des tests à d'autres plateformes et environnements.
Dans nos dossiers




