Aller au contenu principal
RecherchearXiv cs.RO 

Zéro pilote : ancrage métrique persistant pour la navigation aérienne vision-langage sans apprentissage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose Fly0, un framework de navigation aérienne pilotée par instructions en langage naturel (Vision-Language Navigation, VLN) pour drones, décrit dans un article déposé sur arXiv (version révisée, arXiv:2602.15875v2) et dont le code est publié sur GitHub. Le système repose sur un pipeline en trois étapes qui découple le raisonnement sémantique de la planification géométrique : un modèle multimodal de grande taille (MLLM) traduit d'abord l'instruction textuelle en coordonnées de pixels 2D dans l'image, un module de projection géométrique exploite ensuite les données de profondeur pour localiser la cible en 3D, puis un planificateur géométrique génère une trajectoire sans collision. Ce découplage permet au drone de continuer à naviguer vers son objectif même en cas de perte de contact visuel. Sur des expériences menées en simulation et en environnement réel, les auteurs rapportent un taux de réussite supérieur de plus de 20 points par rapport aux meilleures méthodes existantes, ainsi qu'une erreur de navigation réduite d'environ 50 % dans des environnements non structurés.

L'enjeu pratique de ce travail est la latence et la stabilité des systèmes de navigation pilotés par IA générative. Utiliser un MLLM comme contrôleur bas niveau en continu produit typiquement des oscillations de trajectoire et une forte latence, deux défauts rédhibitoires pour un drone évoluant en environnement contraint. En confiant le raisonnement sémantique au MLLM uniquement pour l'ancrage initial de la cible, puis en s'appuyant sur un planificateur géométrique classique pour l'exécution, Fly0 réduit la charge de calcul et évite l'inférence continue, ce qui va dans le sens d'une meilleure applicabilité embarquée pour l'inspection, la logistique ou la surveillance par drone autonome.

Ce travail s'inscrit dans une tendance plus large de la recherche en VLN et en robotique aérienne, où l'ancrage géométrique persistant (les auteurs parlent de « metric anchoring ») cherche à corriger les limites des architectures purement bout-en-bout fondées sur les VLA (Vision-Language-Action). Il reste à confirmer, au-delà des métriques annoncées dans l'article, la robustesse du système face à des instructions ambiguës ou des scènes encombrées non couvertes par les jeux de test utilisés, et à voir si cette approche modulaire est reprise par d'autres équipes ou intégrée dans des plateformes commerciales de drones autonomes.

Dans nos dossiers

À lire aussi

Joint apprentissage sur et hors politique pour la navigation vision-langage
1arXiv cs.RO 

Joint apprentissage sur et hors politique pour la navigation vision-langage

Une équipe de chercheurs présente JOP-VLN, un nouveau framework d'apprentissage pour la navigation par instructions en langage naturel (Vision-and-Language Navigation, VLN), où un agent embarqué doit se déplacer dans un environnement physique en suivant des consignes textuelles. L'article, publié sur arXiv (2607.13461v1), combine pour la première fois deux approches jusqu'ici traitées séparément : l'apprentissage par imitation (IL) à partir de démonstrations expertes, renforcé par l'algorithme DAgger pour corriger les erreurs de trajectoire, et l'apprentissage par renforcement (RL) piloté par des récompenses vérifiables pour améliorer le raisonnement et l'exploration. Le pipeline se déroule en trois étapes : acquisition des compétences de base par imitation, génération de trajectoires d'exploration heuristiques via DAgger pour muscler la récupération d'erreurs, puis une phase conjointe on-policy/off-policy combinant échantillonnage de trajectoires à haute entropie et un tri priorisant la correction d'erreurs. Résultat : 69,9% de taux de réussite sur le benchmark VLN-CE R2R et 68,0% sur RxR, un nouveau record sur R2R. Ces chiffres comptent parce qu'ils comblent un angle mort méthodologique de la navigation par modèles vision-langage : la plupart des systèmes actuels choisissent soit l'imitation (stable mais peu exploratoire, sujette à la dérive en cas d'erreur), soit le renforcement (meilleur en exploration mais coûteux et instable à entraîner). Prouver qu'une combinaison structurée des deux surpasse chaque approche isolée est un signal pour les équipes qui développent des agents de navigation embarqués, notamment pour les robots mobiles autonomes (AMR) ou les futurs humanoïdes devant suivre des instructions en environnement non contrôlé, un domaine où la robustesse aux erreurs reste le principal verrou avant tout déploiement réel. Le travail s'inscrit dans la lignée des modèles vision-langage appliqués à la robotique, où des architectures VLA comme GR00T N2 ou Pi-0 cherchent à unifier perception, langage et action. JOP-VLN se positionne spécifiquement sur les benchmarks de référence R2R et RxR, sans annonce de déploiement matériel ni de partenariat industriel à ce stade ; il s'agit pour l'instant d'un résultat de recherche évalué en simulation, la page projet dédiée servant de vitrine aux résultats.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
2arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source
HCSG : raisonnement sémantique-géométrique centré sur l'humain pour la navigation vision-langage
3arXiv cs.RO 

HCSG : raisonnement sémantique-géométrique centré sur l'humain pour la navigation vision-langage

Des chercheurs ont publié en mai 2026 HCSG (Human-Centric Semantic-Geometric Reasoning), un cadre de navigation en langage naturel (VLN) conçu pour les environnements intérieurs dynamiques peuplés de piétons, déposé sur arXiv sous la référence 2605.13321. Contrairement aux approches existantes qui traitent les humains comme de simples obstacles mobiles détectés par indices visuels, HCSG introduit un module unifié de compréhension humaine combinant deux capacités complémentaires : la prévision géométrique, qui anticipe poses et trajectoires futures des personnes, et l'interprétation sémantique, qui exploite un modèle vision-langage (VLM) pour générer des descriptions textuelles des actions et intentions perçues. Ces représentations sont fusionnées dans une carte topologique sur laquelle l'agent planifie ses déplacements en fonction des instructions reçues. Une fonction de perte de distance sociale (social distance loss) contraint le robot à maintenir des distances d'interaction socialement acceptables. Sur le benchmark HA-VLNCE, le framework affiche un gain de 14 % sur le taux de succès et une réduction de 34 % du taux de collision face à l'état de l'art, des chiffres à interpréter avec la prudence habituelle réservée aux préprints non encore évalués en pair-à-pair. Ces résultats pointent un changement de paradigme pertinent pour la robotique de service en espace ouvert. La distinction clé de HCSG est de passer d'un évitement passif (détecter puis contourner) à une compréhension active des comportements : le robot infère si un piéton s'apprête à changer de direction, à s'arrêter ou à interagir, ce qui permet une planification plus fluide. L'intégration d'un VLM est cohérente avec la montée en puissance des architectures vision-langage-action (VLA), mais l'article valide ici leur utilité spécifique pour la navigation sociale, pas seulement la manipulation. Pour les intégrateurs de robots de livraison intérieure ou de guidage hospitalier, c'est un signal que les approches purement géométriques atteignent leurs limites dans des environnements non contrôlés. La navigation VLN a progressé rapidement depuis les benchmarks R2R et REVERIE, portée par les transformers de vision et des modèles comme CLIP. HA-VLNCE, sur lequel HCSG est évalué, est une extension de VLN-CE intégrant des agents humains dynamiques, le rapprochant davantage des conditions de déploiement réelles. Les approches concurrentes en navigation sociale incluent des travaux issus de Stanford, CMU ou MIT, et des frameworks comme NaviSTAR. Côté industriel, les robots de Keenon, Aethon ou Savioke opèrent encore largement dans des couloirs semi-contrôlés précisément pour éviter ces problèmes de cohabitation. HCSG reste une contribution académique sans validation industrielle annoncée, mais une page de projet dédiée laisse entrevoir des travaux futurs sur robot physique.

RechercheOpinion
1 source
SignScene : ancrage visuel des panneaux pour la navigation sans carte
4arXiv cs.RO 

SignScene : ancrage visuel des panneaux pour la navigation sans carte

Des chercheurs ont publié SignScene (arXiv 2602.12686), un système permettant à un robot de naviguer sans carte préalable en interprétant les panneaux de signalisation présents dans l'environnement. Évalué sur un jeu de données de 114 requêtes couvrant neuf types d'environnements différents, le système atteint 88 % de précision dans ce qu'ils appellent le "sign grounding" : la capacité à associer les instructions sémantiques d'un panneau à des éléments de la scène 3D locale et à des actions de navigation concrètes. La démonstration a été réalisée sur un robot Boston Dynamics Spot naviguant en conditions réelles en s'appuyant uniquement sur les panneaux visibles, sans carte ni waypoints préprogrammés. Le défi central est la représentation spatiale : les grands modèles vision-langage (VLMs) disposent du raisonnement sémantique nécessaire pour interpréter un panneau ("Sortie à 50 m à droite"), mais ils sont sensibles à la manière dont l'information spatiale leur est présentée. SignScene introduit une représentation "sign-centric" qui extrait les éléments de scène pertinents pour la navigation et les organise autour du panneau détecté, améliorant significativement le raisonnement du VLM par rapport aux approches de référence, sans que les chiffres exacts de ces dernières soient publiés dans l'abstract disponible. Pour les intégrateurs industriels, l'enjeu est direct : un robot capable d'interpréter les panneaux existants d'un entrepôt ou d'un hôpital pourrait être déployé sans phase de cartographie SLAM préalable, réduisant les coûts et délais d'installation tout en fonctionnant dans des environnements qui évoluent. La navigation sans carte est un axe de recherche actif en robotique mobile, traditionnellement dominé par SLAM ou les cartes topologiques préprogrammées. L'essor des VLMs a ouvert la voie à une navigation guidée par le langage naturel, avec des travaux comme SayNav, VLMaps ou LM-Nav comme précédents directs. SignScene se positionne sur le créneau spécifique des panneaux physiques, signal abondant dans les environnements humains mais peu exploité en robotique autonome. Le robot Spot de Boston Dynamics sert ici de plateforme de validation standard dans la communauté académique. Les prochaines étapes logiques incluraient une extension aux environnements extérieurs urbains ou logistiques, et l'intégration dans des pipelines VLA (Vision-Language-Action) combinant interprétation de panneaux et planification de trajectoire bout-en-bout.

RecherchePaper
1 source