Aller au contenu principal
RecherchearXiv cs.RO 

VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv, le 18 septembre 2026 (référence 2609.20191), une étude décrivant "VLN on the Fly", une pile logicielle de navigation par instructions en langage naturel (vision-language navigation, VLN) fonctionnant intégralement à bord d'un robot aérien. Le système enchaîne quatre étages distincts et inspectables plutôt qu'un unique réseau de bout en bout : un modèle vision-langage (VLM) quantifié associe l'instruction textuelle à une cellule grossière de l'image caméra, la carte de profondeur convertit cette cellule en un objectif 3D, un planificateur de trajectoire rapide basé sur des splines B calcule un chemin faisable, puis une politique d'apprentissage par renforcement préentraînée traduit cette trajectoire en commandes moteur pour des quadricoptères. Sur 15 vols embarqués testant trois objets de référence du quotidien dans un volume intérieur contrôlé, le drone atteint sa cible dans 13 cas sur 15, avec une erreur moyenne de 5,72 cm par rapport à l'objectif et une utilisation moyenne du GPU embarqué de 39,3 %. Six essais supplémentaires en environnement encombré montrent des trajectoires sans collision grâce à un filtrage de la perception embarquée.

L'intérêt de ces travaux tient à la contrainte de calcul propre aux drones, bien plus sévère que sur des robots au sol ou humanoïdes : grounding, planification et contrôle doivent se partager une puissance embarquée limitée, et une erreur dans un pipeline fusionné en un seul réseau (comme le font la plupart des politiques VLA de bout en bout) est difficile à isoler en vol. En conservant des étages séparés et observables, l'équipe défend une architecture plus sûre et plus facile à diagnostiquer, au prix probable d'une latence ou d'une flexibilité moindre qu'une politique end-to-end. Le chiffre de 39,3 % d'utilisation GPU suggère une marge de calcul disponible, preuve que l'exécution embarquée complète reste viable sans déport vers une station sol ou le cloud, un point clé pour les intégrateurs de drones d'inspection ou de logistique intéressés par un pilotage vocal ou textuel autonome. Il faut toutefois noter la portée limitée de la démonstration : 15 vols, trois objets, un environnement intérieur contrôlé, et un taux d'échec de 2 essais sur 15, loin d'un déploiement industriel validé.

Ces travaux s'inscrivent dans le débat plus large opposant les architectures VLA de bout en bout, popularisées par des modèles comme Pi-0 ou GR00T N2 sur des plateformes au sol, à des pipelines modulaires jugés plus sûrs pour des systèmes critiques comme les drones volant à proximité d'humains ou d'obstacles. Aucun acteur français ou européen n'est mentionné dans cette étude, qui reste un prototype de recherche sans annonce de partenariat industriel ni de calendrier de déploiement commercial. Les essais en environnement encombré laissent entrevoir une prochaine étape vers des scénarios plus réalistes, mais aucun pilote opérationnel n'est pour l'instant annoncé.

Dans nos dossiers

À lire aussi

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée
1arXiv cs.RO 

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée

Des chercheurs présentent Uni-LaViRA (Language-Vision-Robot Actions Translation), une architecture de navigation incarnée publiée le 28 mai 2026 sur arXiv (2605.27582), capable de piloter quatre types de robots distincts, robots à roues, quadrupèdes, humanoïdes et un drone à voilure fixe construit sur mesure, sans aucun entraînement spécifique sur des trajectoires robot. Le système s'appuie sur des grands modèles multimodaux de langage préentraînés (MLLMs) pour décomposer la navigation en deux types de commandes : une commande directionnelle sémantique en langage naturel, et une cible visuelle au niveau pixel. En mode zéro-shot, Uni-LaViRA atteint 60,7 % de taux de succès sur VLN-CE R2R, 51,3 % sur VLN-CE RxR, 77,7 % sur HM3D-v2, 60,0 % sur HM3D-OVON, 54,7 % sur MP3D-EQA et 40,0 % sur OpenUAV. Deux mécanismes structurent la boucle d'agent : le TODO List Memory (TDM), qui maintient une liste de sous-objectifs mise à jour à chaque pas et réinjectée dans la fenêtre d'attention du modèle, et le Second Chance Backtrack (SCB), qui ramène le robot à son état précédant une erreur et force le replanning à partir de la sous-trajectoire échouée. Ce résultat interpelle directement le paradigme dominant des VLA à grande échelle, qui réclame des millions de trajectoires et des milliers d'heures GPU pour atteindre des niveaux de performance comparables. Si les chiffres se confirment en environnements non contrôlés, Uni-LaViRA suggère qu'une partie du problème de généralisation en navigation peut être résolue structurellement, via un raisonnement sur la géométrie de l'action, plutôt que par accumulation de données. Pour les intégrateurs robotiques, cela réduit potentiellement le coût d'adaptation à de nouveaux sites ou morphologies de robots, deux points de friction majeurs dans les déploiements industriels. La capacité à unifier wheeled AMR, quadrupèdes et humanoïdes sous une même architecture sans fine-tuning est particulièrement notable. L'article s'inscrit dans un contexte de compétition intense autour des architectures VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches OpenVLA ou RoboFlamingo ont chacun nécessité des pipelines de collecte de données coûteux. Uni-LaViRA ne cherche pas à remplacer ces modèles sur des tâches de manipulation précise, mais positionne le raisonnement structuré comme alternative crédible pour la navigation. Les benchmarks utilisés (HM3D, MP3D, R2R) sont des standards académiques en simulation ; la validation sur robots réels reste limitée aux quatre plateformes de l'étude, et les performances en conditions industrielles non contrôlées restent à démontrer. Aucune timeline de déploiement ni partenariat industriel n'est mentionné.

RechercheOpinion
1 source
FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon
2arXiv cs.RO 

FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon

Des chercheurs publient sur arXiv (papier 2607.08359, juillet 2026) FSD-VLN, une architecture de navigation aérienne guidée par le langage destinee aux drones (UAV) évoluant en environnement inconnu, sans dépendance GPS ni trajectoire préprogrammée. Le système repose sur deux flux asynchrones : un flux "lent" qui extrait des priors sémantiques stables a partir de modèles vision-langage pré-entraines, et un flux "rapide" fonde sur un Diffusion Transformer (DiT) qui modélise les distributions d'actions dans le temps pour générer des commandes de vol cohérentes. Un optimiseur adaptatif sensible au temps a été intègre pour stabiliser l'entrainement sur de longues séquences et limiter les oscillations de gradient. En simulation a grande échelle sur des scenarios de vol a basse altitude, FSD-VLN atteint un taux de réussite de navigation jusqu'a deux fois supérieur aux méthodes de référence sur des scènes inédites, tout en réduisant de plus de 50% le délai d'inférence par action et la durée totale des taches. L'enjeu technique vise juste : les systèmes de navigation aérienne par langage souffrent généralement d'un désalignement entre compréhension multimodale globale et génération d'actions séquentielles, ce qui produit des trajectoires saccadées et une latence de décision pénalisante sur les missions longues. En découplant explicitement raisonnement sémantique et génération de commandes bas niveau, FSD-VLN reprend une logique "système rapide / système lent" déjà explorée cote robotique humanoïde (Pi-0, GR00T N2, Helix) et l'applique au vol de drone, un domaine ou la contrainte de latence est encore plus stricte qu'au sol. Pour les intégrateurs de drones industriels (inspection, logistique, surveillance), c'est une piste crédible pour rendre la navigation instructable en langage naturel viable sur des taches longues, même si les gains annonces restent, a ce stade, mesures uniquement en simulation. La navigation vision-langage (VLN) s'est imposée ces dernières années comme alternative aux systèmes GPS-dépendants, en promettant une interaction homme-machine plus intuitive et une meilleure adaptabilité environnementale, au prix d'une charge de calcul et de coordination bien plus lourde qu'un pilotage classique. FSD-VLN s'inscrit dans une lignée de travaux cherchant a résoudre ce compromis vitesse/compréhension, déjà au cœur des débats sur les modèles VLA en robotique générale. Les auteurs présentent leurs résultats comme un "paradigme pratique" plutôt qu'un système déployé : la prochaine étape logique, non couverte par cette publication, sera la validation en conditions de vol réelles, seule capable de confirmer si les gains constates en simulation résistent au bruit sensoriel et aux perturbations physiques du monde réel.

RechercheActu
1 source
G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots
3arXiv cs.RO 

G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots

Des chercheurs présentent G2-Nav, un nouveau framework de navigation sociale pour robots mobiles, détaillé dans un article déposé sur arXiv (2607.16956v1). Plutôt que de laisser un modèle vision-langage (VLM) décider directement des trajectoires, comme le font les approches end-to-end existantes, G2-Nav traduit le raisonnement sémantique du VLM en une costmap vision-langage interprétable. Le modèle identifie les zones traversables et les agents sociaux à partir d'une perception en ensemble ouvert (open-set), puis cartographie ce contexte social sous forme de coûts exploitables par le planificateur. Pour renforcer la robustesse en conditions réelles, le VLM effectue aussi une vérification sémantique sur le suivi (tracking) en amont, et les auteurs ajoutent un contrôle de sécurité à haute fréquence destiné à compenser la latence du système avant la génération de trajectoire. Des expériences en environnement réel, selon les auteurs, montrent une navigation autonome sûre, efficace et socialement conforme dans des espaces non structurés. Le code source doit être publié ultérieurement. L'intérêt de ce travail tient à la faille qu'il cherche à combler entre deux approches jugées insuffisantes pour l'autonomie complète: les frameworks VLM end-to-end, qui produisent des décisions de planification difficiles à auditer et donc risquées à déployer, et les méthodes d'instruction-following, pensées pour suivre des consignes humaines plutôt que pour opérer de façon totalement autonome. En cantonnant le VLM à un rôle d'évaluation sémantique plutôt que de contrôle direct, G2-Nav vise une architecture plus traçable, un enjeu concret pour les intégrateurs et décideurs industriels qui doivent justifier la sécurité de robots évoluant parmi des humains, en entrepôt, en établissement de santé ou en espace public. Le garde-fou de sécurité haute fréquence répond en particulier à un angle mort fréquent des démonstrations VLM: la latence d'inférence, souvent ignorée dans les vidéos promotionnelles du secteur. Ce travail s'inscrit dans la vague de recherche actuelle sur l'usage des VLM pour doter les robots d'un raisonnement de niveau humain en navigation sociale, un domaine où les benchmarks restent encore largement issus de démonstrations contrôlées. L'abstract ne précise ni l'institution porteuse ni le matériel robotique utilisé pour les essais réels, et le code, annoncé comme futur, n'est pas encore disponible: il s'agit donc à ce stade d'un préprint à confirmer par la publication effective et par une évaluation indépendante, plutôt que d'une solution déployée ou commercialisée.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
4arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source