Aller au contenu principal
RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection
RecherchearXiv cs.RO 

RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié en août 2026 sur arXiv (référence 2608.22678) présente RACO, un framework de navigation pour drones guidés par instructions en langage naturel (UAV-VLN), pensé pour les missions d'inspection plutôt que pour la simple atteinte d'un objectif, et LG-UVI, un protocole d'évaluation associé dérivé des jeux de données CityNav et CityRefer. Les auteurs pointent une faiblesse des architectures existantes en deux temps ("coarse-to-fine"): l'objectif grossier prédit avant le raffinement local est traité comme fiable alors qu'il peut dériver vers une région plausible mais erronée, ce que l'étape de raffinement fine ne parvient ensuite pas à corriger. LG-UVI ajoute à ces scènes urbaines simulées des objets cibles, des distracteurs visuellement ou sémantiquement proches, des zones d'inspection typées, ainsi que des métriques distinctes pour l'arrivée en zone et pour la confirmation de l'objet. RACO traite l'objectif grossier comme une hypothèse à vérifier en temps réel plutôt qu'un point de passage fixe, en s'appuyant sur des ancres candidates au niveau objet pour corriger la localisation avant la première étape de navigation puis à la frontière entre les deux étapes, avant d'appliquer un raffinement terminal adaptatif pour les cas de quasi-échec en fin de trajectoire. Sous un protocole d'évaluation en ligne unifié, il améliore le taux de succès de 9,53 points de pourcentage sur le jeu de validation "unseen" et de 7,98 points sur le jeu de test "unseen", par rapport à une reproduction de la référence antérieure HETT.

Ce résultat touche un point sensible pour l'inspection industrielle par drone: dans un scénario réel de contrôle d'infrastructure, un appareil qui s'arrête devant le mauvais objet mais confirme tout de même une anomalie représente un risque opérationnel plus grave qu'un simple échec de navigation. En montrant qu'une part importante des erreurs vient d'une dérive précoce de l'objectif grossier, non rattrapée par le raffinement local classique, les auteurs remettent en cause l'hypothèse implicite de nombreux pipelines coarse-to-fine selon laquelle l'étape fine peut compenser une estimation grossière imparfaite. Pour les équipes travaillant sur la navigation vision-langage appliquée aux drones d'inspection, l'implication pratique est qu'une vérification explicite et intermédiaire de l'objectif doit être budgétisée, plutôt que de tout reposer sur la puissance du modèle de perception final. Un gain de 8 à 10 points de taux de succès mesuré sur un protocole en ligne unifié, et non sur des scénarios sélectionnés, reste notable dans un domaine où les progrès se comptent généralement en unités de pourcentage.

RACO s'inscrit dans la lignée des travaux sur la navigation vision-langage pour drones en environnement urbain simulé, qui s'appuient historiquement sur CityNav et CityRefer pour l'entraînement et l'évaluation. La comparaison se fait face à HETT, une architecture coarse-to-fine antérieure que les auteurs ont reproduite faute de protocole standardisé pour les tâches d'inspection, un manque que LG-UVI vise justement à combler en distinguant l'atteinte d'un objectif générique de la confirmation fiable d'un objet précis en présence de distracteurs. L'article ne mentionne ni déploiement sur drone physique ni partenariat industriel: il s'agit d'une contribution de recherche évaluée en simulation, dont la suite logique serait une validation sur plateforme réelle et une extension à d'autres familles de distracteurs et de zones d'inspection.

Dans nos dossiers

À lire aussi

ShieldVLA : un alignement de sécurité tenant compte de la faisabilité pour les modèles vision-langage-action
1arXiv cs.RO 

ShieldVLA : un alignement de sécurité tenant compte de la faisabilité pour les modèles vision-langage-action

Déposée sur arXiv en septembre 2026 (référence 2609.13231), l'étude présente ShieldVLA, un framework de fine-tuning pour la sécurité des modèles Vision-Language-Action (VLA) en manipulation robotique et en navigation. Face aux pénalités lagrangiennes des méthodes existantes, qui laissent des violations résiduelles ou imposent une prudence excessive, ShieldVLA apprend depuis les seules observations visuelles une approximation model-free de la fonction de valeur de réchabilité Hamilton-Jacobi, séparant maximisation de récompense en zone sûre et récupération près des états dangereux. La supervision s'appuie sur des scores de sécurité générés par un modèle vision-langage plutôt que sur un étiquetage manuel. Sur cinq bancs d'essai de navigation et manipulation, avec plusieurs architectures VLA, ShieldVLA réduit le coût de sécurité cumulé de 57% en moyenne et améliore le taux de réussite de 0,13 point par rapport à SafeVLA. Le résultat cible un angle mort des VLA : leur forte généralisation en manipulation et en navigation ne garantit aucune sécurité robuste une fois affinés sur une tâche, un enjeu critique dès qu'un robot opère près d'humains ou de matériel fragile. Les méthodes lagrangiennes actuelles imposent un compromis entre violations et prudence excessive peu compatible avec un déploiement industriel. En réduisant les violations tout en améliorant le taux de succès grâce à une supervision automatisée par modèle vision-langage plutôt qu'un étiquetage humain, l'étude suggère qu'un pipeline de sécurité scalable est possible sans sacrifier les performances, un point que pèseront intégrateurs et décideurs évaluant la maturité réelle des VLA en production, au-delà des démonstrations. L'approche s'inscrit dans la lignée des recherches sur l'alignement de sécurité post-entraînement des modèles robotiques de fondation, où SafeVLA sert de référence par optimisation lagrangienne que ShieldVLA reprend comme point de comparaison direct. L'article, déposé sur arXiv, ne précise ni les architectures VLA testées ni leur origine industrielle, et reste une contribution de recherche évaluée sur bancs d'essai simulés, sans essai sur robot physique, partenaire industriel ni calendrier annoncés. La suite logique, non détaillée par les auteurs, consisterait à valider l'approche par réchabilité sur du matériel réel et à l'étendre aux architectures VLA propriétaires des acteurs commerciaux du secteur, où les garanties de sécurité demeurent un frein identifié à l'adoption à grande échelle.

RecherchePaper
1 source
NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents
2arXiv cs.RO 

NavHarness : des objectifs adaptatifs pour la navigation vision-langage à base d'agents

NavHarness, un framework publié sur arXiv (v1), propose d'aborder la navigation vision-langage (VLN) par une architecture à quatre agents spécialisés plutôt que par un seul agent multimodal généraliste. Un Goal Agent fixe des sous-objectifs adaptatifs à partir de l'instruction, de l'observation courante et de l'historique d'exécution. Un Visuomotor Agent exécute les actions de navigation pour atteindre chaque objectif. Un Verify Agent juge ensuite si l'objectif est atteint, grâce à une question de vérification propre à cet objectif. Un Memory Agent compresse enfin l'historique multimodal correspondant, en conservant l'information utile à la suite du trajet. Les auteurs évaluent le système sur les benchmarks simulés R2R-CE et RxR-CE, comparent des variantes sur trois modèles de base et analysent l'évolution du contexte pendant l'exécution. En conditions réelles, NavHarness atteint 83,3 % de succès et 1,51 m d'erreur de navigation sur huit parcours jugés difficiles, chacun parcouru trois fois, soit 24 essais au total. L'intérêt tient à deux problèmes concrets des agents embarqués pilotés par des modèles multimodaux. Le premier est la dérive sur les tâches longues : choisir une action locale plausible à chaque pas ne garantit pas de rester sur l'itinéraire voulu. La vérification explicite de chaque sous-objectif vise à corriger cette dérive en cours de route. Le second est le coût d'inférence : si l'historique image-texte est réinjecté tel quel à chaque décision, l'entrée grossit sans cesse. Le découpage de l'historique en segments compressés à chaque objectif validé est une réponse d'ingénierie pragmatique, qui concerne directement les intégrateurs soucieux de la latence et du coût de calcul embarqué. Les résultats appellent toutefois de la prudence : l'échantillon réel est restreint (huit parcours, trois passes), la nature des environnements n'est pas détaillée dans le résumé et l'article ne chiffre pas, dans cet extrait, le gain de calcul obtenu. Ce travail s'inscrit dans la tendance qui consiste à réutiliser des modèles multimodaux généralistes comme base de la navigation, plutôt que d'entraîner des politiques dédiées. R2R-CE et RxR-CE, versions en environnement continu des benchmarks Room-to-Room et Room-across-Room, sont des références habituelles de ce champ. Le texte ne fournit ni comparaison chiffrée avec des méthodes concurrentes, ni robot, ni calendrier de déploiement : il s'agit d'une publication de recherche, pas d'un produit. La suite logique serait de mesurer le système sur davantage d'environnements réels et de quantifier précisément l'économie de contexte apportée par la compression.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
3arXiv cs.RO 

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot

Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet. L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle. Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.

RecherchePaper
1 source
NAViLoss : un objectif à double résidu tenant compte de la navigation sous-marine pour un apprentissage cohérent avec la physique
4arXiv cs.RO 

NAViLoss : un objectif à double résidu tenant compte de la navigation sous-marine pour un apprentissage cohérent avec la physique

Les véhicules sous-marins autonomes (AUV) s'appuient généralement sur une navigation inertielle (INS) recalée par un loch Doppler (DVL), de sorte que la qualité de l'estimation de vitesse fournie par ce dernier conditionne directement la réussite des missions. Une équipe de chercheurs propose NAViLoss, une nouvelle fonction de perte pour l'apprentissage de cette estimation, intégrée à une architecture DeepONet pour former le modèle NAVi-DeepONet. La fonction pénalise simultanément deux résidus: l'écart d'estimation de vitesse dans l'espace d'état de navigation, et l'incohérence entre les faisceaux dans l'espace de mesure du DVL. Sa formulation bornée limite l'influence des grands résidus, tandis qu'un mécanisme adaptatif ajuste l'incertitude liée à la géométrie des faisceaux. L'évaluation porte sur environ 10 000 m de données expérimentales semi-synthétiques, issues de plusieurs campagnes en mer réelles. Les auteurs annoncent un gain de 44 % de précision d'estimation de vitesse par rapport aux méthodes de référence, classiques comme basées sur l'apprentissage. L'intérêt tient moins à l'architecture qu'à la manière d'entraîner. Les méthodes d'apprentissage récentes améliorent l'estimation de vitesse du DVL quand les mesures sont dégradées (fond mal réfléchissant, perte de faisceaux, bruit), mais elles reposent sur des pertes de régression standard, sensibles aux valeurs aberrantes et aveugles à la physique du capteur. Intégrer la cohérence entre faisceaux directement dans l'objectif revient à injecter une contrainte physique là où elle compte, sans alourdir le modèle. Pour les intégrateurs d'AUV, d'engins d'inspection ou de véhicules d'exploration, c'est une piste pour réduire la dérive de navigation lors des pertes de fond ou de qualité de mesure, sans matériel supplémentaire. La robustesse aux observations corrompues est aussi un point de passage obligé pour sortir ces approches du laboratoire. Le chiffre de 44 % demande toutefois à être lu avec prudence. Il provient de données qualifiées de semi-synthétiques, probablement des mesures réelles auxquelles des dégradations ont été ajoutées, et d'un parcours d'environ 10 000 m seulement, ce qui reste modeste. Le résumé ne précise ni les baselines exactes, ni la métrique, ni les conditions de fonds marins testées, et rien n'indique un déploiement embarqué en temps réel. Il s'agit d'un travail de recherche publié sur arXiv, pas d'un produit livré. Il prolonge une série de travaux sur l'estimation de vitesse DVL par réseaux de neurones, qui visent à compenser les faiblesses d'une navigation inertielle dont l'erreur dérive avec le temps. La suite logique est une validation sur d'autres plateformes, d'autres types de fonds et en boucle fermée avec un filtre de navigation.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source