Aller au contenu principal
RecherchearXiv cs.RO 

Voir l'invisible : invite visuelle guidée par la physique pour une navigation VLA sensible à la température et aux radiations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent PG-VP (Physics-Guided Visual Prompting), un module de perception multimodal « plug-and-play » qui permet à un modèle vision-langage-action (VLA) de navigation d'éviter des dangers invisibles à une caméra RGB, comme une source de rayonnement ou un pic de température. Le module évalue le risque à partir de la physique d'une source thermique ou radioactive proche, détermine la direction d'évitement, puis superpose aux images un obstacle virtuel qui se déplace d'une image à l'autre (Dynamic Visual Prompting). La politique de navigation, restée gelée, contourne alors le danger comme elle le ferait pour un obstacle visible. L'obstacle virtuel est identique quel que soit le type de risque. Sans danger détecté, rien n'est affiché et la politique se comporte comme sans PG-VP. Sur OmniNav, avec les splits val-unseen de R2R-CE et RxR-CE, le module oriente la politique vers l'action à faible risque dans 84,9 % et 83,2 % des cas, pour un coût de 6,8 et 7,9 points de taux de succès de navigation. Un test sur robot réel, avec de vraies sources thermiques et radioactives et sans réentraînement, améliore de 63,45 % (thermique) et 32,59 % (radiation) la sécurité moyenne des 10 % pires trajectoires.

L'intérêt tient à la méthode. Intégrer un nouveau risque à un VLA exige d'ordinaire un encodeur dédié, de nouvelles données et un réentraînement, un coût qui freine le déploiement en site sensible (installations nucléaires, sites industriels chauds). PG-VP déplace le problème vers l'entrée visuelle. Ajouter un capteur ne change pas le motif de prompt, ce qui rend l'extension peu coûteuse pour un intégrateur. Le travail montre aussi qu'un VLA gelé peut être détourné vers un comportement de sécurité sans toucher à ses poids. Deux réserves s'imposent. Le gain n'est pas gratuit : la perte de 7 à 8 points de succès est significative pour un robot de production. Et les résultats réels portent sur des « scénarios distincts » dont l'ampleur n'est pas précisée, avec une métrique centrée sur les pires 10 % des trajectoires. Il s'agit d'une preuve de concept académique, pas d'un produit.

Le travail s'inscrit dans la vague des modèles VLA appliqués à la navigation vision-langage (VLN), évalués sur les benchmarks R2R-CE et RxR-CE, ici avec OmniNav comme politique de base. La sécurité de ces modèles reste un angle peu traité : la plupart des travaux visent le taux de succès en environnement domestique simulé, pas les risques non visuels. L'approche concurrence implicitement les solutions qui ajoutent des modalités et réentraînent les modèles. Aucun pilote ni calendrier n'est annoncé. Les prochaines étapes probables sont l'ajout d'autres capteurs (gaz, champs électromagnétiques), des tests sur plus de scénarios réels et une réduction du compromis sur le succès de navigation.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Vol à l'aveugle : la délibération spatiale guidée par vision pour la navigation "voir et atteindre" des drones
1arXiv cs.RO 

Vol à l'aveugle : la délibération spatiale guidée par vision pour la navigation "voir et atteindre" des drones

Une équipe de recherche présente DBFly, un système de navigation pour drones capable d'approcher et de s'arrêter précisément près d'une cible désignée en langage naturel et visible dès la prise de vue initiale, une tâche connue sous le nom de "see-and-reach navigation". Le problème identifié par les auteurs est que les méthodes existantes associent directement les représentations vision-langage aux commandes de vol, sans étape intermédiaire de décision spatiale fine, ce qui provoque un désalignement entre la compréhension sémantique et le contrôle réel et rend les manœuvres incohérentes et les arrêts peu fiables. DBFly introduit à la place une chaîne de décision de manœuvre spatiale en trois étapes : ancrage de la direction cible, diagnostic spatial, puis décision de manœuvre, qui guide explicitement la génération continue de points de passage (waypoints). Le système construit aussi un "corridor de vol implicite", une référence géométrique persistante dérivée de la direction cible initiale et recalculée en continu selon la position du drone, pour affiner les corrections de trajectoire. Une stratégie d'arrêt tenant compte de la convergence du mouvement à court terme complète le dispositif. Sur des jeux de test couvrant des scènes vues, des objets inédits et des scènes inédites, DBFly améliore le taux de succès de 25,07 points de pourcentage en moyenne par rapport à la meilleure méthode existante (SOTA). Cette avancée s'inscrit dans un enjeu central pour la navigation autonome des drones commandés en langage naturel : le fossé entre la compréhension d'une instruction ("va vers la voiture rouge") et l'exécution physique précise qui doit en découler. Un gain de 25 points sur des scènes et objets jamais vus est significatif, car c'est justement la généralisation qui échoue le plus souvent dans les approches "bout-en-bout" pilotées uniquement par des modèles vision-langage. Pour les intégrateurs travaillant sur des drones d'inspection, de livraison ou de surveillance guidés par instruction vocale ou textuelle, ce type d'architecture en couches explicites (perception, diagnostic spatial, décision de manœuvre) offre une piste pour réduire les échecs d'atterrissage ou d'approche qui limitent aujourd'hui le déploiement en conditions réelles, au-delà des démonstrations en environnement contrôlé. Le travail se situe dans la continuité des recherches sur la navigation UAV pilotée par le langage (vision-language navigation appliquée aux drones), un domaine qui a jusqu'ici largement repris les architectures VLA (vision-language-action) développées pour la robotique au sol et les bras manipulateurs, sans toujours les adapter aux contraintes spécifiques du vol. Les auteurs comparent leur approche à une base de référence qualifiée d'état de l'art (SOTA), sans que l'abstract ne précise son nom, laissant supposer une comparaison directe sur les mêmes bancs d'essai plutôt qu'une performance en conditions réelles de terrain. Une page projet dédiée (xuefanfu.github.io/DBFly-Page) et l'annonce sur arXiv suggèrent une publication académique à ce stade, sans indication de déploiement commercial ou de partenariat industriel ; les prochaines étapes attendues seraient une validation sur drones physiques en extérieur et une comparaison avec des architectures VLA génériques comme celles utilisées en robotique mobile terrestre.

RecherchePaper
1 source
Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable
2arXiv cs.RO 

Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable

Un preprint arXiv (2609.16737, mis en ligne mi-septembre 2026) présente CueNav, un système de navigation robotique combinant planification vidéo guidée par indices visuels et modèle inverse-dynamique (IDM) propre a chaque plateforme. Le planificateur vidéo s'appuie sur deux indices : une carte vue-du-dessus (Bird's-Eye View) donnant le contexte global de la tache, et le maintien d'une partie du corps du robot dans le champ égocentrique pour exposer le contexte d'embodiment. L'IDM traduit ensuite les champs de flux optique extraits de la vidéo en commandes d'actuation. Sur un test de labyrinthe, CueNav quasiment double le taux de réussite par rapport a une planification sans indice global, et atteint 70% de réussite dans un couloir étroit la ou les méthodes comparées échouent majoritairement. Les auteurs démontrent aussi une navigation conditionnée sémantiquement en zero-shot et le déploiement d'un même planificateur vidéo sur plusieurs plateformes robotiques, avec code et résultats sur cuenav.github.io. Le travail cible un angle mort des approches actuelles de navigation par modèle vidéo, qui conditionnent généralement la planification sur un horizon court et récupèrent des points de passage géométriques via reconstruction de scene, au détriment du long horizon et d'une traduction vidéo-vers-action précise. En couplant contexte global et ancrage d'action spécifique a l'embodiment, CueNav esquisse une piste pour transformer les modèles vidéo génératifs en véritable backbone de politique de navigation généralisable, plutôt qu'en simple outil de visualisation a court terme. Pour les intégrateurs qui explorent les architectures vision-langage-action (VLA) au-delà de la manipulation, cela suggère qu'une même logique de planification vidéo peut se transférer entre plateformes, un enjeu pour les flottes hétérogènes d'AMR et de robots humanoïdes. Ce travail s'inscrit dans une tendance ou des modèles vidéo génératifs sont testes comme backbone de politiques robotiques, en parallèle d'architectures VLA comme Pi-0 ou GR00T N2 employées en manipulation, et se positionne explicitement contre les méthodes limitant la planification a un horizon court avec reconstruction géométrique. Il s'agit d'un preprint non encore revu par les pairs, dont les taux de réussite annonces (quasi-doublement en labyrinthe, 70% en couloir étroit) proviennent de bancs d'essai contrôles propres a l'étude, sans précision sur le nombre d'essais ni déploiement en environnement industriel réel. Aucune entreprise ni feuille de route commerciale n'est associée a l'annonce : il s'agit d'une contribution académique, sans calendrier de pilote a ce jour.

RecherchePaper
1 source
ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
3arXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D). L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles. Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

RecherchePaper
1 source
NaviRrator : la navigation du robot à partir de cartes lisibles par l'humain, guidée par un itinéraire visuel appris
4arXiv cs.RO 

NaviRrator : la navigation du robot à partir de cartes lisibles par l'humain, guidée par un itinéraire visuel appris

Des chercheurs présentent NaViRRator, un système qui traduit un point de départ et une destination désignés sur une carte lisible par un humain en instructions de navigation pour une politique de navigation vision-langage (VLN) déjà entraînée. Decrit dans un preprint mis en ligne sur arXiv le 21 septembre 2026 (2609.21316), il repose sur RouteScribe, une méthode qui sépare l'inférence de trajectoire de sa formulation en langage. RouteScribe génère d'abord un squelette de route dans les coordonnées de l'image de carte, via une technique nommée SGL-CFM qui déformé une ligne droite entre départ et arrivée pour épouser la géométrie du lieu, puis un modèle vision-langage pré-entraine convertit ce squelette en instruction textuelle. En tests réels, le système obtient des taux de réussite et des scores SPL (success weighted by path length) supérieurs a trois méthodes de référence : génération directe carte-vers-instruction, squelette calcule par l'algorithme A*, et flow matching a source gaussienne. L'enjeu concret touche un goulot d'étranglement bien connu du déploiement de robots mobiles autonomes en entrepôt ou en bâtiment industriel : relier la géométrie schématique d'un plan aux observations a hauteur de robot. En gardant la carte et le squelette de route en amont, hors du module exécuteur, l'architecture permet de changer de politique VLN sans reentrainer les modules qui relient carte et langage, un atout pour des intégrateurs qui assemblent des briques logicielles distinctes. Les résultats vont a l'encontre de l'idée qu'une génération directe d'instructions depuis la carte suffirait : l'ancrage explicite de la route améliore la clarté des virages saillants et la fidélité de la séquence de manoeuvres voulue. NaViRRator reste, a ce stade, une contribution de recherche publiée en preprint, sans acteur industriel, produit commercial, site de déploiement ni pilote annonces dans l'article : il s'agit d'une démonstration en environnement réel contrôle, non d'une mise en production. Le travail s'inscrit dans la lignée des politiques de navigation vision-langage pré-entraînées, traitées ici comme des exécuteurs interchangeables places en aval d'un pipeline carte-vers-instruction, une logique modulaire proche des approches vision-langage-action qui structurent aujourd'hui la robotique mobile et manipulatrice, mais appliquée spécifiquement a la navigation. Aucune date de suite, de financement ou de transfert vers un produit n'est précisée, ce qui situe cette publication comme une preuve de concept méthodologique plutôt qu'une annonce commerciale.

RecherchePaper
1 source