Voir l'invisible : invite visuelle guidée par la physique pour une navigation VLA sensible à la température et aux radiations
Des chercheurs proposent PG-VP (Physics-Guided Visual Prompting), un module de perception multimodal « plug-and-play » qui permet à un modèle vision-langage-action (VLA) de navigation d'éviter des dangers invisibles à une caméra RGB, comme une source de rayonnement ou un pic de température. Le module évalue le risque à partir de la physique d'une source thermique ou radioactive proche, détermine la direction d'évitement, puis superpose aux images un obstacle virtuel qui se déplace d'une image à l'autre (Dynamic Visual Prompting). La politique de navigation, restée gelée, contourne alors le danger comme elle le ferait pour un obstacle visible. L'obstacle virtuel est identique quel que soit le type de risque. Sans danger détecté, rien n'est affiché et la politique se comporte comme sans PG-VP. Sur OmniNav, avec les splits val-unseen de R2R-CE et RxR-CE, le module oriente la politique vers l'action à faible risque dans 84,9 % et 83,2 % des cas, pour un coût de 6,8 et 7,9 points de taux de succès de navigation. Un test sur robot réel, avec de vraies sources thermiques et radioactives et sans réentraînement, améliore de 63,45 % (thermique) et 32,59 % (radiation) la sécurité moyenne des 10 % pires trajectoires.
L'intérêt tient à la méthode. Intégrer un nouveau risque à un VLA exige d'ordinaire un encodeur dédié, de nouvelles données et un réentraînement, un coût qui freine le déploiement en site sensible (installations nucléaires, sites industriels chauds). PG-VP déplace le problème vers l'entrée visuelle. Ajouter un capteur ne change pas le motif de prompt, ce qui rend l'extension peu coûteuse pour un intégrateur. Le travail montre aussi qu'un VLA gelé peut être détourné vers un comportement de sécurité sans toucher à ses poids. Deux réserves s'imposent. Le gain n'est pas gratuit : la perte de 7 à 8 points de succès est significative pour un robot de production. Et les résultats réels portent sur des « scénarios distincts » dont l'ampleur n'est pas précisée, avec une métrique centrée sur les pires 10 % des trajectoires. Il s'agit d'une preuve de concept académique, pas d'un produit.
Le travail s'inscrit dans la vague des modèles VLA appliqués à la navigation vision-langage (VLN), évalués sur les benchmarks R2R-CE et RxR-CE, ici avec OmniNav comme politique de base. La sécurité de ces modèles reste un angle peu traité : la plupart des travaux visent le taux de succès en environnement domestique simulé, pas les risques non visuels. L'approche concurrence implicitement les solutions qui ajoutent des modalités et réentraînent les modèles. Aucun pilote ni calendrier n'est annoncé. Les prochaines étapes probables sont l'ajout d'autres capteurs (gaz, champs électromagnétiques), des tests sur plus de scénarios réels et une réduction du compromis sur le succès de navigation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




