Aller au contenu principal
RecherchearXiv cs.RO 

Agir selon sa croyance, regarder au besoin : un modèle du monde spatial bayésien pour la navigation sous perception intermittente

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté ALONE, un modèle de monde spatial bayésien conçu pour la navigation de drones lorsque la perception est intermittente (preprint arXiv 2610.11591). Le système maintient une croyance spatiale structurée, propagée à partir des actions exécutées, puis corrigée par des observations acquises de façon sélective. Des a priori appris sur les structures géométriques courantes lui permettent d'inférer ce qui n'a pas été vu. La croyance est décodée en une estimation spatiale pour le module de planification de mouvement, accompagnée d'une carte de fiabilité qui exprime la confiance dans cette estimation. ALONE ne demande une nouvelle image que si la fiabilité insuffisante gêne la navigation et si une observation peut améliorer la région concernée. Sinon, il continue d'agir à partir de sa croyance. L'instanciation testée utilise une seule caméra de profondeur, avec une décision prise à 10 Hz. Dans deux familles de scènes simulées, le taux de succès en boucle fermée atteint 98 % et 97 %. Parmi les essais réussis, la fraction médiane de pas de décision exigeant une nouvelle image de profondeur n'est que de 0,9 % et 1,3 %. Les vols réels en intérieur ont été réussis dans 10 essais sur 10.

L'enjeu est la contention d'un capteur partagé. Sur beaucoup de robots, la même caméra doit servir à la navigation et à d'autres tâches, comme l'inspection, la manipulation ou le suivi d'une cible. La navigation classique compense l'observabilité partielle par une couverture large et haute fréquence, ce qui devient une contrainte dès que le capteur est détourné. Les chiffres indiquent qu'un drone peut naviguer en n'utilisant son capteur que pour environ un pas de décision sur cent. Cela libère le capteur pour d'autres missions et peut aussi réduire la consommation de calcul et d'énergie. Pour un intégrateur, cela ouvre la voie à des plateformes plus légères, avec moins de capteurs, ou à des robots qui alternent perception de navigation et perception de mission. Il faut toutefois rester prudent. Les résultats viennent surtout de la simulation, la validation réelle se limite à 10 vols en intérieur, et les deux familles de scènes ne sont pas décrites en détail. Les performances en environnement dynamique, avec des obstacles mobiles ou peu structurés, ne sont pas démontrées.

Ce travail s'inscrit dans la recherche sur les modèles de monde et la navigation active, où la perception est généralement traitée comme un flux continu et non comme une ressource à allouer. Il rejoint les approches de cartographie probabiliste et de perception active, mais ajoute des a priori géométriques appris et une carte de fiabilité qui pilote la décision de « regarder ». Les concurrents sont les pipelines de navigation de drone fondés sur des cartes d'occupation ou des champs de distance mis à jour en continu, ainsi que les politiques apprises de bout en bout. Ces dernières consomment toutes des images à chaque pas. L'article est un preprint (v1), sans pilote industriel ni calendrier de déploiement annoncés. Les prochaines étapes probables sont des tests sur des scènes plus variées, des environnements dynamiques et une intégration avec des tâches concurrentes réelles sur le capteur partagé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Sentir le terrain avant de le franchir : des modèles du monde pour la navigation tout-terrain
1arXiv cs.RO 

Sentir le terrain avant de le franchir : des modèles du monde pour la navigation tout-terrain

Une équipe de chercheurs présente, dans un article déposé sur arXiv (référence 2609.19863v1, catégorie "new"), Feel-WM, un modèle de monde ("world model") de navigation conçu pour les terrains accidentés hors piste. Contrairement aux modèles de navigation urbaine, qui se contentent de prédire la scène visuelle à venir, Feel-WM prédit en plus l'état proprioceptif futur du robot, c'est-à-dire son glissement, son inclinaison et ses vibrations le long d'une trajectoire envisagée, ainsi qu'un risque d'échec associé, le tout appris directement à partir de l'expérience du robot sans étiquetage humain. Le planificateur simule ce futur physique en parallèle de la scène visuelle et pondère le risque d'échec prédit face à la proximité avec l'objectif dans un score de décision séparé. Les auteurs ont testé le système sur des données réelles de terrain accidenté et en simulation, sur des plateformes à la fois à roues et à pattes, puis l'ont déployé en embarqué sur un robot à roues Husky lancé sur des sentiers de montagne, où il a anticipé les zones de sol difficile, les a contournées, et a terminé des parcours qu'une politique de bout en bout classique échouait à compléter. L'apport revendiqué est de démontrer que la seule prédiction visuelle ne suffit pas dès que l'interaction robot-terrain devient le facteur dominant, ce qui est le cas hors des environnements urbains structurés où circulent la plupart des robots mobiles commerciaux actuels. En ajoutant la proprioception comme donnée d'entrée, Feel-WM améliore la prédiction du futur physique et surpasse les modèles de navigation purement visuels, aussi bien en planification en boucle ouverte qu'en navigation en boucle fermée sur terrain difficile. Pour les intégrateurs de robots mobiles destinés à l'agriculture, la défense, la sylviculture ou le secours en zone non structurée, ce travail suggère une piste concrète pour réduire les échecs de navigation sans dépendre uniquement de caméras ou de lidars, un enjeu de fiabilité central pour les flottes autonomes en extérieur. Il nuance aussi l'idée reçue selon laquelle les modèles de monde visuels suffiraient à généraliser la planification robotique à tous les environnements. Ce travail s'inscrit dans la tendance de recherche consistant à planifier par anticipation, en simulant les conséquences de chaque action candidate plutôt qu'en associant directement observation et commande, une approche qui concurrence les politiques de bout en bout entraînées par imitation ou apprentissage par renforcement. La quasi-totalité des modèles de monde publiés jusqu'ici ciblait des environnements urbains ou structurés, où l'image seule constitue un proxy suffisant du futur pertinent pour la navigation. Feel-WM comble ce manque pour la robotique tout-terrain en exploitant des signaux proprioceptifs, issus par exemple de centrales inertielles ou d'encodeurs de roues et de jambes, appris de façon autonome. L'article ne mentionne à ce stade ni affiliation industrielle ni partenaire de déploiement commercial : il s'agit d'une validation expérimentale sur robot Husky et en simulation, sans calendrier de mise en production ni pilote industriel annoncé.

RecherchePaper
1 source
DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation
2arXiv cs.RO 

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation

Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor. L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé. Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots
3arXiv cs.RO 

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots

Des chercheurs publient Social-WM, un cadre de planification par modèle de monde latent destiné à la navigation sociale des robots, c'est-à-dire le déplacement parmi des piétons et des obstacles. Le système est entraîné uniquement à partir de séquences vidéo RGB égocentriques. Il prédit, en fonction de l'action commandée, l'observation future réellement obtenue après chaque commande. Il apprend ainsi les conséquences pertinentes pour la sécurité. Un second objectif, dit de dynamique inverse « réalisable », associe chaque transition latente observée à l'action effectivement réalisée, et non à l'action nominale demandée. Au déploiement, le robot imagine plusieurs actions candidates dans le modèle de monde. Le modèle inverse estime ensuite leur réalisabilité, et l'écart entre action nominale et action réalisable sert de signal de sécurité avant exécution. Sur le benchmark Social-HM3D, Social-WM atteint 63,77 % de réussite avec 21,67 % de collisions avec des humains. Les résultats restent solides en transfert zéro-shot sur Social-MP3D. L'approche n'utilise ni suivi explicite des piétons, ni état humain privilégié, ni apprentissage par renforcement en ligne. L'intérêt tient à la manière de traiter le problème. Une action « avancer » peut s'exécuter entièrement en espace libre, mais doit être freinée ou modifiée face à un piéton ou un obstacle. Les données de navigation sociale contiennent donc un décalage systématique entre commande et mouvement réel. En apprenant ce décalage plutôt qu'en le supposant nul, le robot dispose d'un indicateur de risque sans module de perception dédié aux humains. Pour un intégrateur, cela réduit la dépendance à des piles de suivi et de prédiction de trajectoires, coûteuses à calibrer. Le fait que la dynamique et la réalisabilité soient indépendantes du but permet de réutiliser le même modèle pour la navigation par position et par image-cible. Il faut toutefois relativiser : un taux de collision de 21,67 % reste très éloigné d'un niveau acceptable en environnement réel, et les résultats proviennent de simulation. Aucun test sur robot physique ni comparaison de coûts de calcul n'est mentionné dans le résumé. Ce travail s'inscrit dans la montée des modèles de monde latents, qui planifient dans un espace de représentation compact plutôt qu'en reconstruisant des pixels, et dans l'effort pour combler l'écart entre simulation et réel en navigation sociale. Les benchmarks utilisés, construits sur les scènes HM3D et Matterport3D, relèvent de la simulation d'intérieur et couvrent mal la variété des lieux publics. Les approches concurrentes reposent généralement soit sur l'apprentissage par renforcement en ligne, soit sur des modules explicites de suivi des piétons. La suite logique est une validation sur plateforme mobile réelle, dans des espaces partagés comme les hôpitaux ou la logistique, où des robots mobiles autonomes (AMR) croisent déjà des opérateurs. Il s'agit pour l'instant d'une préimpression arXiv (v1), non évaluée par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives
4arXiv cs.RO 

GLAM : un modèle du monde latent sur mémoire spatiotemporelle globale pour l'exploration et la navigation actives

Un nouveau papier de recherche publié le 14 septembre 2026 sur arXiv (référence 2609.14561, soumission inédite, non encore relue par les pairs) présente GLAM, un modèle du monde latent conditionné par un objectif et entraîné sur une mémoire spatiotemporelle globale, ainsi que GLAM NAV, le système de navigation complet construit autour de ce modèle. À partir de tokens de carte historiques, d'un objectif de navigation et de la pose courante du robot, GLAM prédit conjointement les représentations futures de la carte et les latents de points de passage centrés sur le robot, dans un espace de représentation partagé. Le modèle suit un paradigme de prédiction latente de type JEPA, opère directement sur des tokens latents au niveau de la carte plutôt que sur une reconstruction d'images RGB, et s'appuie sur un encodeur-décodeur de waypoints pré-entraîné pour superviser et décoder les plans de navigation. Les données d'entraînement proviennent de trajectoires expertes de la tâche ObjectNav rejouées dans le simulateur Habitat sur les scènes HM3D v0.2, découpées en échantillons de prédiction à plusieurs échelles temporelles. Sur un sous-ensemble contrôlé du benchmark HM3D-ObjectNav, GLAM NAV dépasse une base de référence BSC-Nav reproduite, à la fois en taux de succès et en SPL (succès pondéré par la longueur du chemin). L'intérêt pour la robotique mobile tient à l'approche : en prédisant l'évolution de la mémoire spatiale et l'intention de navigation dans un même espace latent, sans reconstruire des images pixel par pixel, GLAM illustre la piste des modèles du monde compacts appliqués à l'exploration active et à la navigation sémantique, plutôt qu'aux seules politiques d'action de type VLA. Pour les intégrateurs travaillant sur des robots autonomes en environnement inconnu, ce type d'approche promet une planification moins coûteuse en calcul que les pipelines classiques de reconstruction 3D. Le résultat reste toutefois circonscrit à un sous-ensemble contrôlé en simulation, sans validation sur robot réel ni déploiement annoncé, ce qui limite pour l'instant la portée de la comparaison à BSC-Nav. Le travail s'inscrit dans la lignée des architectures JEPA (prédiction dans l'espace latent plutôt que reconstruction pixel) appliquées cette fois à la navigation robotique, en s'appuyant sur l'écosystème de simulation Habitat et le jeu de scènes HM3D largement utilisés par la communauté ObjectNav. Le résumé ne précise ni les auteurs ni leur institution, ni de calendrier de validation matérielle ; il s'agit à ce stade d'une contribution académique en amont de toute intégration industrielle.

RecherchePaper
1 source