Aller au contenu principal
RecherchearXiv cs.RO 

LiteNWM : des modèles du monde latents efficaces pour la navigation visuelle embarquée en milieu naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

LiteNWM, présenté dans un preprint arXiv (2610.12368), est un modèle de monde latent pour la navigation visuelle embarquée. Il vise à évaluer les conséquences futures de plusieurs trajectoires candidates sans générer de vidéo. Le système partage un seul encodage visuel entre tous les candidats. Il prédit conjointement leurs représentations futures conditionnées par l'action, à plusieurs horizons temporels. Un scoreur appris exploite ces prédictions pour choisir la meilleure trajectoire. Hors ligne, sur les jeux de données RECON, SCAND et SACSoN, l'erreur de trajectoire moyenne (macro-moyenne) baisse de 17,56 % par rapport à NoMaD couplé à NWM-XL. L'accélération de bout en bout atteint un facteur 128 sur une RTX 5090. Le même évaluateur passe de NoMaD à MBRA sans réentraînement propre au générateur de trajectoires, avec 16,2 % d'erreur en moins pour MBRA. Sur robot réel, dans des environnements intérieurs et extérieurs inconnus, le taux de réussite de navigation passe de 43,3 % à 83,3 % par rapport à NoMaD seul.

L'intérêt tient à la levée d'un compromis. Les politiques directes comme NoMaD sont rapides mais ne vérifient pas ce que leurs actions provoquent. Les world models génératifs apportent cette anticipation, mais leurs déroulés visuels pixel par pixel sont trop coûteux dès qu'il faut comparer plusieurs candidats. Travailler dans l'espace latent et mutualiser l'encodage rend la planification avec anticipation compatible avec le calcul embarqué. Le fait que l'évaluateur se greffe sur un autre proposeur suggère aussi une brique modulaire, réutilisable sans refaire tout l'apprentissage. Il faut toutefois rester prudent : le gain de 128 fois est mesuré sur un GPU de bureau haut de gamme, pas sur un module embarqué type Jetson. Les résultats réels reposent sur un nombre d'essais probablement limité, le détail du protocole n'étant pas donné dans le résumé. La plateforme robotique n'y est pas précisée non plus.

Ces travaux s'inscrivent dans la lignée des politiques de navigation généralistes entraînées sur de grandes collections de données de robots mobiles, dont NoMaD, et des Navigation World Models, qui ont introduit la simulation vidéo conditionnée par l'action pour la navigation. MBRA représente l'autre voie, celle de la réannotation des données pour améliorer les politiques. LiteNWM se positionne comme une couche d'évaluation commune à ces approches. La suite logique serait des tests sur matériel embarqué contraint, sur des parcours plus longs et dans des environnements plus denses. La publication de code et de poids conditionnera son adoption par la communauté.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots
1arXiv cs.RO 

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots

Des chercheurs publient Social-WM, un cadre de planification par modèle de monde latent destiné à la navigation sociale des robots, c'est-à-dire le déplacement parmi des piétons et des obstacles. Le système est entraîné uniquement à partir de séquences vidéo RGB égocentriques. Il prédit, en fonction de l'action commandée, l'observation future réellement obtenue après chaque commande. Il apprend ainsi les conséquences pertinentes pour la sécurité. Un second objectif, dit de dynamique inverse « réalisable », associe chaque transition latente observée à l'action effectivement réalisée, et non à l'action nominale demandée. Au déploiement, le robot imagine plusieurs actions candidates dans le modèle de monde. Le modèle inverse estime ensuite leur réalisabilité, et l'écart entre action nominale et action réalisable sert de signal de sécurité avant exécution. Sur le benchmark Social-HM3D, Social-WM atteint 63,77 % de réussite avec 21,67 % de collisions avec des humains. Les résultats restent solides en transfert zéro-shot sur Social-MP3D. L'approche n'utilise ni suivi explicite des piétons, ni état humain privilégié, ni apprentissage par renforcement en ligne. L'intérêt tient à la manière de traiter le problème. Une action « avancer » peut s'exécuter entièrement en espace libre, mais doit être freinée ou modifiée face à un piéton ou un obstacle. Les données de navigation sociale contiennent donc un décalage systématique entre commande et mouvement réel. En apprenant ce décalage plutôt qu'en le supposant nul, le robot dispose d'un indicateur de risque sans module de perception dédié aux humains. Pour un intégrateur, cela réduit la dépendance à des piles de suivi et de prédiction de trajectoires, coûteuses à calibrer. Le fait que la dynamique et la réalisabilité soient indépendantes du but permet de réutiliser le même modèle pour la navigation par position et par image-cible. Il faut toutefois relativiser : un taux de collision de 21,67 % reste très éloigné d'un niveau acceptable en environnement réel, et les résultats proviennent de simulation. Aucun test sur robot physique ni comparaison de coûts de calcul n'est mentionné dans le résumé. Ce travail s'inscrit dans la montée des modèles de monde latents, qui planifient dans un espace de représentation compact plutôt qu'en reconstruisant des pixels, et dans l'effort pour combler l'écart entre simulation et réel en navigation sociale. Les benchmarks utilisés, construits sur les scènes HM3D et Matterport3D, relèvent de la simulation d'intérieur et couvrent mal la variété des lieux publics. Les approches concurrentes reposent généralement soit sur l'apprentissage par renforcement en ligne, soit sur des modules explicites de suivi des piétons. La suite logique est une validation sur plateforme mobile réelle, dans des espaces partagés comme les hôpitaux ou la logistique, où des robots mobiles autonomes (AMR) croisent déjà des opérateurs. Il s'agit pour l'instant d'une préimpression arXiv (v1), non évaluée par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire
2arXiv cs.RO 

Vers des modèles du monde unifiés pour la navigation visuelle par planification et anticipation augmentées de mémoire

Une équipe de recherche présente UniWM, un « world model » unifié et augmenté par mémoire pour la navigation visuelle des agents incarnés, détaillé dans une version mise à jour d'un article arXiv (2510.08713v3). Le système fusionne, au sein d'un seul backbone autorégressif multimodal, la prévision visuelle égocentrique des états futurs et la planification d'actions, évitant le découplage classique entre ces deux modules qui provoque un désalignement état-action dans les architectures modulaires habituelles. Un mécanisme de mémoire hiérarchique combine indices perceptifs à court terme et contexte de trajectoire à long terme pour maintenir un raisonnement stable sur des horizons étendus. Testé sur quatre bancs d'essai (Go Stanford, ReCon, SCAND, HuRoN) ainsi que sur le 1X Humanoid Dataset, issu du fabricant de robots humanoïdes 1X Technologies, UniWM améliore le taux de réussite de navigation jusqu'à 30% face aux meilleures références existantes, réduit sensiblement les erreurs de trajectoire, et généralise en zero-shot sur le jeu de données inédit TartanDrive. Code et modèles sont publiés en open source sur GitHub, sous UWMILab/UniWM. Le résultat cible un point de friction connu en robotique embarquée : les piles de navigation modulaires, qui séparent planification et modélisation visuelle, s'adaptent mal aux scénarios dynamiques ou inédits faute d'alignement entre prédiction et décision. En ancrant explicitement l'action sur des états futurs imaginés au sein d'un modèle unique entraîné de bout en bout, UniWM illustre une alternative aux pipelines fragmentés, un enjeu concret pour les intégrateurs qui déploient des robots mobiles ou humanoïdes en environnement non structuré. Le transfert réussi vers un jeu de données humanoïde suggère une passerelle entre navigation mobile classique et locomotion humanoïde, même si ces gains restent mesurés sur des bancs d'essai académiques standardisés, pas en conditions réelles de déploiement. UniWM s'inscrit dans la tendance de recherche vers des modèles du monde unifiés, où prévision visuelle et contrôle fusionnent dans un système génératif unique plutôt qu'en sous-modules séparés, une logique voisine de celle poursuivie par les laboratoires développant des modèles vision-langage-action pour la manipulation robotique. Porté par le UWMILab, le projet met code et poids à disposition de la communauté académique sans annonce de partenariat industriel ni de calendrier de déploiement pilote, et aucun acteur européen n'apparaît dans les benchmarks utilisés. La prochaine étape annoncée reste l'appropriation du code par les chercheurs en navigation visuelle et robotique incarnée.

RecherchePaper
1 source
DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation
3arXiv cs.RO 

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation

Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor. L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé. Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
4arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source