LiteNWM : des modèles du monde latents efficaces pour la navigation visuelle embarquée en milieu naturel
LiteNWM, présenté dans un preprint arXiv (2610.12368), est un modèle de monde latent pour la navigation visuelle embarquée. Il vise à évaluer les conséquences futures de plusieurs trajectoires candidates sans générer de vidéo. Le système partage un seul encodage visuel entre tous les candidats. Il prédit conjointement leurs représentations futures conditionnées par l'action, à plusieurs horizons temporels. Un scoreur appris exploite ces prédictions pour choisir la meilleure trajectoire. Hors ligne, sur les jeux de données RECON, SCAND et SACSoN, l'erreur de trajectoire moyenne (macro-moyenne) baisse de 17,56 % par rapport à NoMaD couplé à NWM-XL. L'accélération de bout en bout atteint un facteur 128 sur une RTX 5090. Le même évaluateur passe de NoMaD à MBRA sans réentraînement propre au générateur de trajectoires, avec 16,2 % d'erreur en moins pour MBRA. Sur robot réel, dans des environnements intérieurs et extérieurs inconnus, le taux de réussite de navigation passe de 43,3 % à 83,3 % par rapport à NoMaD seul.
L'intérêt tient à la levée d'un compromis. Les politiques directes comme NoMaD sont rapides mais ne vérifient pas ce que leurs actions provoquent. Les world models génératifs apportent cette anticipation, mais leurs déroulés visuels pixel par pixel sont trop coûteux dès qu'il faut comparer plusieurs candidats. Travailler dans l'espace latent et mutualiser l'encodage rend la planification avec anticipation compatible avec le calcul embarqué. Le fait que l'évaluateur se greffe sur un autre proposeur suggère aussi une brique modulaire, réutilisable sans refaire tout l'apprentissage. Il faut toutefois rester prudent : le gain de 128 fois est mesuré sur un GPU de bureau haut de gamme, pas sur un module embarqué type Jetson. Les résultats réels reposent sur un nombre d'essais probablement limité, le détail du protocole n'étant pas donné dans le résumé. La plateforme robotique n'y est pas précisée non plus.
Ces travaux s'inscrivent dans la lignée des politiques de navigation généralistes entraînées sur de grandes collections de données de robots mobiles, dont NoMaD, et des Navigation World Models, qui ont introduit la simulation vidéo conditionnée par l'action pour la navigation. MBRA représente l'autre voie, celle de la réannotation des données pour améliorer les politiques. LiteNWM se positionne comme une couche d'évaluation commune à ces approches. La suite logique serait des tests sur matériel embarqué contraint, sur des parcours plus longs et dans des environnements plus denses. La publication de code et de poids conditionnera son adoption par la communauté.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




