NavVerse : évaluer la navigation incarnée intérieur-extérieur en simulation robotique continue
NavVerse est un nouveau benchmark de simulation physique dédié à la navigation robotique continue entre intérieur et extérieur, présenté dans un article déposé sur arXiv le 24 juillet 2026. Il couvre 100 scènes intérieures, 50 scènes urbaines extérieures et 50 scènes hybrides intérieur-extérieur, pour un total de 10 000 épisodes répartis sur trois tâches : navigation vers un objet (Object Navigation), navigation guidée par le langage (Vision-and-Language Navigation) et navigation vers un lieu (Place Navigation), où l'agent doit localiser des points d'intérêt sémantiques comme un restaurant ou une banque. Contrairement aux benchmarks existants qui évaluent séparément l'intérieur et l'extérieur et abstraient souvent l'exécution robotique réelle, NavVerse impose aux agents de passer par des interfaces robotiques exécutables, avec des métriques de succès de tâche, d'efficacité de trajectoire et de sécurité. Les tests zéro-shot menés avec des baselines par apprentissage par renforcement (RL), des modèles vision-langage-action (VLA) et des architectures modulaires montrent qu'aucune approche ne résout le problème : les VLA de bout en bout obtiennent le meilleur taux de succès zéro-shot, tandis que la méthode modulaire affiche le meilleur profil de sécurité.
Cette double évaluation comble un angle mort réel du secteur : la plupart des robots de livraison, de campus ou d'intervention d'urgence doivent aujourd'hui franchir la frontière bâtiment-rue au sein d'un seul épisode continu, un cas d'usage rarement testé de bout en bout. Le résultat le plus révélateur concerne PlaceNav, dont les performances chutent nettement dès qu'on passe d'un environnement purement extérieur à un scénario hybride intérieur-extérieur, ce qui pointe l'adaptation au changement de contexte comme goulot d'étranglement majeur plutôt que la perception ou la planification prises isolément. Pour les intégrateurs et décideurs B2B, ce constat tempère l'idée que les modèles VLA génériques sont prêts à généraliser sans friction hors des environnements d'entraînement : le meilleur taux de succès zéro-shot ne s'accompagne pas du meilleur niveau de sécurité, ce qui illustre un arbitrage encore mal résolu entre performance brute et fiabilité opérationnelle.
Le benchmark s'inscrit dans une lignée de plateformes de simulation pour la navigation incarnée (embodied navigation), généralement centrées soit sur l'intérieur soit sur l'extérieur, que NavVerse cherche explicitement à unifier en modélisant la traversée de frontière, la recherche de sortie et les échecs kinodynamiques souvent ignorés ailleurs. L'article ne précise pas d'institution porteuse ni de partenaire industriel, et reste à ce stade un outil d'évaluation académique plutôt qu'un produit déployé. Les prochaines étapes annoncées concernent l'élargissement des baselines testées et l'affinement des scénarios hybrides, dans un contexte où la course aux agents de navigation généralistes s'intensifie face à la difficulté persistante de transférer des compétences apprises en simulation vers des déploiements réels multi-environnements.
Dans nos dossiers




