ImagiNav : navigation incarnée à grande échelle par prédiction visuelle générative et dynamique inverse
Des chercheurs proposent ImagiNav, un cadre hiérarchique de navigation robotique guidée par le langage, décrit dans un article arXiv (2603.13833, version 2). Au lieu de prédire directement des points de passage (waypoints) comme les politiques de bout en bout classiques, le système génère une vidéo égocentrique future, conditionnée par une instruction en langage naturel. Cette vidéo sert de plan de haut niveau. Un modèle de dynamique inverse l'interprète ensuite pour en extraire des trajectoires métriques exécutables par le robot. Les auteurs ont aussi développé un pipeline d'auto-étiquetage qui améliore la précision des annotations de mouvement. Ils revendiquent un transfert zero-shot vers la navigation robotique, sans aucune démonstration sur robot. L'abstract ne donne ni chiffres de performance, ni taux de réussite, ni robot de test, ni volume de vidéos d'entraînement. Une page de projet est annoncée.
L'intérêt est d'abord économique. La navigation vision-langage (VLN) repose aujourd'hui sur des politiques entraînées sur des données robot coûteuses et propres à chaque morphologie. Les modèles de fondation entraînés sur de vastes volumes de simulation progressent, mais butent sur la diversité limitée des scènes et sur le réalisme visuel. En séparant la planification (dans l'espace visuel) de l'actionnement (confié au modèle de dynamique inverse), ImagiNav permet d'exploiter des vidéos de navigation « in the wild », non étiquetées, qui existent en quantité bien supérieure à toute collecte robotique. Si l'approche tient à l'échelle, elle réduirait la dépendance aux flottes de téléopération et au sim-to-real. Les réserves sont claires : sans métriques publiées dans l'abstract, le transfert « zero-shot » reste à vérifier sur des environnements variés. La génération vidéo reste coûteuse en calcul et pose la question de la latence en boucle fermée. Rien n'indique non plus que la vidéo imaginée respecte les contraintes physiques et la sécurité d'un déploiement réel.
Ce travail s'inscrit dans un mouvement plus large où les modèles génératifs de vidéo servent de « modèles du monde » pour la planification, en parallèle des architectures VLA (vision-langage-action) qui prédisent directement les actions. Il s'oppose aux approches de VLN de bout en bout entraînées sur données robot, et prolonge les travaux qui extraient des actions de vidéos via des modèles de dynamique inverse. Il s'agit d'un résultat de recherche académique, sans produit, pilote industriel ni calendrier de déploiement annoncé. Les prochaines étapes à surveiller sont la publication de résultats chiffrés sur robots réels, la comparaison avec les politiques VLN de référence et la libération éventuelle du code et du pipeline d'annotation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




