Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable
Un preprint arXiv (2609.16737, mis en ligne mi-septembre 2026) présente CueNav, un système de navigation robotique combinant planification vidéo guidée par indices visuels et modèle inverse-dynamique (IDM) propre a chaque plateforme. Le planificateur vidéo s'appuie sur deux indices : une carte vue-du-dessus (Bird's-Eye View) donnant le contexte global de la tache, et le maintien d'une partie du corps du robot dans le champ égocentrique pour exposer le contexte d'embodiment. L'IDM traduit ensuite les champs de flux optique extraits de la vidéo en commandes d'actuation. Sur un test de labyrinthe, CueNav quasiment double le taux de réussite par rapport a une planification sans indice global, et atteint 70% de réussite dans un couloir étroit la ou les méthodes comparées échouent majoritairement. Les auteurs démontrent aussi une navigation conditionnée sémantiquement en zero-shot et le déploiement d'un même planificateur vidéo sur plusieurs plateformes robotiques, avec code et résultats sur cuenav.github.io.
Le travail cible un angle mort des approches actuelles de navigation par modèle vidéo, qui conditionnent généralement la planification sur un horizon court et récupèrent des points de passage géométriques via reconstruction de scene, au détriment du long horizon et d'une traduction vidéo-vers-action précise. En couplant contexte global et ancrage d'action spécifique a l'embodiment, CueNav esquisse une piste pour transformer les modèles vidéo génératifs en véritable backbone de politique de navigation généralisable, plutôt qu'en simple outil de visualisation a court terme. Pour les intégrateurs qui explorent les architectures vision-langage-action (VLA) au-delà de la manipulation, cela suggère qu'une même logique de planification vidéo peut se transférer entre plateformes, un enjeu pour les flottes hétérogènes d'AMR et de robots humanoïdes.
Ce travail s'inscrit dans une tendance ou des modèles vidéo génératifs sont testes comme backbone de politiques robotiques, en parallèle d'architectures VLA comme Pi-0 ou GR00T N2 employées en manipulation, et se positionne explicitement contre les méthodes limitant la planification a un horizon court avec reconstruction géométrique. Il s'agit d'un preprint non encore revu par les pairs, dont les taux de réussite annonces (quasi-doublement en labyrinthe, 70% en couloir étroit) proviennent de bancs d'essai contrôles propres a l'étude, sans précision sur le nombre d'essais ni déploiement en environnement industriel réel. Aucune entreprise ni feuille de route commerciale n'est associée a l'annonce : il s'agit d'une contribution académique, sans calendrier de pilote a ce jour.
Dans nos dossiers




