Aller au contenu principal
NavDreamer : des modèles vidéo comme navigateurs 3D en zero-shot
RecherchearXiv cs.RO 

NavDreamer : des modèles vidéo comme navigateurs 3D en zero-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent NavDreamer, un framework de navigation robotique en 3D publié sur arXiv sous la référence 2602.09765 (version 2, révisée, papier initialement déposé début 2026). Le système utilise des modèles vidéo génératifs comme interface universelle entre des instructions en langage naturel et des trajectoires de navigation, plutôt que de s'appuyer sur les représentations statiques des modèles Vision-Language-Action (VLA) classiques. Pour gérer le caractère aléatoire des prédictions vidéo, les auteurs ajoutent une méthode d'optimisation par échantillonnage : un modèle de langage visuel (VLM) note et sélectionne les trajectoires générées. Un modèle de dynamique inverse convertit ensuite ces plans vidéo en points de passage exécutables par le robot. L'équipe a construit un benchmark maison couvrant cinq tâches, la navigation vers un objet, la navigation de précision, l'ancrage spatial, le contrôle par le langage et le raisonnement de scène, pour tester plusieurs modèles vidéo de base. Les expériences montrent une généralisation à des objets et environnements inédits.

Sur le fond, le travail cible un problème central du secteur : la rareté des données de navigation, coûteuses à collecter par téléopération, et l'incapacité des représentations figées à capturer la dynamique temporelle et les lois physiques. En s'appuyant sur des modèles vidéo entraînés à l'échelle d'internet plutôt que sur des démonstrations robotiques dédiées, NavDreamer teste l'hypothèse selon laquelle la vidéo peut servir de modèle du monde généraliste pour la navigation, sans réentraînement spécifique par environnement. Une conclusion issue des études d'ablation nuance toutefois la portée de l'approche : la navigation se prête bien à ce type de planification vidéo parce qu'elle relève surtout de décisions de haut niveau, où aller, quoi éviter, et non de contrôle moteur fin. Rien n'indique que la méthode transfère aussi bien à des tâches de manipulation exigeant une précision articulaire élevée. Les scores de généralisation « zéro-shot » sont par ailleurs mesurés sur un benchmark conçu par les auteurs eux-mêmes, ce qui appelle une lecture prudente avant toute comparaison avec des déploiements industriels réels.

Le papier s'inscrit dans la lignée des modèles VLA qui dominent la robotique généraliste depuis plusieurs années, dans la même famille conceptuelle que des systèmes comme Pi-0, GR00T N2 ou Helix, tous confrontés au même goulot d'étranglement : des jeux de démonstrations robotiques restreints et coûteux à produire. NavDreamer s'en distingue en déportant l'apprentissage vers des modèles vidéo génératifs pré-entraînés sur des corpus internet, une piste explorée en parallèle par plusieurs laboratoires de recherche en robotique et en vision par ordinateur. À ce stade, il s'agit d'une contribution académique : aucun déploiement sur robot physique, aucun partenaire industriel ni date de commercialisation n'apparaît dans la publication. Le benchmark introduit par les auteurs est présenté comme un outil de comparaison entre architectures vidéo, ce qui suggère que la prochaine étape sera une course de performance entre modèles de base avant tout passage à la production.

Dans nos dossiers

À lire aussi

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
1arXiv cs.RO 

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot

Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet. L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle. Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.

RecherchePaper
1 source
TADreamer : navigation 3D guidée par le langage en zero-shot pour robots bimodaux terrestres-aériens via imagination vidéo
2arXiv cs.RO 

TADreamer : navigation 3D guidée par le langage en zero-shot pour robots bimodaux terrestres-aériens via imagination vidéo

TADreamer, présenté dans un article arXiv déposé sous la référence 2609.19824v1, est un framework de navigation zero-shot pour robots bimodaux terrestres-aériens guidés par instructions en langage naturel. Le système fait traduire par un modèle vision-langage les observations embarquées et les consignes en prompts de génération vidéo, sélectionne les séquences vidéo générées valides et redemande une régénération si nécessaire. La vidéo retenue est reconstruite en waypoints 3D annotés du mode de déplacement, terrestre ou aérien, puis calibrée en deux étapes: une initialisation de l'échelle via les contraintes de champ de vision, suivie d'un raffinement des échelles par axe, de la rotation et de la translation par recalage du nuage de points sur la géométrie mesurée. Les expériences en conditions réelles couvrent sept scénarios, intérieurs et extérieurs. Avec cinq candidats vidéo par cycle, des séquences exploitables sont obtenues en au plus deux cycles dans les sept cas testés. Sur les observations de calibration, la méthode réduit l'erreur de profondeur absolue moyenne de 87,7% et l'erreur de profondeur relative moyenne de 86,3% par rapport à NavDreamer, la référence antérieure citée dans l'étude. L'enjeu dépassé le simple exercice académique: la génération vidéo comme représentation intermédiaire pour la planification robotique se heurte d'habitude à un problème d'ambiguïté d'échelle et de distorsions géométriques dépendant des axes, ce qui rend les trajectoires imaginées inexploitables telles quelles pour un contrôle physique précis. TADreamer illustre une voie pour ancrer ces vidéos générées dans une géométrie mesurée sans entraînement spécifique à la tâche ni fine-tuning, ce qui intéresse directement les équipes travaillant sur les world models appliqués à la navigation et sur l'interopérabilité entre modes de locomotion, un terrain encore peu couvert face aux approches VLA généralistes à mode unique. Le travail se positionne explicitement comme une amélioration face à NavDreamer, seule référence comparative citée dans l'abstract, sur la métrique de précision de profondeur. Aucune entreprise, aucun nom d'institution ni acteur français ou européen n'est mentionné dans le résumé fourni: il s'agit d'une publication de recherche fraîchement annoncée sur arXiv, sans indication de déploiement commercial, de partenariat industriel ni de calendrier de suite. Les prochaines étapes, extension à d'autres plateformes, validation à plus grande échelle, ne sont pas précisées dans le document.

RecherchePaper
1 source
ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
3arXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D). L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles. Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

RecherchePaper
1 source
EmboAlign : aligner la génération vidéo avec des contraintes de composition pour la manipulation en zero-shot
4arXiv cs.RO 

EmboAlign : aligner la génération vidéo avec des contraintes de composition pour la manipulation en zero-shot

EmboAlign, décrit dans une version révisée d'un article arXiv (2603.05757v2), est un framework de manipulation robotique zero-shot qui combine modèles génératifs vidéo (VGM) et modèles vision-langage (VLM) pour convertir une instruction textuelle en trajectoire robot exécutable, sans donnée d'entraînement spécifique à la tâche. À l'inférence, un VLM extrait des contraintes compositionnelles à partir de l'instruction ; elles servent d'abord à filtrer un lot de vidéos générées par le VGM pour ne garder que le rollout le plus physiquement plausible, puis à optimiser la trajectoire robot correspondante afin de corriger les erreurs de retargeting géométrique. Sur six tâches de manipulation exécutées sur robot réel exigeant une précision fine, les auteurs rapportent un gain de 43,3 points de pourcentage de taux de succès par rapport à la meilleure baseline testée, sans aucune donnée d'entraînement propre à la tâche. Ce résultat cible un problème connu du secteur : les modèles vidéo pré-entraînés sur des corpus internet produisent des séquences visuellement cohérentes mais souvent physiquement invraisemblables, et leur conversion en commandes robot par estimation de profondeur et suivi de points clés accumule des erreurs à chaque étape. En traitant le VLM comme un module de raisonnement spatial complémentaire, plutôt que comme un générateur d'actions entraîné de bout en bout, EmboAlign teste l'idée que des modèles génériques, jamais affinés sur des démonstrations robotiques, peuvent piloter une manipulation fine sans la collecte massive de données de téléopération qui alimente la plupart des piles VLA commerciales actuelles. Ce gain reste toutefois à relativiser tant que le niveau absolu de performance de la baseline et la diversité réelle du panel de tâches ne sont pas détaillés au-delà du résumé. Ce travail prolonge une ligne de recherche qui utilise la génération vidéo comme modèle du monde pour la planification robotique, longtemps freinée par l'écart entre vidéos plausibles et actions exécutables en toute sécurité. Il se positionne à contre-courant de la stratégie dominante de l'industrie, portée par des modèles vision-langage-action entraînés de bout en bout sur de vastes jeux de démonstrations téléopérées ou simulées, à l'image de Pi-0 de Physical Intelligence, de la série GR00T de NVIDIA ou de Helix de Figure AI, qui misent sur le volume de données plutôt que sur des contraintes ajoutées à l'inférence. L'article ne précise ni l'affiliation des auteurs ni de calendrier de déploiement industriel ; il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé en laboratoire sur un nombre restreint de tâches, sans pilote ni produit commercial annoncé.

RecherchePaper
1 source