GeoScaffold : apprendre des latents géométriques compacts par reconstruction pour une navigation vision-langage efficace
Une équipe de chercheurs publie sur arXiv GeoScaffold, un cadre de supervision géométrique pour la navigation vision-langage (VLN) en environnement continu. Il cible les politiques Video-LLM en streaming. Ces modèles convertissent directement des images RGB égocentriques et une instruction en actions de bas niveau, mais héritent de faibles a priori 3D de leur préentraînement 2D. La méthode se déroule en deux temps. Un tokenizer de profondeur compact est d'abord appris sur les cartes de profondeur des trajectoires d'entraînement, puis gelé. La politique est ensuite affinée avec quelques tokens de requête géométrique apprenables, dont les états cachés doivent reconstruire des informations utiles à la navigation: profondeur, connectivité de l'espace et traversabilité. Après l'entraînement, le tokenizer, les générateurs de cibles et les têtes de reconstruction sont supprimés. Le backbone et l'interface d'action restent identiques. Les auteurs affirment que GeoScaffold surpasse les navigateurs purement visuels de référence sur des benchmarks VLN continus. Le résumé ne donne aucun chiffre, ni taux de succès, ni latence, ni taille de modèle.
L'enjeu est le coût d'inférence. Les extensions géométriques existantes imposent en production des capteurs de profondeur, des encodeurs 3D ou des appels d'outils de perception à chaque pas. Cela alourdit la nomenclature matérielle, la consommation et la latence. GeoScaffold déplace ce coût vers l'entraînement. Pour un intégrateur qui vise un déploiement embarqué sur robot mobile ou quadrupède, l'idée est donc de gagner en compréhension spatiale sans ajouter de capteur. Il faut toutefois rester prudent. Les résultats portent sur des benchmarks, probablement simulés, et aucun essai sur robot réel n'est mentionné. La profondeur reste indispensable à l'entraînement, ce qui suppose des données qui en contiennent. Ce travail ne tranche donc pas la question du transfert sim-to-real.
Ce travail s'inscrit dans le passage des pipelines de navigation modulaires aux politiques de bout en bout de type VLA et Video-LLM. Ces dernières sont séduisantes par leur simplicité, mais limitées par leur pauvreté géométrique. Les approches concurrentes y répondent en ajoutant des modules au moment de l'inférence. GeoScaffold suit l'autre voie, qui consiste à injecter la structure 3D dans les poids par des objectifs auxiliaires de reconstruction. Aucun acteur français ou européen n'est cité. Il s'agit d'un preprint, sans produit ni déploiement. Les prochaines étapes à surveiller sont la publication du code, la mesure de la latence sur matériel embarqué et une validation sur robot physique.
Dans nos dossiers




