Robostral Navigate
Voici l'article traduit et résumé :
Des chercheurs présentent Robostral Navigate, un modèle vision-langage de 8 milliards de paramètres dédié à la navigation robotique, entraîné à partir d'un unique flux de caméra RGB monoculaire. Contrairement aux systèmes actuels qui s'appuient sur des capteurs de profondeur, des rigs multi-caméras ou des cartes préconstruites, le modèle prédit directement des points de passage en pointant vers la prochaine position cible dans l'image de la caméra courante. Cette approche, opérant en espace image plutôt qu'en coordonnées propres au robot, le rend robuste aux variations d'intrinsèques caméra et d'échelle de scène. L'équipe a généré 2,4 millions de trajectoires sur 350 000 scènes simulées pour limiter la collecte de données réelles, et développé une recette d'entraînement par mise en cache de préfixes qui réduit le nombre de tokens d'entraînement d'un facteur 22, ramenant le temps d'entraînement de plusieurs mois à quelques jours. Un masque d'attention arborescent empêche le modèle de se reposer sur les actions vérité-terrain précédentes, et de l'apprentissage par renforcement améliore ensuite ses capacités d'exploration et de récupération. Sur les benchmarks R2R-CE et RxR-CE, Robostral Navigate établit un nouvel état de l'art : 77,4% de taux de réussite sur R2R-CE (10,5 points devant la meilleure méthode monoculaire, 5,3 points devant le meilleur système à profondeur ou multi-caméras), et 75,1% sur RxR-CE, devançant toutes les références monoculaires.
L'intérêt pour l'industrie tient au découplage entre performance de navigation et richesse capteur : un seul flux RGB suffit désormais à surpasser des systèmes équipés de capteurs de profondeur, ce qui réduit le coût matériel de déploiement et permet, en théorie, une portabilité directe entre robots à roues, robots à pattes et drones sans recalibration. Cela remet en question l'hypothèse répandue selon laquelle la perception de profondeur explicite serait nécessaire pour une navigation fiable en environnement complexe.
Il s'agit toutefois d'un travail de recherche publié sur arXiv (arXiv:2607.20785v1), entraîné et validé en simulation sur des benchmarks académiques standards de navigation vision-langage (Room-to-Room et Room-Across-Room en environnements continus), sans mention de déploiement sur robot physique ni de partenaire industriel. La méthode s'inscrit dans la lignée des modèles VLA appliqués à la navigation, où la généralisation inter-embodiments et la réduction des coûts de collecte de données réelles restent des enjeux centraux pour un passage à l'échelle en production.
Dans nos dossiers




