RTNav : vers une navigation d'objets sans exemple en temps réel
Une équipe de recherche présente RTNav dans un article publié sur arXiv sous la référence 2608.26496v1, consacré à la navigation robotique zero-shot vers des objets non spécifiés à l'avance, en environnement inconnu. Le constat de départ est que les modèles de vision et de langage utilisés pour la navigation dite "zero-shot" introduisent une latence d'inférence non négligeable, largement ignorée jusqu'ici car la plupart des méthodes de référence sont évaluées dans des simulateurs synchrones, où l'environnement attend que l'agent termine son calcul avant d'avancer, rendant le temps de calcul artificiellement gratuit. Les auteurs démontrent que ces méthodes de pointe subissent une dégradation de performance nette dès qu'elles sont testées en conditions réelles de temps d'horloge, où chaque milliseconde de calcul consomme le budget de temps de la tâche. RTNav est conçu comme une architecture qui traite explicitement la latence d'inférence, l'avancement asynchrone de l'environnement et les contraintes de calcul borné comme des paramètres de conception à part entière, plutôt que comme un enchaînement séquentiel perception-raisonnement-action. Sur des variantes temps réel des benchmarks HM3D-v1, HM3D-v2 et HM3D-OVON, RTNav améliore le taux de succès jusqu'à 11 points et le score SCT (Success weighted by Completion Time) jusqu'à 5,1 points par rapport aux méthodes précédentes.
Ce travail met le doigt sur un angle mort méthodologique du secteur de la navigation robotique autonome: la plupart des benchmarks académiques masquent le coût réel de l'inférence des grands modèles de vision-langage, ce qui peut donner une image trompeuse de la maturité de ces systèmes pour un déploiement embarqué. Pour les intégrateurs et équipes robotiques travaillant sur des AMR ou des plateformes mobiles amenées à opérer en continu dans le monde réel, cela confirme qu'une architecture pensée pour un simulateur synchrone ne se transpose pas telle quelle sur du matériel avec budget de calcul et de temps limité, et que l'écart simulation-réalité concerne aussi la dimension temporelle, pas seulement la perception.
Le papier s'inscrit dans la lignée des travaux sur la navigation d'objets zero-shot appuyés sur des modèles de fondation vision-langage, un domaine de recherche actif où les gains rapportés se mesurent généralement en simulation pure. En reformulant l'évaluation autour de contraintes temps réel plutôt que de la seule précision de navigation, RTNav ouvre la voie à des comparaisons plus proches des conditions de déploiement effectif, sans toutefois qu'aucun essai sur robot physique ni partenariat industriel ne soit mentionné à ce stade.
Dans nos dossiers




