Aller au contenu principal
RecherchearXiv cs.RO 

RTNav : vers une navigation d'objets sans exemple en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente RTNav dans un article publié sur arXiv sous la référence 2608.26496v1, consacré à la navigation robotique zero-shot vers des objets non spécifiés à l'avance, en environnement inconnu. Le constat de départ est que les modèles de vision et de langage utilisés pour la navigation dite "zero-shot" introduisent une latence d'inférence non négligeable, largement ignorée jusqu'ici car la plupart des méthodes de référence sont évaluées dans des simulateurs synchrones, où l'environnement attend que l'agent termine son calcul avant d'avancer, rendant le temps de calcul artificiellement gratuit. Les auteurs démontrent que ces méthodes de pointe subissent une dégradation de performance nette dès qu'elles sont testées en conditions réelles de temps d'horloge, où chaque milliseconde de calcul consomme le budget de temps de la tâche. RTNav est conçu comme une architecture qui traite explicitement la latence d'inférence, l'avancement asynchrone de l'environnement et les contraintes de calcul borné comme des paramètres de conception à part entière, plutôt que comme un enchaînement séquentiel perception-raisonnement-action. Sur des variantes temps réel des benchmarks HM3D-v1, HM3D-v2 et HM3D-OVON, RTNav améliore le taux de succès jusqu'à 11 points et le score SCT (Success weighted by Completion Time) jusqu'à 5,1 points par rapport aux méthodes précédentes.

Ce travail met le doigt sur un angle mort méthodologique du secteur de la navigation robotique autonome: la plupart des benchmarks académiques masquent le coût réel de l'inférence des grands modèles de vision-langage, ce qui peut donner une image trompeuse de la maturité de ces systèmes pour un déploiement embarqué. Pour les intégrateurs et équipes robotiques travaillant sur des AMR ou des plateformes mobiles amenées à opérer en continu dans le monde réel, cela confirme qu'une architecture pensée pour un simulateur synchrone ne se transpose pas telle quelle sur du matériel avec budget de calcul et de temps limité, et que l'écart simulation-réalité concerne aussi la dimension temporelle, pas seulement la perception.

Le papier s'inscrit dans la lignée des travaux sur la navigation d'objets zero-shot appuyés sur des modèles de fondation vision-langage, un domaine de recherche actif où les gains rapportés se mesurent généralement en simulation pure. En reformulant l'évaluation autour de contraintes temps réel plutôt que de la seule précision de navigation, RTNav ouvre la voie à des comparaisons plus proches des conditions de déploiement effectif, sans toutefois qu'aucun essai sur robot physique ni partenariat industriel ne soit mentionné à ce stade.

Dans nos dossiers

À lire aussi

UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert
1arXiv cs.RO 

UAV-ON : un référentiel pour la navigation aérienne autonome vers des objets en monde ouvert

Un nouveau benchmark baptisé UAV-ON vise à évaluer la capacité de drones autonomes à localiser des objets dans de vastes environnements ouverts, sans dépendre d'instructions linguistiques détaillées. Publié sur arXiv (2508.00288v5), le jeu de données couvre 14 environnements haute fidélité construits sous Unreal Engine, mêlant zones urbaines, milieux naturels et espaces mixtes, avec des agencements spatiaux complexes. Il définit 1270 objets cibles annotés individuellement, chacun décrit par une instruction de niveau instance précisant la catégorie, l'emprise physique et des descripteurs visuels, permettant un raisonnement ancré dans la scène. Les chercheurs ont aussi implémenté plusieurs méthodes de référence, dont Aerial ObjectNav Agent (AOA), une politique modulaire combinant sémantique de l'instruction et observations égocentriques pour une exploration orientée objectif sur de longs horizons. Résultat: tous les modèles testés peinent à accomplir la tâche, ce qui souligne la difficulté cumulée de la navigation aérienne et de l'ancrage sémantique des objectifs. Ce benchmark marque une rupture avec le paradigme dominant de la navigation vision-langage (VLN), qui repose sur des séquences d'instructions pas à pas et limite de fait l'autonomie et le passage à l'échelle des agents. En proposant une tâche d'Object Goal Navigation où l'agent ne reçoit qu'un objectif sémantique de haut niveau, UAV-ON teste une compétence plus proche des besoins réels d'inspection, de surveillance ou de cartographie par drone. L'échec généralisé des baselines confirme que le passage d'instructions détaillées à des objectifs sémantiques abstraits reste un verrou majeur, loin d'être résolu malgré les progrès des modèles vision-langage-action sur d'autres plateformes robotiques. La navigation aérienne embarquée demeure sous-explorée comparée à la navigation terrestre, où les benchmarks VLN se sont multipliés ces dernières années. UAV-ON s'inscrit dans cette lignée en l'adaptant aux contraintes spécifiques du vol: grande échelle, environnements non structurés, absence de repères au sol. Les auteurs positionnent ce travail comme une fondation pour de futures recherches sur l'autonomie UAV pilotée par des descriptions sémantiques, ouvrant la voie à des méthodes capables de généraliser au-delà des scénarios scriptés actuels.

RecherchePaper
1 source
ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages
2arXiv cs.RO 

ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages

Une équipe de recherche présente ZONDA, un nouveau framework de navigation robotique "zero-shot" vers un objet désigné (Object Goal Navigation), conçu pour fonctionner dans des environnements multi-étages et en présence de piétons en mouvement. Le système repose sur trois composants : une planification heuristique multi-étages qui exploite des cartes de différences de hauteur pour permettre à un robot de gravir des escaliers et de changer d'étage sans contrôleur spécifique à la plateforme ; une vérification multi-vues de la cible, qui croise des observations à différentes échelles avec un modèle vision-langage (VLM) pour réduire les faux positifs de détection ; et un module d'évitement dynamique des piétons, qui suit et anticipe leurs déplacements pour générer des trajectoires préventives. Le système a été testé sur un robot bipède TITA du fabricant chinois Direct Drive Tech, ainsi que sur des simulations extensives utilisant les jeux de données HM3D et MP3D, deux benchmarks de référence pour la navigation en environnement intérieur photoréaliste. Les auteurs annoncent des résultats "significativement améliorés" par rapport aux méthodes existantes, ainsi qu'une robustesse maintenue sur HM3D-DYNA, une variante dynamique du benchmark incluant des agents mobiles. Cette publication s'attaque à une limite concrète et rarement traitée des systèmes de navigation robotique actuels : la quasi-totalité des méthodes de pointe supposent un environnement statique et confiné à un seul étage, une hypothèse commode en laboratoire mais irréaliste pour un déploiement réel en entrepôt, hôpital ou bâtiment de bureaux à plusieurs niveaux. En combinant franchissement d'escaliers sans apprentissage spécifique au robot et anticipation des piétons, ZONDA vise directement l'écart entre démonstration en simulation et usage industriel, un problème central pour les intégrateurs qui cherchent à déployer des robots mobiles ou humanoïdes au-delà d'un seul plateau. À noter que l'abstract ne fournit pas de chiffres précis de performance (taux de succès, distance parcourue, temps de cycle) permettant de comparer objectivement l'ampleur du gain revendiqué face aux méthodes concurrentes, une réserve à garder en tête avant de considérer le résultat comme acquis. Le champ de l'Object Goal Navigation s'est largement construit sur des benchmarks comme HM3D et MP3D, où les méthodes récentes intègrent de plus en plus des modèles vision-langage pour améliorer la reconnaissance sémantique des cibles, dans la lignée de travaux comme les architectures VLA utilisées en manipulation robotique. Le choix du robot bipède TITA de Direct Drive Tech comme plateforme de test réel, plutôt qu'un robot à roues plus classique en recherche de navigation, souligne l'ambition de valider l'approche sur une morphologie capable physiquement de franchir des escaliers, condition nécessaire à toute navigation multi-étages. L'article, publié sur arXiv le 24 juillet 2026, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution académique, dont la prochaine étape logique serait une validation sur davantage de plateformes robotiques et dans des environnements réels plus variés que le cadre expérimental actuel.

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
3arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source
DSCD-Nav : débat coopératif à double posture pour la navigation vers un objet
4arXiv cs.RO 

DSCD-Nav : débat coopératif à double posture pour la navigation vers un objet

Le robot d'assistance domestique orienté navigation vient d'être testé sur trois jeux de données de référence, HM3Dv1, HM3Dv2 et MP3D, avec un nouveau mécanisme baptisé DSCD-Nav (Dual-Stance Cooperative Debate Navigation). Le principe : au lieu de faire évaluer chaque action candidate par un seul passage de scoring, comme le font les systèmes actuels bâtis sur des modèles vision-langage, la méthode confronte deux points de vue construits sur des objectifs complémentaires. Le premier, appelé TSU (Task-Scene Understanding), privilégie la progression vers l'objectif à partir d'indices de disposition de la scène. Le second, SIB (Safety-Information Balancing), met l'accent sur le risque et la valeur informationnelle de chaque choix. Ces deux "postures" débattent en confrontant leurs meilleures candidates avec des arguments ancrés dans l'observation, puis un agent d'arbitrage nommé NCA (Navigation Consensus Arbitration) synthétise les raisons des deux camps et peut déclencher une micro-vérification légère en cas de doute persistant. Les auteurs rapportent des gains constants en taux de réussite et en efficacité de trajectoire, avec une réduction de l'exploration redondante sur les trois benchmarks. L'enjeu dépasse la seule performance chiffrée : il touche à un problème connu des systèmes de navigation basés sur des VLA (vision-language-action), le fait qu'un scoring en un seul passage produit une confiance excessive et des erreurs qui s'accumulent sur des trajectoires longues, dans des environnements observés seulement partiellement. En reformulant la décision comme un débat entre postures antagonistes plutôt qu'un score unique, DSCD-Nav s'attaque directement à ce biais de surconfiance, un sujet critique pour tout intégrateur voulant déployer des robots domestiques ou de service dans des environnements réels non cartographiés au préalable. Si l'approche tient à l'échelle au-delà des benchmarks académiques, elle offre une piste concrète pour fiabiliser la prise de décision des robots autonomes sans nécessiter de re-entraînement lourd du modèle de perception sous-jacent. Le papier s'inscrit dans la lignée des travaux récents sur la navigation zero-shot en environnement intérieur inconnu, un axe de recherche actif depuis l'essor des modèles vision-langage capables de raisonner sur des scènes jamais vues. Contrairement aux approches à score unique dominantes dans la littérature actuelle, DSCD-Nav mise sur une architecture multi-agents délibérative, une tendance émergente dans plusieurs sous-domaines de l'IA où la confrontation de perspectives remplace l'inférence directe. Le texte, republié en version 3 sur arXiv, ne précise pas de déploiement matériel réel ni de partenaire industriel : il s'agit à ce stade d'une contribution méthodologique validée en simulation, dont la prochaine étape naturelle serait un test sur plateforme robotique physique pour confirmer que les gains observés en simulation se transposent au monde réel.

RecherchePaper
1 source