Aller au contenu principal
SiGNgapore : un jeu de données interactif pour la navigation visuelle fondée sur les panneaux
RecherchearXiv cs.RO 

SiGNgapore : un jeu de données interactif pour la navigation visuelle fondée sur les panneaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (v1, octobre 2026) SiGNgapore, un jeu de données destiné à la navigation visuelle fondée sur les panneaux de signalisation. Les données ont été collectées avec un dispositif tenu à la main dans plusieurs espaces publics de Singapour, des lieux que les humains fréquentent au quotidien. Chaque séquence contient des images RGB, de la profondeur éparse (sparse depth), de l'odométrie et des mesures d'IMU, centrées sur des panneaux de navigation et sur les environnements complexes qui les entourent. Le jeu comprend 56 missions de navigation longue portée et plus de 450 scénarios centrés sur les panneaux. Les données sont livrées dans un format lisible par l'humain, avec des scripts utilitaires de conversion vers ROS 2. Les auteurs fournissent aussi les plans des sites et des graphes de scène alignés sur le GPS pour les environnements de test. Il s'agit d'une ressource de recherche : aucun robot n'a été déployé et aucun résultat de navigation n'est annoncé dans le résumé.

L'intérêt tient au problème visé. Un robot qui évolue dans un aéroport, une gare, un centre commercial ou un hôpital ne peut pas toujours compter sur une carte préétablie, dont la création et la maintenance coûtent cher aux intégrateurs. Les humains s'orientent pourtant sans carte grâce à la signalétique. Lui faire lire et interpréter ces panneaux pourrait réduire la cartographie préalable, un poste de coût réel pour les déploiements en espaces publics. Le jeu de données traite aussi un manque : les benchmarks de navigation se concentrent surtout sur la géométrie et la perception de l'espace libre, rarement sur la décision fondée sur le sens d'un panneau, c'est-à-dire le raisonnement sémantique de bout en bout. Les capteurs utilisés (caméra, profondeur éparse, IMU) restent peu coûteux et proches de ce que portent des robots commerciaux. Il faut toutefois rester prudent. La collecte à la main ne reproduit ni la dynamique d'un robot ni ses contraintes de sécurité. Le volume, 56 missions et environ 450 scénarios, est modeste pour entraîner de gros modèles. Il convient donc mieux à l'évaluation qu'à l'apprentissage massif.

Ce travail s'inscrit dans le mouvement de la navigation sans carte (mapless) portée par les modèles vision-langage et les VLA (vision-language-action), qui cherchent à comprendre des instructions et des indices sémantiques plutôt qu'à localiser le robot dans une carte métrique. Les graphes de scène alignés sur le GPS permettent de relier perception, sémantique et topologie du lieu. Singapour offre un terrain d'étude dense, multilingue et très signalisé, ce qui en fait un banc d'essai exigeant mais peu représentatif d'autres contextes, notamment européens, où la signalétique varie. Les suites probables sont des benchmarks et des comparaisons de méthodes sur ce jeu de données, puis des essais sur robots réels. Aucun calendrier, pilote industriel ni acteur commercial n'est mentionné dans l'annonce.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

SignScene : ancrage visuel des panneaux pour la navigation sans carte
1arXiv cs.RO 

SignScene : ancrage visuel des panneaux pour la navigation sans carte

Des chercheurs ont publié SignScene (arXiv 2602.12686), un système permettant à un robot de naviguer sans carte préalable en interprétant les panneaux de signalisation présents dans l'environnement. Évalué sur un jeu de données de 114 requêtes couvrant neuf types d'environnements différents, le système atteint 88 % de précision dans ce qu'ils appellent le "sign grounding" : la capacité à associer les instructions sémantiques d'un panneau à des éléments de la scène 3D locale et à des actions de navigation concrètes. La démonstration a été réalisée sur un robot Boston Dynamics Spot naviguant en conditions réelles en s'appuyant uniquement sur les panneaux visibles, sans carte ni waypoints préprogrammés. Le défi central est la représentation spatiale : les grands modèles vision-langage (VLMs) disposent du raisonnement sémantique nécessaire pour interpréter un panneau ("Sortie à 50 m à droite"), mais ils sont sensibles à la manière dont l'information spatiale leur est présentée. SignScene introduit une représentation "sign-centric" qui extrait les éléments de scène pertinents pour la navigation et les organise autour du panneau détecté, améliorant significativement le raisonnement du VLM par rapport aux approches de référence, sans que les chiffres exacts de ces dernières soient publiés dans l'abstract disponible. Pour les intégrateurs industriels, l'enjeu est direct : un robot capable d'interpréter les panneaux existants d'un entrepôt ou d'un hôpital pourrait être déployé sans phase de cartographie SLAM préalable, réduisant les coûts et délais d'installation tout en fonctionnant dans des environnements qui évoluent. La navigation sans carte est un axe de recherche actif en robotique mobile, traditionnellement dominé par SLAM ou les cartes topologiques préprogrammées. L'essor des VLMs a ouvert la voie à une navigation guidée par le langage naturel, avec des travaux comme SayNav, VLMaps ou LM-Nav comme précédents directs. SignScene se positionne sur le créneau spécifique des panneaux physiques, signal abondant dans les environnements humains mais peu exploité en robotique autonome. Le robot Spot de Boston Dynamics sert ici de plateforme de validation standard dans la communauté académique. Les prochaines étapes logiques incluraient une extension aux environnements extérieurs urbains ou logistiques, et l'intégration dans des pipelines VLA (Vision-Language-Action) combinant interprétation de panneaux et planification de trajectoire bout-en-bout.

RecherchePaper
1 source
Interface de navigation universelle : données sans robot pour la navigation des robots à roues
2arXiv cs.RO 

Interface de navigation universelle : données sans robot pour la navigation des robots à roues

Un article arXiv (2609.20114v1) présente Universal Navigation Interface (UNI), une méthode de collecte de données de navigation pour robots à roues sans robot cible ni téléopération. Le dispositif est un déambulateur à quatre roues (rollator) équipé d'un smartphone, poussé par un opérateur humain ; incapable de monter des escaliers, de franchir des bordures non abaissées ou de passer par des espaces étroits, il biaise naturellement les trajectoires vers des itinéraires praticables en roues. Les auteurs ont collecté 37,2 km de données réelles, converties en trajectoires métriques pour entraîner des modèles de navigation conditionnés par objectif. Le fine-tuning sur ces données réduit l'erreur de prédiction de trajectoire de 17,4 à 24,8 % sur le jeu de test UNI, avec des gains plus inégaux sur d'autres datasets, et un transfert en boucle fermée vers un fauteuil roulant motorisé a été validé sur des scénarios de bordures et d'escaliers. Cette approche s'attaque à un goulot d'étranglement connu de la robotique mobile : la collecte de données de navigation exige d'ordinaire une téléopération spécifique à chaque plateforme, coûteuse et difficile à faire passer à l'échelle. En montrant qu'un objet du quotidien, sans robot cible ni capteurs sophistiqués, peut produire des trajectoires exploitables pour l'entraînement, UNI ouvre une piste de réduction de coûts pour les intégrateurs de robots à roues, qu'il s'agisse d'AMR industriels, de robots de livraison ou d'aides à la mobilité comme les fauteuils roulants. Le résultat appuie l'idée que des proxys physiques bon marché peuvent fournir une supervision réelle sans simulation ni robot final, même si les gains ne se généralisent pas uniformément aux jeux de données externes testés, un rappel que la méthode reste sensible au domaine d'entraînement. UNI prolonge une lignée d'outils de collecte "robot-free" popularisée en manipulation par des dispositifs comme Universal Manipulation Interface, qui enregistrait des démonstrations via une pince portative sans bras robotique ; UNI transpose cette logique à la navigation à roues en exploitant les contraintes physiques d'un objet grand public, un déambulateur pour personnes à mobilité réduite. Il s'agit d'un travail de recherche publié en preprint sur arXiv, sans lien annoncé avec un produit commercial ou un déploiement industriel. Les prochaines étapes évoquées par les auteurs portent sur l'élargissement des tests à d'autres jeux de données et plateformes robotiques, au-delà du fauteuil roulant motorisé utilisé pour la validation en boucle fermée.

RecherchePaper
1 source
DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues
3arXiv cs.RO 

DaViNCi : un jeu de données pour la navigation extérieure vision-langage avec actions continues

Un article de recherche publié sur arXiv (2608.11901) présente DaViNCi (Dynamic Vision-and-Language Navigation in Continuous Environment), premier jeu de données de navigation vision-langage (VLN) en extérieur combinant actions continues et éléments dynamiques imprévisibles, avec six cartes distinctes et 6 933 trajectoires au total. Contrairement aux datasets VLN outdoor existants, construits sur des graphes topologiques fixes et discrets, DaViNCi impose à l'agent de se déplacer avec des commandes continues tout en réagissant à des éléments mobiles qui modifient l'environnement en temps réel. Les expériences comparatives montrent que le taux de réussite chute de plus de 10 % en configuration discrète par rapport aux jeux de données précédents, et la baisse est encore plus marquée en configuration continue. Les auteurs isolent également l'impact respectif de la granularité des actions et de la présence d'éléments dynamiques sur la performance des agents. Le dataset et les ressources associées sont disponibles sur le site du projet. Ce résultat contredit l'idée que les agents VLN actuels, entraînés et évalués sur des graphes topologiques figés, seraient prêts pour un déploiement réel en extérieur, et expose l'écart persistant entre bancs d'essai simulés et conditions réelles rencontrées par les robots mobiles et les AMR devant naviguer parmi piétons, véhicules ou obstacles temporaires. Pour les équipes qui développent des agents de navigation autonome guidés par le langage, qu'il s'agisse de robots de livraison, d'inspection ou de plateformes humanoïdes mobiles, ce benchmark offre un cadre d'évaluation plus exigeant que les datasets discrets utilisés jusqu'ici. Il souligne surtout que le passage à des actions continues, plus proches du contrôle moteur réel, reste un facteur de fragilité majeur pour les modèles de navigation, un enjeu direct pour le transfert sim-to-real que l'industrie robotique cherche à valider avant tout déploiement commercial. DaViNCi s'inscrit dans l'évolution du champ VLN, d'abord développé en environnement intérieur avant de s'étendre progressivement à l'extérieur ces dernières années via des jeux de données construits sur des graphes topologiques discrets, qui simplifiaient la tâche d'entraînement mais s'éloignaient des conditions réelles de terrain où les trajectoires ne sont pas prédéfinies. En introduisant simultanément mouvement continu et dynamique environnementale, DaViNCi se positionne comme un nouveau standard d'évaluation, plus difficile que les benchmarks VLN outdoor précédents. Les auteurs présentent ce travail comme une étape vers des agents de navigation capables d'opérer dans des environnements urbains réalistes, et mettent le jeu de données à disposition de la communauté de recherche pour mesurer les progrès futurs sur ce terrain plus exigeant.

RecherchePaper
1 source
GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots
4arXiv cs.RO 

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots

GROVE (Grounded Robot-Oriented Vehicle Environment), présenté dans un preprint arXiv (2606.25504) déposé fin juin 2026, est un framework de simulation de piétons piloté par langage naturel, conçu pour entraîner et évaluer des robots de navigation sociale. Le système accepte des instructions textuelles pour générer des scénarios de simulation: trois presets préconfigurés couvrent les situations d'urgence, de file d'attente et de déplacement ordinaire, mais l'utilisateur peut aussi saisir un prompt libre pour obtenir un scénario entièrement personnalisé. Trois modules distincts gèrent respectivement le comportement humain à long horizon (trajectoires et intentions globales), la navigation piétonne à moyen horizon (évitement, flots de foule), et les interactions sociales à court horizon entre robot et individus. GROVE s'intègre nativement dans Isaac Sim (NVIDIA), Gazebo et RViz. Les scènes de validation couvrent des environnements résidentiels, hospitaliers et de bureau. Le principal verrou que GROVE cherche à lever est le coût de génération manuelle de données de simulation: aujourd'hui, produire un scénario crédible (couloir d'hôpital en heure de pointe, évacuation d'urgence) exige un travail de paramétrage fastidieux, répété à chaque variante. Déléguer cette configuration au langage naturel réduit la friction pour les équipes non-spécialistes et accélère la diversification des données d'entraînement. La sélection dynamique des algorithmes de l'état de l'art par module vise explicitement à comprimer le sim-to-real gap, défaillance structurelle qui pénalise le transfert des politiques apprises en simulation vers des robots déployés en milieu réel. Sur le papier, l'architecture modulaire permet aussi de mettre à jour chaque couche indépendamment quand un nouvel algorithme de navigation ou de prédiction de trajectoire devient disponible. La navigation sociale robotique est un champ actif depuis plus d'une décennie, avec des modèles fondateurs comme le Social Force Model et des outils de simulation existants (PedSim, pedsim\_ros, SEAN) qui imposaient des paramétrages rigides et manuels. GROVE s'inscrit dans une tendance plus large d'utilisation des LLM comme interface de configuration pour les pipelines de simulation, une direction explorée parallèlement dans la génération procédurale de scènes 3D. Important à noter: la validation présentée est uniquement qualitative, sans benchmark quantitatif sur des métriques standardisées comme celles de trajnet++ ou BARN. Les affirmations sur la "haute fidélité" de simulation restent donc à vérifier sur robot réel. Le preprint ne mentionne ni déploiement en production ni partenariat industriel.

RecherchePaper
1 source