Aller au contenu principal
GO : le grand jeu de données multimodal sur la nature en plein air
RecherchearXiv cs.RO 

GO : le grand jeu de données multimodal sur la nature en plein air

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire Unmanned Systems Lab a publié en janvier 2025 le dataset GO (Great Outdoors), une ressource d'entraînement multimodale annotée destinée à la robotique de terrain en environnements non structurés. Sa caractéristique principale est la combinaison de six modalités sensorielles complémentaires, dont la caméra thermique et le radar, deux capteurs systématiquement absents des datasets off-road existants. L'ensemble est accompagné d'annotations sémantiques et de traces GPS, ce qui permet de l'exploiter pour l'entraînement à la segmentation sémantique, la détection d'objets et le SLAM (localisation et cartographie simultanées). L'article, référencé arXiv:2501.19274 et en troisième révision, ne précise pas le volume exact de données dans son abstract : la mention "large-scale" reste à vérifier dans le papier complet.

Ce dataset comble une lacune réelle dans l'écosystème de la robotique outdoor : la quasi-totalité des benchmarks off-road disponibles, RUGD, RELLIS, YCOR, se limitent aux modalités RGB et LiDAR, qui deviennent inopérantes par brouillard dense, nuit ou fumée. L'ajout du thermique et du radar ouvre la voie à des systèmes de perception capables d'opérer en conditions dégradées, un prérequis pour les applications d'exploration autonome en milieux naturels, la robotique de secours post-catastrophe ou les véhicules tout-terrain militaires et civils. Pour les équipes de recherche et les intégrateurs industriels, disposer de données annotées multi-capteurs dans ces conditions représente un accélérateur concret pour le développement de modèles de perception robustes, sans avoir à monter leurs propres campagnes de collecte coûteuses.

L'Unmanned Systems Lab, rattaché à une université américaine (Texas A&M University), est spécialisé depuis plusieurs années dans la robotique de terrain non structurée et la navigation autonome en extérieur. Le secteur compte quelques acteurs positionnés sur des niches proches : en France, aucun équivalent direct n'est recensé sur ce segment précis, bien que des laboratoires comme le LAAS-CNRS travaillent sur la navigation outdoor. Côté datasets concurrents, Boreas (University of Toronto) couvre des conditions hivernales avec radar et LiDAR, et le dataset TartanDrive (CMU) se concentre sur la dynamique off-road, GO se distingue par l'inclusion du thermique comme modalité de premier rang. Le dataset est téléchargeable sur unmannedlab.org ; aucune roadmap ni partenariat industriel annoncé à ce stade.

Impact France/UE

Les équipes françaises travaillant sur la robotique outdoor (LAAS-CNRS notamment) peuvent exploiter ce dataset open-access pour accélérer leurs travaux sur la perception en conditions dégradées, sans monter leurs propres campagnes de collecte multi-capteurs coûteuses.

Dans nos dossiers

À lire aussi

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles
1arXiv cs.RO 

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles

Une équipe de chercheurs a publié EgoWalk, un dataset multimodal de 50 heures de navigation humaine destiné à entraîner des algorithmes de navigation robotique en conditions réelles. Les données ont été collectées dans une grande variété d'environnements intérieurs et extérieurs, sur plusieurs saisons et sites géographiques différents. Le dataset comprend les données brutes ainsi qu'un format prêt pour l'apprentissage par imitation (Imitation Learning), accompagné de pipelines automatisés générant deux types de sous-datasets dérivés : des annotations d'objectifs en langage naturel et des masques de segmentation de traversabilité. L'ensemble des pipelines de traitement et la description de la plateforme matérielle utilisée pour la collecte sont publiés en open source. L'intérêt principal d'EgoWalk réside dans la rareté des datasets de navigation en conditions non contrôlées, à grande échelle et couvrant plusieurs saisons. La majorité des systèmes de navigation robotique actuels souffrent d'un écart sim-to-real persistant, faute de données réelles suffisamment diversifiées. En proposant simultanément des annotations langage naturel et des masques de traversabilité générés automatiquement, EgoWalk vise à réduire le coût de labellisation manuelle qui freine le développement de modèles vision-langage-action (VLA) pour la navigation outdoor. La publication open source des pipelines permet aux équipes de réplication de reconstruire des datasets similaires sur leur propre plateforme, ce qui est un signal positif pour la reproductibilité dans le domaine. La navigation autonome en environnements non structurés reste l'un des défis centraux de la robotique mobile, que ce soit pour les robots de livraison, les plateformes de surveillance ou les assistants mobiles. EgoWalk s'inscrit dans un mouvement plus large de constitution de datasets ego-centriques, aux côtés d'initiatives comme SCAND (UT Austin) ou des travaux de Boston Dynamics et de Google DeepMind sur la navigation en extérieur. Le fait que les données soient collectées du point de vue humain, plutôt que depuis un robot, soulève la question du transfert de domaine, que les auteurs reconnaissent implicitement en proposant des benchmarks et études de diversité. Les prochaines étapes naturelles seraient la validation sur des plateformes robotiques réelles et l'intégration dans des architectures de type foundation model pour la navigation.

RechercheActu
1 source
ACME : jeu de données multiculturel et multi-incarnation pour la navigation sociale
2arXiv cs.RO 

ACME : jeu de données multiculturel et multi-incarnation pour la navigation sociale

Wandercraft, Pollen Robotics ou tout autre acteur français ne figurent pas dans cette étude, qui reste une publication de recherche pure sur arXiv. Voici la synthèse. Une équipe de chercheurs publie ACME (Cross-cultural, Multi-Embodiment dataset), un jeu de données destiné à la navigation sociale des robots, collecté sur 8 sites répartis dans 5 pays et utilisant 7 embodiments robotiques différents. Le corpus totalise 29,35 heures de données embarquées capturées directement par les robots et 43,5 heures de suivi piéton en vue aérienne. Contrairement aux jeux de données existants, ACME cible spécifiquement des scénarios de navigation orientée objectif en environnement social complexe, avec des interactions explicites robot-foule incluant la parole du robot comme signal d'interaction. Le dataset fournit des features de scène en 2D et 3D, des données d'odométrie, des informations d'interaction et des trajectoires piétonnes annotées manuellement, disponibles à la fois en format brut binaire et en version lisible par sensor modality. L'enjeu pour l'industrie robotique est celui de la généralisation. Les politiques de navigation sociale entraînées aujourd'hui reposent souvent sur des corpus captés dans un seul pays, avec un seul type de robot, ce qui expose les systèmes déployés à un risque de mauvaise généralisation face à des normes culturelles de proxémie ou de comportement piéton différentes. En couvrant plusieurs cultures et embodiments simultanément, ACME répond directement à cette limite documentée dans la littérature. Les auteurs affirment que leur dataset capture des scénarios plus complexes et une distribution de comportements piétons plus large que les jeux de données précédents, une évaluation qualitative et quantitative qui reste toutefois auto-rapportée par l'équipe elle-même et mériterait une validation indépendante avant d'être prise comme référence de facto. Ce travail s'inscrit dans une dynamique plus large de la recherche en robotique mobile, où la multiplication des robots de service et de livraison en espace partagé avec des humains a rendu criante l'absence de données d'entraînement culturellement diverses. La publication ouverte du dataset, avec formats bruts et annotés, vise à en faire un benchmark communautaire pour entraîner des politiques de navigation et des modèles de prédiction de trajectoires piétonnes, sans qu'aucune date de disponibilité publique ou dépôt associé ne soit précisé dans l'abstract.

RecherchePaper
1 source
GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
3arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de données en accès libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux équipes de recherche françaises et européennes travaillant sur le SLAM et l'estimation d'état pour robots a pattes.

RecherchePaper
1 source
MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain
4arXiv cs.RO 

MUSON : jeu de données multimodal orienté raisonnement pour la navigation socialement conforme en milieu urbain

Une équipe de recherche publie MUSON, un nouveau jeu de données multimodal destiné à entraîner les robots et systèmes de navigation autonome à respecter les normes sociales dans les espaces partagés avec des humains. Le corpus comprend 10 110 échantillons égocentriques (captés à la première personne, comme le ferait un robot ou un piéton) collectés dans des scènes intérieures et extérieures variées. Chaque échantillon est annoté selon un cadre structuré en cinq étapes de raisonnement en chaîne : perception, prédiction, raisonnement, action et explication, avec un espace de décision standardisé à six actions possibles et une modélisation explicite des contraintes physiques statiques (obstacles fixes, rétrécissements de passage, etc.). Les chercheurs ont évalué dix modèles vision-langage (VLM) de taille petite à moyenne sur ce benchmark. Qwen3-VL-8B, développé par Alibaba, arrive en tête avec une précision d'action de 0,7765, un score Macro-F1 de 0,7490 et le taux de collision le plus bas parmi les modèles testés, à 0,0609. Le dataset est publié en accès libre sur GitHub sous la version 1.0. Cette publication répond à un manque identifié dans la recherche en navigation sociale : jusqu'ici, aucun jeu de données à grande échelle ne combinait annotations égocentriques et raisonnement structuré pour ce cas d'usage précis. Les modèles vision-langage génériques, même performants sur des tâches visuelles classiques, peinent à interpréter finement les normes sociales implicites (céder le passage, anticiper une trajectoire piétonne, respecter une distance de confort) sans fine-tuning spécifique. En fournissant un benchmark reproductible avec des métriques comparables, MUSON offre aux équipes de recherche en robotique mobile et en véhicules autonomes de proximité un outil pour évaluer objectivement leurs modèles, plutôt que de se fier à des démonstrations ponctuelles souvent peu représentatives des conditions réelles. Le projet s'inscrit dans la lignée des travaux récents cherchant à exploiter les VLM comme couche de raisonnement de haut niveau pour la navigation robotique, en complément des piles de perception et de contrôle bas niveau classiques. Contrairement à une annonce produit, il s'agit ici d'une contribution académique dont la valeur dépendra de son adoption par la communauté comme référence d'évaluation, à l'image d'autres benchmarks ayant structuré des sous-domaines de la robotique ces dernières années. Le code et les données étant publics, les prochaines étapes attendues sont des extensions du dataset et des comparaisons avec des modèles plus volumineux ou spécialisés.

RecherchePaper
1 source