Aller au contenu principal
Vers des métriques fondées sur les données pour l'évaluation comparative de la navigation sociale des robots
RecherchearXiv cs.RO 

Vers des métriques fondées sur les données pour l'évaluation comparative de la navigation sociale des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié une métrique d'évaluation entièrement pilotée par les données pour la navigation robotique en environnement social, baptisée SN26. Le travail s'appuie sur un jeu de données de 4427 trajectoires, dont 182 enregistrées sur des robots réels et 4245 générées en simulation, notées ensuite par des évaluateurs humains selon des critères de qualité et d'acceptabilité sociale. Après un contrôle qualité des annotations, 4402 trajectoires notées ont été retenues pour entraîner le modèle. Les auteurs présentent des résultats qualitatifs et quantitatifs, dont la perte de test obtenue, une comparaison directe avec les métriques manuelles utilisées jusqu'ici dans le domaine, ainsi qu'une étude d'ablation détaillant la contribution de chaque composante. L'ensemble des données, du code et des poids du modèle a été rendu public.

Cette publication répond à un problème concret pour les équipes qui développent des robots mobiles autonomes destinés à évoluer parmi des humains, entrepôts, hôpitaux, espaces commerciaux : l'absence de métrique standardisée et fiable pour juger si une trajectoire de navigation est socialement acceptable. Jusqu'ici, les métriques reposaient sur des règles conçues à la main, distance minimale aux piétons, vitesse, fluidité, qui peinent à capturer la perception humaine réelle du confort ou de l'intrusion. Une métrique apprise à partir de données réelles et d'annotations humaines pourrait devenir un outil de référence pour comparer objectivement des politiques de navigation, y compris celles entraînées par apprentissage par renforcement, et accélérer le passage de la démonstration en simulation au déploiement en conditions réelles, un des points de friction classiques du secteur robotique.

Le sujet s'inscrit dans un effort collectif de la communauté de recherche en navigation sociale, où plusieurs benchmarks et simulateurs concurrents coexistent sans consensus sur la métrique d'évaluation à privilégier. En rendant public le dataset, le code et les poids du modèle SN26, les auteurs cherchent explicitement à fournir une base commune réutilisable par d'autres laboratoires et industriels, plutôt qu'un outil propriétaire fermé. Les prochaines étapes attendues concernent l'élargissement du dataset à davantage de trajectoires réelles et l'adoption de cette métrique par d'autres équipes pour valider sa généralisation au-delà du corpus initial.

À lire aussi

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots
1arXiv cs.RO 

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots

GROVE (Grounded Robot-Oriented Vehicle Environment), présenté dans un preprint arXiv (2606.25504) déposé fin juin 2026, est un framework de simulation de piétons piloté par langage naturel, conçu pour entraîner et évaluer des robots de navigation sociale. Le système accepte des instructions textuelles pour générer des scénarios de simulation: trois presets préconfigurés couvrent les situations d'urgence, de file d'attente et de déplacement ordinaire, mais l'utilisateur peut aussi saisir un prompt libre pour obtenir un scénario entièrement personnalisé. Trois modules distincts gèrent respectivement le comportement humain à long horizon (trajectoires et intentions globales), la navigation piétonne à moyen horizon (évitement, flots de foule), et les interactions sociales à court horizon entre robot et individus. GROVE s'intègre nativement dans Isaac Sim (NVIDIA), Gazebo et RViz. Les scènes de validation couvrent des environnements résidentiels, hospitaliers et de bureau. Le principal verrou que GROVE cherche à lever est le coût de génération manuelle de données de simulation: aujourd'hui, produire un scénario crédible (couloir d'hôpital en heure de pointe, évacuation d'urgence) exige un travail de paramétrage fastidieux, répété à chaque variante. Déléguer cette configuration au langage naturel réduit la friction pour les équipes non-spécialistes et accélère la diversification des données d'entraînement. La sélection dynamique des algorithmes de l'état de l'art par module vise explicitement à comprimer le sim-to-real gap, défaillance structurelle qui pénalise le transfert des politiques apprises en simulation vers des robots déployés en milieu réel. Sur le papier, l'architecture modulaire permet aussi de mettre à jour chaque couche indépendamment quand un nouvel algorithme de navigation ou de prédiction de trajectoire devient disponible. La navigation sociale robotique est un champ actif depuis plus d'une décennie, avec des modèles fondateurs comme le Social Force Model et des outils de simulation existants (PedSim, pedsim\_ros, SEAN) qui imposaient des paramétrages rigides et manuels. GROVE s'inscrit dans une tendance plus large d'utilisation des LLM comme interface de configuration pour les pipelines de simulation, une direction explorée parallèlement dans la génération procédurale de scènes 3D. Important à noter: la validation présentée est uniquement qualitative, sans benchmark quantitatif sur des métriques standardisées comme celles de trajnet++ ou BARN. Les affirmations sur la "haute fidélité" de simulation restent donc à vérifier sur robot réel. Le preprint ne mentionne ni déploiement en production ni partenariat industriel.

RecherchePaper
1 source
Modèle du monde pour la navigation sociale de robots guidée par la logique
2arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source
Interface de navigation universelle : données sans robot pour la navigation des robots à roues
3arXiv cs.RO 

Interface de navigation universelle : données sans robot pour la navigation des robots à roues

Un article arXiv (2609.20114v1) présente Universal Navigation Interface (UNI), une méthode de collecte de données de navigation pour robots à roues sans robot cible ni téléopération. Le dispositif est un déambulateur à quatre roues (rollator) équipé d'un smartphone, poussé par un opérateur humain ; incapable de monter des escaliers, de franchir des bordures non abaissées ou de passer par des espaces étroits, il biaise naturellement les trajectoires vers des itinéraires praticables en roues. Les auteurs ont collecté 37,2 km de données réelles, converties en trajectoires métriques pour entraîner des modèles de navigation conditionnés par objectif. Le fine-tuning sur ces données réduit l'erreur de prédiction de trajectoire de 17,4 à 24,8 % sur le jeu de test UNI, avec des gains plus inégaux sur d'autres datasets, et un transfert en boucle fermée vers un fauteuil roulant motorisé a été validé sur des scénarios de bordures et d'escaliers. Cette approche s'attaque à un goulot d'étranglement connu de la robotique mobile : la collecte de données de navigation exige d'ordinaire une téléopération spécifique à chaque plateforme, coûteuse et difficile à faire passer à l'échelle. En montrant qu'un objet du quotidien, sans robot cible ni capteurs sophistiqués, peut produire des trajectoires exploitables pour l'entraînement, UNI ouvre une piste de réduction de coûts pour les intégrateurs de robots à roues, qu'il s'agisse d'AMR industriels, de robots de livraison ou d'aides à la mobilité comme les fauteuils roulants. Le résultat appuie l'idée que des proxys physiques bon marché peuvent fournir une supervision réelle sans simulation ni robot final, même si les gains ne se généralisent pas uniformément aux jeux de données externes testés, un rappel que la méthode reste sensible au domaine d'entraînement. UNI prolonge une lignée d'outils de collecte "robot-free" popularisée en manipulation par des dispositifs comme Universal Manipulation Interface, qui enregistrait des démonstrations via une pince portative sans bras robotique ; UNI transpose cette logique à la navigation à roues en exploitant les contraintes physiques d'un objet grand public, un déambulateur pour personnes à mobilité réduite. Il s'agit d'un travail de recherche publié en preprint sur arXiv, sans lien annoncé avec un produit commercial ou un déploiement industriel. Les prochaines étapes évoquées par les auteurs portent sur l'élargissement des tests à d'autres jeux de données et plateformes robotiques, au-delà du fauteuil roulant motorisé utilisé pour la validation en boucle fermée.

RecherchePaper
1 source
Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots
4arXiv cs.RO 

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots

Des chercheurs publient Social-WM, un cadre de planification par modèle de monde latent destiné à la navigation sociale des robots, c'est-à-dire le déplacement parmi des piétons et des obstacles. Le système est entraîné uniquement à partir de séquences vidéo RGB égocentriques. Il prédit, en fonction de l'action commandée, l'observation future réellement obtenue après chaque commande. Il apprend ainsi les conséquences pertinentes pour la sécurité. Un second objectif, dit de dynamique inverse « réalisable », associe chaque transition latente observée à l'action effectivement réalisée, et non à l'action nominale demandée. Au déploiement, le robot imagine plusieurs actions candidates dans le modèle de monde. Le modèle inverse estime ensuite leur réalisabilité, et l'écart entre action nominale et action réalisable sert de signal de sécurité avant exécution. Sur le benchmark Social-HM3D, Social-WM atteint 63,77 % de réussite avec 21,67 % de collisions avec des humains. Les résultats restent solides en transfert zéro-shot sur Social-MP3D. L'approche n'utilise ni suivi explicite des piétons, ni état humain privilégié, ni apprentissage par renforcement en ligne. L'intérêt tient à la manière de traiter le problème. Une action « avancer » peut s'exécuter entièrement en espace libre, mais doit être freinée ou modifiée face à un piéton ou un obstacle. Les données de navigation sociale contiennent donc un décalage systématique entre commande et mouvement réel. En apprenant ce décalage plutôt qu'en le supposant nul, le robot dispose d'un indicateur de risque sans module de perception dédié aux humains. Pour un intégrateur, cela réduit la dépendance à des piles de suivi et de prédiction de trajectoires, coûteuses à calibrer. Le fait que la dynamique et la réalisabilité soient indépendantes du but permet de réutiliser le même modèle pour la navigation par position et par image-cible. Il faut toutefois relativiser : un taux de collision de 21,67 % reste très éloigné d'un niveau acceptable en environnement réel, et les résultats proviennent de simulation. Aucun test sur robot physique ni comparaison de coûts de calcul n'est mentionné dans le résumé. Ce travail s'inscrit dans la montée des modèles de monde latents, qui planifient dans un espace de représentation compact plutôt qu'en reconstruisant des pixels, et dans l'effort pour combler l'écart entre simulation et réel en navigation sociale. Les benchmarks utilisés, construits sur les scènes HM3D et Matterport3D, relèvent de la simulation d'intérieur et couvrent mal la variété des lieux publics. Les approches concurrentes reposent généralement soit sur l'apprentissage par renforcement en ligne, soit sur des modules explicites de suivi des piétons. La suite logique est une validation sur plateforme mobile réelle, dans des espaces partagés comme les hôpitaux ou la logistique, où des robots mobiles autonomes (AMR) croisent déjà des opérateurs. Il s'agit pour l'instant d'une préimpression arXiv (v1), non évaluée par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source