Aller au contenu principal
RecherchearXiv cs.RO 

CSIR : des robots sensibles au contexte et aux normes sociales pour une navigation efficace vers une personne cible

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent CSIR, un cadre de planification qui permet à un robot mobile de retrouver une personne en intérieur pour lui remettre un objet, même quand la demande est vague et que les informations sur le destinataire sont incomplètes. Le travail, publié sur arXiv (2610.02750) et accompagné d'un site de démonstration anonymisé, traite le problème dit « Person Goal Navigation » (PersonNav). La méthode combine deux signaux : la distance jusqu'aux lieux candidats et des informations sémantiques sur la personne (habitudes, intention), pondérées par le degré de confiance accordé aux renseignements fournis par l'utilisateur. Les auteurs ont aussi construit un banc d'essai synthétique, avec acteurs, objets et requêtes en langage naturel, pour évaluer les performances avant tout déploiement réel. Selon l'étude, la recherche informée surpasse nettement les références classiques fondées sur des graphes et la seule distance. La sémantique employée seule produit une exploration sporadique, mal ancrée dans l'espace. Une variante pilotée par un LLM obtient des résultats comparables. Des essais sur matériel ont été réalisés. Le résumé ne donne ni chiffres de gain, ni plateforme robotique, ni site de test.

L'intérêt tient au problème visé. Les systèmes de recherche de personnes existants supposent en général une connaissance exacte de l'individu, ce qui ne correspond pas aux usages de livraison en bureaux, hôpitaux ou hôtels, où la consigne est du type « apporte ça à la personne de la comptabilité ». Le résultat contredit aussi une tentation courante : le tout-sémantique, ou le tout-LLM, ne suffit pas sans ancrage métrique. Le fait que la variante LLM ne fasse que jeu égal avec le planificateur explicite relativise l'idée qu'un modèle de langage généraliste serait nécessaire ici. La représentation explicite des croyances ouvre en outre la voie à un filtrage bayésien, plus auditable pour un intégrateur. Reste une réserve : les gains sont mesurés surtout en simulation sur un benchmark conçu par les auteurs, et la validation matérielle est décrite de façon qualitative.

Ce travail s'inscrit dans la navigation orientée objectif (ObjectNav, puis PersonNav), où les approches apprises souffrent d'un manque de données publiques, la confidentialité des personnes limitant la collecte. Les auteurs contournent ce verrou par la planification et la génération synthétique, plutôt que par l'apprentissage de bout en bout adopté par de nombreux laboratoires. Il s'agit d'une publication de recherche, pas d'un produit ni d'un pilote : aucun calendrier de déploiement n'est annoncé. La suite logique serait le filtrage bayésien évoqué, puis des tests en environnement occupé et sur de longues durées.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots
1arXiv cs.RO 

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots

Des chercheurs publient Social-WM, un cadre de planification par modèle de monde latent destiné à la navigation sociale des robots, c'est-à-dire le déplacement parmi des piétons et des obstacles. Le système est entraîné uniquement à partir de séquences vidéo RGB égocentriques. Il prédit, en fonction de l'action commandée, l'observation future réellement obtenue après chaque commande. Il apprend ainsi les conséquences pertinentes pour la sécurité. Un second objectif, dit de dynamique inverse « réalisable », associe chaque transition latente observée à l'action effectivement réalisée, et non à l'action nominale demandée. Au déploiement, le robot imagine plusieurs actions candidates dans le modèle de monde. Le modèle inverse estime ensuite leur réalisabilité, et l'écart entre action nominale et action réalisable sert de signal de sécurité avant exécution. Sur le benchmark Social-HM3D, Social-WM atteint 63,77 % de réussite avec 21,67 % de collisions avec des humains. Les résultats restent solides en transfert zéro-shot sur Social-MP3D. L'approche n'utilise ni suivi explicite des piétons, ni état humain privilégié, ni apprentissage par renforcement en ligne. L'intérêt tient à la manière de traiter le problème. Une action « avancer » peut s'exécuter entièrement en espace libre, mais doit être freinée ou modifiée face à un piéton ou un obstacle. Les données de navigation sociale contiennent donc un décalage systématique entre commande et mouvement réel. En apprenant ce décalage plutôt qu'en le supposant nul, le robot dispose d'un indicateur de risque sans module de perception dédié aux humains. Pour un intégrateur, cela réduit la dépendance à des piles de suivi et de prédiction de trajectoires, coûteuses à calibrer. Le fait que la dynamique et la réalisabilité soient indépendantes du but permet de réutiliser le même modèle pour la navigation par position et par image-cible. Il faut toutefois relativiser : un taux de collision de 21,67 % reste très éloigné d'un niveau acceptable en environnement réel, et les résultats proviennent de simulation. Aucun test sur robot physique ni comparaison de coûts de calcul n'est mentionné dans le résumé. Ce travail s'inscrit dans la montée des modèles de monde latents, qui planifient dans un espace de représentation compact plutôt qu'en reconstruisant des pixels, et dans l'effort pour combler l'écart entre simulation et réel en navigation sociale. Les benchmarks utilisés, construits sur les scènes HM3D et Matterport3D, relèvent de la simulation d'intérieur et couvrent mal la variété des lieux publics. Les approches concurrentes reposent généralement soit sur l'apprentissage par renforcement en ligne, soit sur des modules explicites de suivi des piétons. La suite logique est une validation sur plateforme mobile réelle, dans des espaces partagés comme les hôpitaux ou la logistique, où des robots mobiles autonomes (AMR) croisent déjà des opérateurs. Il s'agit pour l'instant d'une préimpression arXiv (v1), non évaluée par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Bi3 : un jeu de données biplateforme, biculturel et bipersonnel pour la navigation des robots sociaux
2arXiv cs.RO 

Bi3 : un jeu de données biplateforme, biculturel et bipersonnel pour la navigation des robots sociaux

Bi3 est un jeu de données pour la navigation sociale de robots en espaces contraints, publié en preprint sur arXiv en mai 2026. L'expérience place systématiquement un robot face à deux humains dans un espace de laboratoire restreint, avec 74 participants recrutés sur deux sites : un aux États-Unis, un en France. Le dataset totalise 10,5 heures de trajectoires avec vérité terrain pour humains et robots, des flux vidéo RGB et des évaluations subjectives des participants sur les performances du robot. Cinq algorithmes de navigation distincts ont été testés sur deux plateformes robotiques différentes, ce qui constitue une couverture algorithmique et matérielle inédite dans ce domaine. La navigation sociale en milieu dense reste l'un des verrous techniques majeurs de la robotique de service et de la logistique en environnement humain. Les benchmarks existants souffrent généralement d'un biais culturel marqué et d'une densité d'interaction artificiellement faible. Bi3 cible ces lacunes directement : la dimension biculturelle France/USA permet de tester si les comportements proximaux humains varient selon les normes sociales locales, une hypothèse rarement éprouvée empiriquement. Les métriques publiées, densité d'interaction et vélocité humaine, montrent une complexité comportementale supérieure aux datasets précédents, ce qui en fait un terrain d'évaluation plus exigeant pour les modèles de prédiction de mouvement et les politiques de contrôle de navigation. Ce dataset s'inscrit dans l'effort collectif de la communauté robotique pour réduire l'écart entre simulations et déploiements réels. La présence d'un site de collecte en France est notable : elle apporte une représentation européenne rare dans ce type de benchmark, où les données américaines ou asiatiques dominent historiquement. Bi3 est conçu comme une ressource ouverte pour entraîner des architectures VLA (Vision-Language-Action) et des politiques de navigation en espaces denses, ainsi que des modèles de prédiction de mouvement humain. À ce stade, il s'agit d'un preprint académique, pas d'un déploiement opérationnel. Les suites naturelles incluent l'intégration dans des benchmarks standardisés et l'utilisation pour affiner des politiques de navigation sur des AMR (Autonomous Mobile Robots) en environnement industriel ou hospitalier.

UELa présence d'un site de collecte en France apporte des données comportementales européennes dans un benchmark de navigation sociale, offrant une référence plus représentative pour calibrer des AMR déployés en milieu hospitalier ou industriel en Europe.

RecherchePaper
1 source
SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion
3arXiv cs.RO 

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion

Des chercheurs présentent SplatSearch, une nouvelle architecture de navigation robotique permettant à un robot mobile de retrouver un objet ou une personne spécifique à partir d'une seule image de référence, prise sous un angle arbitraire. Le système s'appuie sur des reconstructions 3D par Gaussian Splatting (3DGS) construites à partir de vues éparses, une technique bien moins gourmande en données que les reconstructions denses classiques. SplatSearch génère plusieurs points de vue synthétiques autour des objets candidats grâce à cette carte 3DGS, puis utilise un modèle de diffusion multi-vues pour compléter les zones manquantes des images rendues, ce qui permet une mise en correspondance robuste avec l'image cible. Une politique d'exploration de frontières a également été développée : elle combine le contexte visuel des vues synthétisées et le contexte sémantique de l'image but pour hiérarchiser les zones à explorer en priorité. Les auteurs rapportent des performances supérieures aux méthodes de référence actuelles, mesurées en taux de réussite et en longueur de chemin jusqu'au succès, sur des environnements domestiques photoréalistes et des tests en conditions réelles. Une étude d'ablation confirme la pertinence des choix de conception retenus. Cette avancée s'attaque à un problème central pour la robotique de service et l'inspection industrielle : la capacité d'un robot à localiser une cible précise dans un environnement inconnu, sans dépendre d'un scan 3D exhaustif préalable. La navigation par instance d'image (Instance Image Goal Navigation) est particulièrement exigeante lorsque l'image de référence est prise sous un angle très différent de celui du robot au moment de la recherche, un scénario fréquent en usage réel mais souvent contourné dans les benchmarks. En misant sur des reconstructions éparses complétées par diffusion plutôt que sur des cartes 3D denses coûteuses à construire, l'approche pourrait réduire le temps de calibration nécessaire au déploiement de robots de recherche et de récupération d'objets, un enjeu concret pour les intégrateurs travaillant sur des AMR en environnement domestique ou logistique. Le travail s'inscrit dans la lignée des recherches combinant 3D Gaussian Splatting et navigation robotique, une technique de rendu apparue en 2023 et rapidement adoptée pour la cartographie temps réel en raison de sa rapidité par rapport aux champs de radiance neuronaux (NeRF). SplatSearch se positionne face aux méthodes état de l'art existantes en IIN, qu'il dépasse selon les métriques de taux de réussite et de longueur de chemin rapportées dans l'article, republié en version 2 sur arXiv. Le papier ne précise pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, validée par simulation et par des tests réels limités, sans indication d'un acteur français ou européen impliqué.

RecherchePaper
1 source
Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff
4arXiv cs.RO 

Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff

Une équipe de recherche publie SoGuDiff (Socially Guided Diffusion), un cadre de navigation robotique fondé sur un modèle de diffusion, dans une prépublication arXiv (2609.30560v1, catégorie "new"). Le système permet de régler à l'exécution le style social d'un robot mobile : distance de passage, côté privilégié pour contourner un obstacle, degré de déférence envers un groupe de personnes. Contrairement aux politiques classiques, entraînées par apprentissage par renforcement sur une récompense fixe ou par imitation de démonstrations humaines, qui figent un comportement unique sans réglage possible, SoGuDiff définit des axes de style continus, utilisables seuls ou combinés, plutôt qu'un catalogue de comportements discrets prédéfinis. Une couche de projection de faisabilité sépare ce comportement social appris des contraintes cinématiques et de l'évitement de collision. Les auteurs montrent qu'un balayage sur un seul axe de style produit une courbe de compromis qui domine strictement les configurations de référence à comportement fixe testées, et que les différences de style se retrouvent dans des démonstrations réelles ; aucune plateforme commerciale, entreprise ni volume de déploiement n'est cité, il s'agit d'une contribution méthodologique et non d'un produit livré. Pour les intégrateurs de robots mobiles autonomes et de service évoluant en environnements partagés avec des humains, l'absence d'interface de réglage du comportement social est une limite connue : chaque site, culture ou réglementation impose ses propres conventions de distance et de priorité de passage, qu'une politique figée gère mal. Pouvoir ajuster ce comportement via des paramètres continus au déploiement, sans ré-entraînement ni choix parmi des comportements discrets prédéfinis, simplifierait l'adaptation d'une même flotte à plusieurs sites. La validation reste toutefois limitée à un seul axe de style balayé et à des références "comportement fixe" définies par les auteurs eux-mêmes, sans comparaison à un système commercial existant ni test à grande échelle : le résultat démontré est une courbe de compromis en banc d'essai, pas un déploiement en flotte. Le travail prolonge des recherches antérieures sur les modèles de diffusion appliqués à la planification de trajectoire, une approche qui a gagné du terrain depuis 2023 pour sa capacité à représenter des comportements multimodaux, à la différence des politiques par renforcement ou par imitation classiques qui convergent vers un comportement moyen unique. L'abstract ne cite aucun concurrent ni acteur industriel, américain ou européen, ni aucun des acteurs FR/EU du secteur AMR comme Wandercraft ou Exotec, le travail relevant de la recherche académique plutôt que d'un produit commercial. Aucun calendrier de pilote ni prochaine étape n'est annoncé : il s'agit pour l'instant d'une simple prépublication, dont la portée pratique dépendra de validations futures sur du matériel varié et à plus grande échelle.

UEAucune entreprise ni institution européenne n'est impliquée, mais la méthode pourrait intéresser les intégrateurs européens de robots mobiles de service confrontes a des normes sociales variables selon les pays.

RecherchePaper
1 source