Aller au contenu principal
RecherchearXiv cs.RO 

Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie SoGuDiff (Socially Guided Diffusion), un cadre de navigation robotique fondé sur un modèle de diffusion, dans une prépublication arXiv (2609.30560v1, catégorie "new"). Le système permet de régler à l'exécution le style social d'un robot mobile : distance de passage, côté privilégié pour contourner un obstacle, degré de déférence envers un groupe de personnes. Contrairement aux politiques classiques, entraînées par apprentissage par renforcement sur une récompense fixe ou par imitation de démonstrations humaines, qui figent un comportement unique sans réglage possible, SoGuDiff définit des axes de style continus, utilisables seuls ou combinés, plutôt qu'un catalogue de comportements discrets prédéfinis. Une couche de projection de faisabilité sépare ce comportement social appris des contraintes cinématiques et de l'évitement de collision. Les auteurs montrent qu'un balayage sur un seul axe de style produit une courbe de compromis qui domine strictement les configurations de référence à comportement fixe testées, et que les différences de style se retrouvent dans des démonstrations réelles ; aucune plateforme commerciale, entreprise ni volume de déploiement n'est cité, il s'agit d'une contribution méthodologique et non d'un produit livré.

Pour les intégrateurs de robots mobiles autonomes et de service évoluant en environnements partagés avec des humains, l'absence d'interface de réglage du comportement social est une limite connue : chaque site, culture ou réglementation impose ses propres conventions de distance et de priorité de passage, qu'une politique figée gère mal. Pouvoir ajuster ce comportement via des paramètres continus au déploiement, sans ré-entraînement ni choix parmi des comportements discrets prédéfinis, simplifierait l'adaptation d'une même flotte à plusieurs sites. La validation reste toutefois limitée à un seul axe de style balayé et à des références "comportement fixe" définies par les auteurs eux-mêmes, sans comparaison à un système commercial existant ni test à grande échelle : le résultat démontré est une courbe de compromis en banc d'essai, pas un déploiement en flotte.

Le travail prolonge des recherches antérieures sur les modèles de diffusion appliqués à la planification de trajectoire, une approche qui a gagné du terrain depuis 2023 pour sa capacité à représenter des comportements multimodaux, à la différence des politiques par renforcement ou par imitation classiques qui convergent vers un comportement moyen unique. L'abstract ne cite aucun concurrent ni acteur industriel, américain ou européen, ni aucun des acteurs FR/EU du secteur AMR comme Wandercraft ou Exotec, le travail relevant de la recherche académique plutôt que d'un produit commercial. Aucun calendrier de pilote ni prochaine étape n'est annoncé : il s'agit pour l'instant d'une simple prépublication, dont la portée pratique dépendra de validations futures sur du matériel varié et à plus grande échelle.

Impact France/UE

Aucune entreprise ni institution européenne n'est impliquée, mais la méthode pourrait intéresser les intégrateurs européens de robots mobiles de service confrontes a des normes sociales variables selon les pays.

À lire aussi

Modèle du monde pour la navigation sociale de robots guidée par la logique
1arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
2arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source
G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots
3arXiv cs.RO 

G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots

Des chercheurs présentent G2-Nav, un nouveau framework de navigation sociale pour robots mobiles, détaillé dans un article déposé sur arXiv (2607.16956v1). Plutôt que de laisser un modèle vision-langage (VLM) décider directement des trajectoires, comme le font les approches end-to-end existantes, G2-Nav traduit le raisonnement sémantique du VLM en une costmap vision-langage interprétable. Le modèle identifie les zones traversables et les agents sociaux à partir d'une perception en ensemble ouvert (open-set), puis cartographie ce contexte social sous forme de coûts exploitables par le planificateur. Pour renforcer la robustesse en conditions réelles, le VLM effectue aussi une vérification sémantique sur le suivi (tracking) en amont, et les auteurs ajoutent un contrôle de sécurité à haute fréquence destiné à compenser la latence du système avant la génération de trajectoire. Des expériences en environnement réel, selon les auteurs, montrent une navigation autonome sûre, efficace et socialement conforme dans des espaces non structurés. Le code source doit être publié ultérieurement. L'intérêt de ce travail tient à la faille qu'il cherche à combler entre deux approches jugées insuffisantes pour l'autonomie complète: les frameworks VLM end-to-end, qui produisent des décisions de planification difficiles à auditer et donc risquées à déployer, et les méthodes d'instruction-following, pensées pour suivre des consignes humaines plutôt que pour opérer de façon totalement autonome. En cantonnant le VLM à un rôle d'évaluation sémantique plutôt que de contrôle direct, G2-Nav vise une architecture plus traçable, un enjeu concret pour les intégrateurs et décideurs industriels qui doivent justifier la sécurité de robots évoluant parmi des humains, en entrepôt, en établissement de santé ou en espace public. Le garde-fou de sécurité haute fréquence répond en particulier à un angle mort fréquent des démonstrations VLM: la latence d'inférence, souvent ignorée dans les vidéos promotionnelles du secteur. Ce travail s'inscrit dans la vague de recherche actuelle sur l'usage des VLM pour doter les robots d'un raisonnement de niveau humain en navigation sociale, un domaine où les benchmarks restent encore largement issus de démonstrations contrôlées. L'abstract ne précise ni l'institution porteuse ni le matériel robotique utilisé pour les essais réels, et le code, annoncé comme futur, n'est pas encore disponible: il s'agit donc à ce stade d'un préprint à confirmer par la publication effective et par une évaluation indépendante, plutôt que d'une solution déployée ou commercialisée.

RecherchePaper
1 source
Adaptation en ligne préservant la performance en navigation sociale via pilotage par diffusion
4arXiv cs.RO 

Adaptation en ligne préservant la performance en navigation sociale via pilotage par diffusion

Des chercheurs publient sur arXiv (arXiv:2609.24317v1, soumission du 24 septembre 2026) une méthode baptisée DSRL, pour "diffusion steering via reinforcement learning", destinée à l'adaptation en ligne des robots de navigation sociale, c'est-à-dire des robots mobiles qui doivent éviter des piétons et atteindre une destination au milieu d'humains. Le constat de départ: l'apprentissage par renforcement profond utilisé pour ce type de navigation est entraîné en simulation, mais celle-ci ne reproduit jamais fidèlement la diversité des scénarios réels, la dynamique propre du robot, ni les conventions sociales qui varient d'un site de déploiement à l'autre (un couloir d'hôpital ne se comporte pas comme un entrepôt ou un bureau). La solution proposée consiste à figer la politique de diffusion de base déjà entraînée et à n'entraîner que sa "politique de bruit" lors du réglage fin sur site, ce qui évite de dégrader les performances du modèle initial pendant l'adaptation. Les auteurs assemblent en plus plusieurs politiques de RL basées sur la diffusion, entraînées avec des graines aléatoires différentes, pour construire une politique de base plus robuste. L'évaluation s'appuie sur des comparaisons avec d'autres méthodes d'apprentissage et sur un test en hardware-in-the-loop avec un robot physique, mais l'abstract ne fournit aucun chiffre de performance concret (taux de succès, distance, temps de cycle), ce qui limite la portée vérifiable de l'annonce à ce stade. Pour l'industrie robotique, ce travail s'attaque à un point de friction bien identifié: le réglage fin en environnement réel améliore l'adaptation mais risque l'oubli catastrophique, c'est-à-dire une dégradation du comportement de base validé en simulation. Une méthode qui préserve les performances tout en permettant un ajustement flexible aux conventions sociales locales intéresse directement les fabricants d'AMR et de robots de service déployés en environnements humains partagés, où les intégrateurs cherchent justement à réduire l'écart entre démonstration simulée et comportement réel sans tout réentraîner à chaque site. Le papier s'inscrit dans la lignée des méthodes de "diffusion steering" appliquées au RL, en les spécialisant pour la navigation sociale plutôt que pour un fine-tuning généraliste. Classé "Announce Type: new" sur arXiv, il s'agit d'une prépublication non encore validée par les pairs, sans partenaire industriel ni déploiement réel annoncé: seules la simulation et une validation hardware-in-the-loop sont mentionnées, les tests sur robot physique en conditions de terrain restant une étape à venir.

RecherchePaper
1 source