Aller au contenu principal
RecherchearXiv cs.RO 

Adaptation en ligne préservant la performance en navigation sociale via pilotage par diffusion

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2609.24317v1, soumission du 24 septembre 2026) une méthode baptisée DSRL, pour "diffusion steering via reinforcement learning", destinée à l'adaptation en ligne des robots de navigation sociale, c'est-à-dire des robots mobiles qui doivent éviter des piétons et atteindre une destination au milieu d'humains. Le constat de départ: l'apprentissage par renforcement profond utilisé pour ce type de navigation est entraîné en simulation, mais celle-ci ne reproduit jamais fidèlement la diversité des scénarios réels, la dynamique propre du robot, ni les conventions sociales qui varient d'un site de déploiement à l'autre (un couloir d'hôpital ne se comporte pas comme un entrepôt ou un bureau). La solution proposée consiste à figer la politique de diffusion de base déjà entraînée et à n'entraîner que sa "politique de bruit" lors du réglage fin sur site, ce qui évite de dégrader les performances du modèle initial pendant l'adaptation. Les auteurs assemblent en plus plusieurs politiques de RL basées sur la diffusion, entraînées avec des graines aléatoires différentes, pour construire une politique de base plus robuste. L'évaluation s'appuie sur des comparaisons avec d'autres méthodes d'apprentissage et sur un test en hardware-in-the-loop avec un robot physique, mais l'abstract ne fournit aucun chiffre de performance concret (taux de succès, distance, temps de cycle), ce qui limite la portée vérifiable de l'annonce à ce stade.

Pour l'industrie robotique, ce travail s'attaque à un point de friction bien identifié: le réglage fin en environnement réel améliore l'adaptation mais risque l'oubli catastrophique, c'est-à-dire une dégradation du comportement de base validé en simulation. Une méthode qui préserve les performances tout en permettant un ajustement flexible aux conventions sociales locales intéresse directement les fabricants d'AMR et de robots de service déployés en environnements humains partagés, où les intégrateurs cherchent justement à réduire l'écart entre démonstration simulée et comportement réel sans tout réentraîner à chaque site.

Le papier s'inscrit dans la lignée des méthodes de "diffusion steering" appliquées au RL, en les spécialisant pour la navigation sociale plutôt que pour un fine-tuning généraliste. Classé "Announce Type: new" sur arXiv, il s'agit d'une prépublication non encore validée par les pairs, sans partenaire industriel ni déploiement réel annoncé: seules la simulation et une validation hardware-in-the-loop sont mentionnées, les tests sur robot physique en conditions de terrain restant une étape à venir.

Dans nos dossiers

À lire aussi

SOPD-SocialNav : distillation sélective en ligne pour la navigation sociale vision-langage
1arXiv cs.RO 

SOPD-SocialNav : distillation sélective en ligne pour la navigation sociale vision-langage

Des chercheurs présentent SOPD-SocialNav, une méthode de distillation sélective "on-policy" (SOPD) qui transfère les capacités de raisonnement social pour la navigation robotique d'un grand modèle vision-langage (VLM) enseignant vers un VLM étudiant léger, plus facile à déployer sur une plateforme robotique aux ressources limitées. Le mécanisme central repose sur une sélection de tokens basée sur l'entropie: le système repère, grâce à l'incertitude du modèle enseignant, les tokens de décision socialement informatifs, tout en supprimant les gradients des tokens à faible entropie qui correspondent à des situations de navigation triviales. Un objectif de divergence de Jensen-Shannon à température contrôlée aligne ensuite les distributions de l'étudiant et de l'enseignant sur ces tokens sélectionnés uniquement. Sur les benchmarks SNEI et MUSON, SOPD surpasse le fine-tuning supervisé classique, la distillation hors ligne (off-policy) et la distillation on-policy standard, sur trois axes: prédiction d'action, cohérence de perception et cohérence de raisonnement. Les auteurs ont aussi testé le modèle distillé en conditions réelles sur un robot Scout Mini, dans des scénarios de conversation et de file d'attente humaine. L'enjeu dépasse la simple performance benchmark: c'est la tension classique entre VLM massifs, riches en raisonnement social mais trop lourds pour l'embarqué, et VLM légers, rapides mais socialement maladroits. Les méthodes de distillation existantes traitent généralement tous les tokens de façon uniforme, gaspillant de la capacité d'apprentissage sur des états de navigation sans enjeu social réel. En ciblant spécifiquement les moments de décision ambigus (croiser un piéton, gérer une file d'attente), SOPD propose une piste concrète pour des robots socialement compétents sans dépendre d'un cloud ou d'un GPU embarqué surdimensionné, un sujet clé pour les intégrateurs en logistique, santé ou espaces partagés. Ce travail reste toutefois un résultat de recherche publié sur arXiv, validé sur un seul robot (Scout Mini) et deux benchmarks spécialisés (SNEI, MUSON), pas un produit déployé à l'échelle. Il s'inscrit dans la vague plus large des VLA/VLM pour la robotique incarnée (Pi-0, GR00T, Helix), mais se concentre étroitement sur la navigation sociale plutôt que la manipulation généraliste. Les suites logiques attendues seraient des essais sur d'autres plateformes robotiques et une comparaison directe avec d'autres approches de navigation sociale.

RecherchePaper
1 source
COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion
2arXiv cs.RO 

COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion

Des chercheurs proposent COLSON (Controllable Learning-based Social Navigation), une méthode de navigation sociale pour robots mobiles autonomes (AMR) en milieux piétons, fondée sur l'apprentissage par renforcement couplé à des modèles de diffusion. Publiée sur arXiv (2503.13934v2), cette étude traite d'un verrou persistant pour les robots de service : naviguer de façon fluide et socialement cohérente parmi des piétons dynamiques, sans violer leurs espaces de proximité ni générer de comportements erratiques. Les approches à base de règles telles qu'ORCA ou DWA montrent leurs limites dans les environnements denses, tandis que les méthodes de deep RL conventionnelles reposent sur des distributions gaussiennes qui contraignent la variété des trajectoires produites. COLSON contourne cette limitation en exploitant les distributions d'actions plus riches offertes par les modèles de diffusion appliqués au RL, capables de représenter des comportements multimodaux (hésiter, contourner à gauche ou à droite) que les politiques gaussiennes tendent à lisser. L'apport central de la méthode est sa capacité de généralisation à des scénarios inédits sans ré-entraînement. Dans les démonstrations présentées, le robot adapte son comportement à des obstacles statiques absents du jeu d'entraînement, ou change d'objectif pour accompagner un piéton cible tout en évitant les autres passants. Pour les intégrateurs d'AMR en milieux hospitaliers, aéroportuaires ou logistiques, cette propriété de contrôlabilité zero-shot est stratégiquement importante : elle réduit le coût de re-paramétrage à chaque nouveau site de déploiement. Elle valide aussi partiellement l'hypothèse que les diffusion models peuvent atténuer le sim-to-real gap en navigation sociale, en générant des distributions d'actions plus robustes face à l'imprévu. Le champ de la social navigation par deep RL est actif depuis une décennie, avec des travaux fondateurs comme CADRL (2017), SARL et CrowdNav. L'application des modèles de diffusion au RL dans la robotique est plus récente, s'appuyant notamment sur Diffusion Policy (Columbia/MIT, 2023) dans le domaine de la manipulation. COLSON transfère cette logique vers la planification de mouvement en espace ouvert. Il s'agit à ce stade d'un preprint académique avec validation uniquement en simulation ; aucun déploiement sur robot réel ni partenariat industriel n'est mentionné, ce qui invite à tempérer les conclusions. Les éditeurs actifs sur la navigation sociale autonome incluent Boston Dynamics, ANYbotics et Clearpath Robotics, et côté européen Enchanted Tools (France) ou PAL Robotics (Espagne) pour les robots de service. Les prochaines étapes naturelles seraient une validation en environnement réel et un benchmarking sur les datasets standardisés ETH/UCY.

UELes intégrateurs AMR européens (dont Enchanted Tools en France, PAL Robotics en Espagne) pourraient à terme bénéficier de la contrôlabilité zero-shot de COLSON pour réduire les coûts de redéploiement multi-sites, mais la méthode reste validée uniquement en simulation sans partenariat industriel déclaré.

RecherchePaper
1 source
Mémoire explicite guidée par l'avantage pour la navigation sociale
3arXiv cs.RO 

Mémoire explicite guidée par l'avantage pour la navigation sociale

Une équipe de recherche publie sur arXiv (référence 2608.25610v1) un nouvel agent de navigation robotique doté d'une mémoire explicite non paramétrique, conçu pour la navigation sociale, c'est à dire le déplacement d'un robot au milieu d'humains. Le constat de départ est que les politiques robotiques actuelles, entraînées par imitation learning ou par apprentissage par renforcement (RL) classiques, stockent tout leur comportement dans les poids du réseau de neurones, ce qui les rend fragiles face aux situations rares mais critiques, comme un risque de collision avec un piéton. La solution proposée consiste à indexer explicitement les séquences d'étapes ayant mené à ces événements critiques dans une mémoire externe, plutôt que de tout confier à la représentation apprise. Techniquement, cette mémoire est intégrée à une architecture PPO récurrente (Proximal Policy Optimization), où les états cachés du réseau servent de clé de récupération pour capter la dynamique spatio-temporelle continue de l'environnement, et où les signaux d'avantage du RL guident la priorisation des événements rares à fort impact. L'agent est entraîné en simulation, combinant rendu photoréaliste et simulation de foule non visuelle. L'apport principal tient à deux effets combinés. D'une part, l'agent peut continuer à apprendre pendant son déploiement en collectant des données de ses propres épisodes de test, ce qui améliore sa généralisation face à des comportements humains hors distribution (OOD), un point faible connu des politiques purement paramétriques. D'autre part, cette mémoire externe atténue en partie l'écart classique entre simulation et monde réel (sim-to-real gap), puisque certaines décisions peuvent désormais s'appuyer sur des données réelles collectées après l'entraînement, et non uniquement sur des poids figés issus de la simulation. Pour les intégrateurs travaillant sur des robots mobiles évoluant en environnement humain, cela pointe vers des architectures hybrides mémoire plus apprentissage continu comme piste pour fiabiliser la sécurité sans réentraînement complet. Le travail s'inscrit dans la lignée des méthodes RL récurrentes de type PPO et des recherches sur la mémoire épisodique non paramétrique, sans affiliation industrielle ni nom d'entreprise cités dans la publication. Il reste à ce stade une validation en simulation, sans annonce de pilote terrain ni de calendrier de déploiement réel.

RecherchePaper
1 source
Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)
4arXiv cs.RO 

Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)

Une équipe de recherche présente SPLC (Social Preference Learning for Crowd Robot Navigation), un nouvel algorithme d'apprentissage par renforcement hors ligne conçu pour faire naviguer des robots au milieu de foules de piétons sans avoir à concevoir manuellement une fonction de récompense. Publié sur arXiv le 2 juillet 2026 (arXiv:2607.01925v1), le système introduit un mécanisme de retour de préférences sociales qui génère automatiquement des données de préférence à partir de critères d'évaluation prédéfinis, en tenant compte explicitement de la dynamique complexe des piétons. Les auteurs ont testé SPLC en combinaison avec plusieurs méthodes de RL hors ligne et rapportent des gains constants par rapport aux meilleures références actuelles sur des métriques de performance standard, avant de valider l'approche en conditions réelles sur un robot TurtleBot4. Le code et des démonstrations vidéo sont disponibles sur le dépôt GitHub du projet (sklus949/SPLC). L'enjeu pratique est la conception des récompenses en RL, un goulot d'étranglement bien connu pour déployer des robots mobiles autonomes dans des environnements humains partagés, entrepôts, hôpitaux, espaces commerciaux. Écrire à la main une fonction qui capture des normes sociales floues (garder ses distances, céder le passage, anticiper une trajectoire) introduit des biais et ne généralise pas d'une foule à l'autre. En automatisant la génération de préférences plutôt que la récompense elle-même, SPLC s'attaque directement au problème du "reward hacking" et du décalage entre simulation et réel, un point sensible pour tout intégrateur qui envisage des robots de navigation autonome en zones piétonnes denses. Le passage à un test réel sur TurtleBot4, plutôt qu'une simple démonstration en simulateur, distingue ce travail de nombreuses publications qui restent cantonnées au benchmark. Ce travail s'inscrit dans une lignée de recherches sur le RL hors ligne appliqué à la navigation sociale, un axe où les laboratoires cherchent à réduire la dépendance aux interactions coûteuses en environnement réel pendant l'entraînement. Les approches concurrentes reposent généralement sur du reward shaping manuel ou sur de l'apprentissage par imitation à partir de trajectoires humaines annotées, des méthodes que les auteurs positionnent comme moins robustes face à la variabilité des comportements piétons. Les prochaines étapes annoncées ne sont pas détaillées dans le résumé, mais la mise à disposition du code laisse présager des évaluations comparatives par d'autres équipes, et potentiellement une extension à des plateformes robotiques plus complexes que le TurtleBot4.

RecherchePaper
1 source