Adaptation en ligne préservant la performance en navigation sociale via pilotage par diffusion
Des chercheurs publient sur arXiv (arXiv:2609.24317v1, soumission du 24 septembre 2026) une méthode baptisée DSRL, pour "diffusion steering via reinforcement learning", destinée à l'adaptation en ligne des robots de navigation sociale, c'est-à-dire des robots mobiles qui doivent éviter des piétons et atteindre une destination au milieu d'humains. Le constat de départ: l'apprentissage par renforcement profond utilisé pour ce type de navigation est entraîné en simulation, mais celle-ci ne reproduit jamais fidèlement la diversité des scénarios réels, la dynamique propre du robot, ni les conventions sociales qui varient d'un site de déploiement à l'autre (un couloir d'hôpital ne se comporte pas comme un entrepôt ou un bureau). La solution proposée consiste à figer la politique de diffusion de base déjà entraînée et à n'entraîner que sa "politique de bruit" lors du réglage fin sur site, ce qui évite de dégrader les performances du modèle initial pendant l'adaptation. Les auteurs assemblent en plus plusieurs politiques de RL basées sur la diffusion, entraînées avec des graines aléatoires différentes, pour construire une politique de base plus robuste. L'évaluation s'appuie sur des comparaisons avec d'autres méthodes d'apprentissage et sur un test en hardware-in-the-loop avec un robot physique, mais l'abstract ne fournit aucun chiffre de performance concret (taux de succès, distance, temps de cycle), ce qui limite la portée vérifiable de l'annonce à ce stade.
Pour l'industrie robotique, ce travail s'attaque à un point de friction bien identifié: le réglage fin en environnement réel améliore l'adaptation mais risque l'oubli catastrophique, c'est-à-dire une dégradation du comportement de base validé en simulation. Une méthode qui préserve les performances tout en permettant un ajustement flexible aux conventions sociales locales intéresse directement les fabricants d'AMR et de robots de service déployés en environnements humains partagés, où les intégrateurs cherchent justement à réduire l'écart entre démonstration simulée et comportement réel sans tout réentraîner à chaque site.
Le papier s'inscrit dans la lignée des méthodes de "diffusion steering" appliquées au RL, en les spécialisant pour la navigation sociale plutôt que pour un fine-tuning généraliste. Classé "Announce Type: new" sur arXiv, il s'agit d'une prépublication non encore validée par les pairs, sans partenaire industriel ni déploiement réel annoncé: seules la simulation et une validation hardware-in-the-loop sont mentionnées, les tests sur robot physique en conditions de terrain restant une étape à venir.
Dans nos dossiers




