Au-delà du support de politique : apprentissage par renforcement hors ligne sous contrainte d'interaction pour la conduite autonome
Des chercheurs proposent ICDP (Interaction-Constrained Drive Policy), un cadre d'apprentissage par renforcement hors ligne pour la conduite autonome, qui cible un défaut peu traité : le décalage de distribution au niveau des interactions. Le problème de base est classique. En RL hors ligne, la politique s'entraîne sur un jeu de données figé, sans exploration en ligne, et l'optimisation tend à choisir des actions peu représentées dans ces données, ce qui rend les estimations de valeur peu fiables. Les méthodes existantes contrôlent ce décalage dans l'espace d'actions de la politique elle-même. Les auteurs montrent que cela ne suffit pas en conduite : une trajectoire candidate du véhicule ego peut être bien couverte par la distribution marginale des comportements enregistrés, tout en étant très mal couverte conjointement avec le comportement des agents environnants observé dans le même log. Ils nomment cette dégradation « interaction distribution shift » (IDS). Techniquement, ils décomposent exactement la perte de support conjoint en une composante propre à l'ego et une composante résiduelle d'interaction. Cette dernière est estimée par des ratios de densité contrastifs, ce qui évite de modéliser explicitement la densité conjointe, de prédire les autres agents, ou de lancer des rollouts dans un simulateur réactif ou un modèle du monde pendant l'optimisation. Les évaluations en boucle fermée portent sur nuPlan et Interplan, ainsi que sur des essais réels avec un camion. Selon les auteurs, ICDP supprime la sélection de trajectoires à forte valeur estimée mais non soutenues par les interactions observées, et améliore les résultats dans les scénarios où l'interaction est critique. Les chiffres détaillés ne figurent pas dans le résumé.
L'intérêt pratique tient à l'angle d'attaque. Beaucoup de planificateurs appris échouent précisément dans les situations denses (insertions, croisements, négociation de priorité), où une trajectoire isolément plausible devient dangereuse face à la réaction réelle des autres usagers. Traiter ce problème par une contrainte de support apprise, sans simulateur réactif ni prédicteur d'agents dans la boucle d'entraînement, réduit le coût de calcul et évite d'injecter les erreurs d'un modèle du monde dans l'optimisation. C'est un argument pour les équipes qui veulent exploiter de gros volumes de logs de flotte sans exploration risquée. La présence d'essais sur camion suggère aussi une préoccupation de transfert vers le poids lourd, même si le résumé ne précise ni l'ampleur ni les conditions de ces tests, et si les gains annoncés restent à valider sur des benchmarks indépendants. Il s'agit d'un résultat de recherche, pas d'un produit ni d'un déploiement.
Ce travail s'inscrit dans la lignée du RL hors ligne appliqué à la conduite, où les approches dominantes limitent l'écart à la politique de comportement (contraintes de support ou pénalités de type conservateur) et où nuPlan sert de banc d'essai standard pour la planification en boucle fermée. Interplan, centré sur des scénarios interactifs, complète cette évaluation. Les concurrents directs sont les planificateurs fondés sur l'imitation, les méthodes de RL hors ligne conservatrices et les approches adossées à des simulateurs réactifs ou des modèles du monde appris. La suite logique serait une validation plus large, avec des comparaisons chiffrées face à ces références et des essais réels étendus. Une page projet accompagne la publication (mahmoud-selim.github.io/ICDP).
Pas d\'impact direct sur la France/UE



