Au-delà du pilotage du bruit : apprentissage par renforcement à double espace latent pour les politiques génératives en robotique
Publié sur arXiv le 11 septembre 2026 sous la référence 2609.11270v1, un article lié au dépôt GitHub xianchaoxiu présente DLSRL (Dual-Latent Space Reinforcement Learning), une méthode d'apprentissage par renforcement pour affiner des politiques robotiques génératives préentraînées par démonstration. Le constat de départ : les méthodes de RL existantes se contentent de piloter le bruit initial du générateur, comme dans les politiques de diffusion ou de flow matching, sans jamais toucher aux représentations d'action intermédiaires produites pendant la génération, ce qui dégrade performance et efficacité. DLSRL fait prédire par un réseau acteur deux latentes distinctes, l'une pour le bruit initial qui pilote le comportement généré, l'autre pour la représentation d'action qui module les caractéristiques intermédiaires. Cette seconde latente est projetée en "adapter features" et injectée par connexions résiduelles dans les états cachés des tokens d'action intermédiaires, à l'intérieur d'un générateur qui reste gelé. Le code est publié sur GitHub (xianchaoxiu/DLSRL) ; les tests couvrent plusieurs architectures de politiques génératives et plusieurs tâches de manipulation robotique, sans que le résumé ne détaille de chiffres de temps de cycle ou de taux de réussite précis.
Pour les équipes qui affinent par RL des politiques de type diffusion ou flow matching, l'enjeu est concret : jusqu'ici, le RL en ligne appliqué à ces générateurs ne modifiait que l'entrée du processus de débruitage, laissant les représentations internes largement figées et ralentissant l'adaptation à de nouvelles tâches ou conditions. En ajoutant un canal de contrôle au niveau des représentations sans mettre à jour la politique de base, DLSRL vise une adaptation en ligne plus rapide tout en préservant l'investissement de préentraînement, un argument qui parle directement aux intégrateurs cherchant à réduire le coût de réadaptation d'un modèle générique à un site ou une tâche spécifique. Reste que "accélère efficacement" et "performance compétitive" sont des formulations non chiffrées dans le résumé, ce qui invite à lire les résultats expérimentaux complets avant d'en juger l'ampleur réelle.
DLSRL s'inscrit dans la lignée des politiques robotiques génératives entraînées par imitation puis affinées par renforcement, un courant porté par la diffusion des politiques de type diffusion et flow matching en manipulation robotique. Les méthodes de fine-tuning par RL précédentes se limitaient au pilotage du bruit d'entrée ; DLSRL se présente explicitement comme un complément à ces approches, pas un remplacement. Il s'agit à ce stade d'une contribution de recherche publiée en preprint, sans lien annoncé avec un acteur industriel, un déploiement sur robot physique, ou un partenaire français ou européen. La suite logique passe par la reproduction des résultats via le code partagé sur GitHub et par des comparaisons indépendantes face aux méthodes de steering de bruit existantes.
Dans nos dossiers




