
Apprentissage par renforcement à entropie de trajectoire pour un apprentissage robuste des compétences motrices des robots
Des chercheurs publient une nouvelle méthode d'apprentissage par renforcement pour le contrôle robotique, baptisée Trajectory Entropy Reinforcement Learning, décrite dans un article déposé sur arXiv (référence 2505.04193, version 2). Le principe consiste à minimiser l'entropie de la trajectoire complète des actions produites par l'agent, c'est-à-dire le nombre de bits nécessaires pour décrire ces actions une fois les états observés, au lieu de s'appuyer uniquement sur la maximisation de récompense classique. Cette entropie est estimée via un modèle de prédiction d'actions à paramétrage variationnel, utilisé pour construire une fonction de récompense régularisée par l'information ; un algorithme permet ensuite d'optimiser conjointement la politique et ce modèle de prédiction. Testée sur plusieurs tâches de locomotion à haute dimension, la méthode produit des trajectoires d'actions plus cycliques et cohérentes, avec de meilleures performances et une robustesse supérieure au bruit et aux changements dynamiques que les approches de référence.
Le résultat cible un point faible connu du RL profond appliqué au contrôle : les politiques neuronales capturent souvent des corrélations complexes et fallacieuses entre observations et actions, ce qui les rend fragiles dès qu'une perturbation légère affecte l'environnement, un frein direct au transfert simulation-vers-réel. En imposant un biais de simplicité mesuré par une quantité d'information plutôt qu'une régularisation ad hoc, ce travail propose un levier générique de robustesse, potentiellement transposable au-delà de la locomotion vers la manipulation ou les tâches de robots mobiles autonomes en environnement non contrôlé, un enjeu central pour tout intégrateur cherchant à sortir de la démonstration en labo.
Cette contribution s'inscrit dans une lignée de recherches sur les biais inductifs de simplicité en apprentissage par renforcement, une direction distincte des approches dominantes misant sur l'échelle des données, à l'image des politiques vision-langage-action généralistes type Pi-0 ou GR00T N2. Publié sous forme de révision croisée entre catégories arXiv, l'article reste une contribution académique validée en simulation, sans mention de déploiement matériel, de partenariat industriel ni de calendrier de transfert vers une pile robotique commerciale.
Dans nos dossiers




