LASER : appariement adjoint dans l'espace latent pour l'apprentissage par renforcement hors ligne à entropie régularisée et support contraint
Des chercheurs du laboratoire REALM du MIT publient sur arXiv (2610.08989) LASER, un algorithme d'apprentissage par renforcement hors ligne (offline RL). Il vise à optimiser une politique à partir de jeux de données statiques, sans interaction coûteuse avec un robot ou un environnement réel. Le travail s'appuie sur une approche récente: apprendre d'abord une politique de clonage de comportement par flow matching, puis faire l'apprentissage par renforcement dans son espace latent contraint, afin que les actions restent proches de celles du jeu de données. LASER ajoute une régularisation par l'entropie, mise en œuvre par un « latent-space adjoint matching ». Cette technique permet d'entraîner des politiques de flux expressives sans rétropropagation à travers le temps. L'évaluation porte sur 40 tâches de l'OGBench, avec des jeux de données de qualité variable. LASER y atteint l'état de l'art, avec un jeu d'hyperparamètres unique et fixe pour toutes les tâches. Les références comparées, dont certaines sont réglées tâche par tâche et jeu de données par jeu de données, sont dépassées. Un site de projet et le code associé sont annoncés.
Cette avancée touche un point bloquant pour le déploiement de politiques robotiques apprises: le risque d'exécuter des actions hors distribution (OOD) que le jeu de données n'a jamais couvertes. Les auteurs observent qu'optimiser naïvement la politique latente la fait s'effondrer sur un mode fragile, ou lui fait exploiter les artefacts abrupts du critique appris. Pour un robot physique, cela se traduit par des comportements instables ou dangereux. Le résultat sur les hyperparamètres compte presque autant que le score. Dans l'industrie, le réglage par tâche mobilise des ingénieurs et des essais coûteux, et il complique le passage du laboratoire à plusieurs sites clients. Une méthode qui tient sans réglage spécifique réduit ce coût. Il faut toutefois rester prudent: OGBench est un banc d'essai en simulation, centré sur des tâches de navigation et de manipulation à objectif. Rien n'est démontré ici sur du matériel réel, ni sur des modèles VLA de grande taille comme Pi-0 ou GR00T N2. Le transfert simulation vers réel reste une hypothèse non testée.
Cette publication s'inscrit dans un courant qui combine politiques génératives (diffusion, flow matching) et RL hors ligne. Il répond à une limite connue: ces politiques imitent bien mais ne dépassent pas la qualité de leurs démonstrations. Les méthodes concurrentes contraignent généralement le support de la politique ou distillent un modèle de flux en une politique à une étape, ce qui impose souvent un réglage fin par tâche. LASER propose de rester dans l'espace latent du modèle de flux et d'y maintenir de l'entropie. La suite logique sera de tester la méthode sur des données robotiques réelles et sur des modèles de fondation plus larges. Aucun pilote industriel ni calendrier de déploiement n'est annoncé à ce stade. Il s'agit d'un résultat de recherche à l'état de préprint, non évalué par les pairs.
Dans nos dossiers



