Aller au contenu principal
RecherchearXiv cs.RO 

LASER : appariement adjoint dans l'espace latent pour l'apprentissage par renforcement hors ligne à entropie régularisée et support contraint

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire REALM du MIT publient sur arXiv (2610.08989) LASER, un algorithme d'apprentissage par renforcement hors ligne (offline RL). Il vise à optimiser une politique à partir de jeux de données statiques, sans interaction coûteuse avec un robot ou un environnement réel. Le travail s'appuie sur une approche récente: apprendre d'abord une politique de clonage de comportement par flow matching, puis faire l'apprentissage par renforcement dans son espace latent contraint, afin que les actions restent proches de celles du jeu de données. LASER ajoute une régularisation par l'entropie, mise en œuvre par un « latent-space adjoint matching ». Cette technique permet d'entraîner des politiques de flux expressives sans rétropropagation à travers le temps. L'évaluation porte sur 40 tâches de l'OGBench, avec des jeux de données de qualité variable. LASER y atteint l'état de l'art, avec un jeu d'hyperparamètres unique et fixe pour toutes les tâches. Les références comparées, dont certaines sont réglées tâche par tâche et jeu de données par jeu de données, sont dépassées. Un site de projet et le code associé sont annoncés.

Cette avancée touche un point bloquant pour le déploiement de politiques robotiques apprises: le risque d'exécuter des actions hors distribution (OOD) que le jeu de données n'a jamais couvertes. Les auteurs observent qu'optimiser naïvement la politique latente la fait s'effondrer sur un mode fragile, ou lui fait exploiter les artefacts abrupts du critique appris. Pour un robot physique, cela se traduit par des comportements instables ou dangereux. Le résultat sur les hyperparamètres compte presque autant que le score. Dans l'industrie, le réglage par tâche mobilise des ingénieurs et des essais coûteux, et il complique le passage du laboratoire à plusieurs sites clients. Une méthode qui tient sans réglage spécifique réduit ce coût. Il faut toutefois rester prudent: OGBench est un banc d'essai en simulation, centré sur des tâches de navigation et de manipulation à objectif. Rien n'est démontré ici sur du matériel réel, ni sur des modèles VLA de grande taille comme Pi-0 ou GR00T N2. Le transfert simulation vers réel reste une hypothèse non testée.

Cette publication s'inscrit dans un courant qui combine politiques génératives (diffusion, flow matching) et RL hors ligne. Il répond à une limite connue: ces politiques imitent bien mais ne dépassent pas la qualité de leurs démonstrations. Les méthodes concurrentes contraignent généralement le support de la politique ou distillent un modèle de flux en une politique à une étape, ce qui impose souvent un réglage fin par tâche. LASER propose de rester dans l'espace latent du modèle de flux et d'y maintenir de l'entropie. La suite logique sera de tester la méthode sur des données robotiques réelles et sur des modèles de fondation plus larges. Aucun pilote industriel ni calendrier de déploiement n'est annoncé à ce stade. Il s'agit d'un résultat de recherche à l'état de préprint, non évalué par les pairs.

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

Au-delà du support de politique : apprentissage par renforcement hors ligne sous contrainte d'interaction pour la conduite autonome

Des chercheurs proposent ICDP (Interaction-Constrained Drive Policy), un cadre d'apprentissage par renforcement hors ligne pour la conduite autonome, qui cible un défaut peu traité : le décalage de distribution au niveau des interactions. Le problème de base est classique. En RL hors ligne, la politique s'entraîne sur un jeu de données figé, sans exploration en ligne, et l'optimisation tend à choisir des actions peu représentées dans ces données, ce qui rend les estimations de valeur peu fiables. Les méthodes existantes contrôlent ce décalage dans l'espace d'actions de la politique elle-même. Les auteurs montrent que cela ne suffit pas en conduite : une trajectoire candidate du véhicule ego peut être bien couverte par la distribution marginale des comportements enregistrés, tout en étant très mal couverte conjointement avec le comportement des agents environnants observé dans le même log. Ils nomment cette dégradation « interaction distribution shift » (IDS). Techniquement, ils décomposent exactement la perte de support conjoint en une composante propre à l'ego et une composante résiduelle d'interaction. Cette dernière est estimée par des ratios de densité contrastifs, ce qui évite de modéliser explicitement la densité conjointe, de prédire les autres agents, ou de lancer des rollouts dans un simulateur réactif ou un modèle du monde pendant l'optimisation. Les évaluations en boucle fermée portent sur nuPlan et Interplan, ainsi que sur des essais réels avec un camion. Selon les auteurs, ICDP supprime la sélection de trajectoires à forte valeur estimée mais non soutenues par les interactions observées, et améliore les résultats dans les scénarios où l'interaction est critique. Les chiffres détaillés ne figurent pas dans le résumé. L'intérêt pratique tient à l'angle d'attaque. Beaucoup de planificateurs appris échouent précisément dans les situations denses (insertions, croisements, négociation de priorité), où une trajectoire isolément plausible devient dangereuse face à la réaction réelle des autres usagers. Traiter ce problème par une contrainte de support apprise, sans simulateur réactif ni prédicteur d'agents dans la boucle d'entraînement, réduit le coût de calcul et évite d'injecter les erreurs d'un modèle du monde dans l'optimisation. C'est un argument pour les équipes qui veulent exploiter de gros volumes de logs de flotte sans exploration risquée. La présence d'essais sur camion suggère aussi une préoccupation de transfert vers le poids lourd, même si le résumé ne précise ni l'ampleur ni les conditions de ces tests, et si les gains annoncés restent à valider sur des benchmarks indépendants. Il s'agit d'un résultat de recherche, pas d'un produit ni d'un déploiement. Ce travail s'inscrit dans la lignée du RL hors ligne appliqué à la conduite, où les approches dominantes limitent l'écart à la politique de comportement (contraintes de support ou pénalités de type conservateur) et où nuPlan sert de banc d'essai standard pour la planification en boucle fermée. Interplan, centré sur des scénarios interactifs, complète cette évaluation. Les concurrents directs sont les planificateurs fondés sur l'imitation, les méthodes de RL hors ligne conservatrices et les approches adossées à des simulateurs réactifs ou des modèles du monde appris. La suite logique serait une validation plus large, avec des comparaisons chiffrées face à ces références et des essais réels étendus. Une page projet accompagne la publication (mahmoud-selim.github.io/ICDP).

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Découpage Q adaptatif pour l'apprentissage par renforcement hors ligne vers en ligne
2arXiv cs.RO 

Découpage Q adaptatif pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs ont publié sur arXiv (arXiv:2605.05544, mai 2026) une méthode appelée Adaptive Q-Chunking (AQC), visant à résoudre une limitation structurelle de l'apprentissage par renforcement offline-to-online avec action chunking. Toutes les approches existantes appliquent une taille de chunk fixe à chaque état, ce qui est sous-optimal : près d'un contact physique, des chunks courts sont nécessaires pour un contrôle réactif ; en déplacement libre, des chunks longs améliorent l'attribution du crédit temporel. La solution naïve, entraîner un critique par taille de chunk puis comparer les valeurs Q, échoue systématiquement par désalignement des échelles de remise (discount-scale mismatch) et dégénère en bruit dans les états à faible valeur. AQC corrige ce double problème en comparant l'avantage relatif de chaque horizon par rapport à une baseline normalisée par le facteur de remise, rendant les comparaisons non biaisées même en l'absence de signal discriminant. La méthode atteint des taux de succès état de l'art sur les benchmarks OGBench et Robomimic, et améliore significativement les performances de modèles VLA à grande échelle sur les tâches RoboCasa-GR1. L'enjeu est concret pour les équipes qui intègrent des modèles Vision-Language-Action en production. Ces architectures, dont Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, prédisent des séquences d'actions dont l'efficacité dépend directement de la granularité temporelle de ces séquences. AQC est applicable sans modifier l'architecture sous-jacente, ce qui en fait un correctif plug-and-play pour des pipelines existants. Les auteurs fournissent également des bornes formelles sur l'immunité au bruit du sélecteur d'avantage et sur la dominance en valeur du chunking adaptatif face à toute taille fixe, donnant une assise théorique à des performances que les benchmarks confirment empiriquement. L'action chunking s'est imposé comme paradigme de référence en manipulation apprise depuis ACT (Action Chunking with Transformers, Chi et al., 2023) et Diffusion Policy. La limitation d'une taille fixe était documentée mais sans solution rigoureuse. Des approches concurrentes adressent la granularité temporelle via la planification hiérarchique ou le fine-tuning online de politiques de diffusion, sans résoudre le biais de comparaison entre horizons. AQC se positionne comme correctif algorithmique orthogonal, applicable en surcouche de ces méthodes. Les résultats présentés portent intégralement sur des environnements simulés ; la validation sur plateformes physiques reste à établir, le gap sim-to-real demeurant une variable non résolue dans ce domaine.

RechercheOpinion
1 source
Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels
3arXiv cs.RO 

Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels

Une étude empirique menée sur trois plateformes robotiques distinctes a testé l'apprentissage par renforcement (RL) en ligne directement sur des robots physiques, à travers 100 sessions d'entraînement réelles. Les chercheurs ont systématiquement isolé les choix de conception algorithmiques, matériels et expérimentaux habituellement laissés implicites dans les travaux précédents sur le sujet. Résultat principal : certains réglages par défaut largement utilisés dans la pratique du RL se révèlent contre-productifs sur du matériel réel, tandis qu'un ensemble restreint de choix de conception robustes, faciles à adopter dans le cadre standard du RL, permet d'obtenir un apprentissage stable sur différentes tâches et différents types de robots. Il s'agit, selon les auteurs, de la première étude empirique à grande échelle de ce type portant sur ces choix de conception. Cette cartographie répond à un point de friction bien identifié chez les intégrateurs et équipes de recherche robotique : le RL en ligne sur robot réel reste réputé fragile, coûteux en ingénierie et peu reproductible d'une plateforme à l'autre, ce qui pousse la majorité des équipes vers l'apprentissage en simulation (sim-to-real) ou l'imitation à partir de démonstrations. En identifiant quels réglages par défaut nuisent réellement à l'apprentissage et lesquels le stabilisent, ce travail réduit potentiellement l'effort d'ingénierie nécessaire pour déployer du RL en ligne directement sur du hardware, sans passer par un simulateur intermédiaire. C'est un signal utile pour évaluer si le RL en ligne peut devenir une option pratique face aux architectures VLA (vision-langage-action) qui dominent actuellement la communication du secteur, en offrant une alternative plus frugale en données de démonstration. Le papier s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les promesses du RL en robotique, démontrées depuis longtemps en simulation, et sa fiabilité en conditions réelles, où le coût d'échantillonnage et les risques matériels limitent les expérimentations à grande échelle. Contrairement aux annonces de plateformes humanoïdes commerciales, ce travail relève de la recherche fondamentale reproductible, avec des ablations systématiques plutôt qu'une démonstration ponctuelle. Publié sur arXiv en tant que version révisée ("replace"), il ouvre la voie à des protocoles standardisés que d'autres laboratoires pourront reprendre et à des comparaisons futures avec des approches sim-to-real ou par imitation sur les mêmes tâches.

RecherchePaper
1 source
Transformer de décision conditionné par objectif pour l'apprentissage par renforcement hors ligne multi-objectifs
4arXiv cs.RO 

Transformer de décision conditionné par objectif pour l'apprentissage par renforcement hors ligne multi-objectifs

Des chercheurs ont publié en octobre 2024 sur arXiv (identifiant 2410.06347, version 2) une méthode baptisée Goal-Conditioned Decision Transformer (GCDT), conçue pour entraîner des robots à accomplir plusieurs tâches distinctes sans interaction en temps réel avec l'environnement. L'approche repose sur l'apprentissage par renforcement hors ligne (offline RL) : le modèle apprend uniquement à partir de données collectées au préalable, sans générer de nouvelles trajectoires coûteuses. La validation se fait sur le bras collaboratif Franka Emika Panda (7 degrés de liberté), à partir d'un jeu de données offline nouvellement publié pour cette plateforme. Les résultats annoncés montrent que GCDT surpasse des baselines en ligne considérées comme état de l'art sur des tâches complexes, et conserve ses performances dans des environnements à récompenses éparses, même avec un nombre limité de démonstrations expertes. L'enjeu technique est réel : le principal frein à l'industrialisation du RL en robotique reste le coût des interactions d'entraînement, chaque collision, chaque reset prend du temps physique et use les équipements. En découplant l'apprentissage de l'exécution grâce à des données hors ligne, GCDT réduit ce verrou. Ce qui est plus notable, c'est la capacité à gérer des objectifs multiples et variables dans un seul modèle, là où la plupart des politiques offline sont entraînées tâche par tâche. La reformulation sous forme de séquences (héritage du Decision Transformer) permet d'injecter explicitement l'état-cible dans le contexte du modèle, ce qui facilite la généralisation. Il faut toutefois rester prudent : il s'agit d'un preprint non encore publié en conférence majeure, et les résultats portent sur un dataset contrôlé, pas sur un déploiement industriel réel. Le Decision Transformer original (Chen et al., 2021, Google Brain / UC Berkeley) avait montré qu'un transformer entraîné sur des trajectoires étiquetées par leur retour cumulatif pouvait rivaliser avec des méthodes RL classiques. GCDT étend cette idée au cadre multi-objectifs, un problème que des travaux concurrents comme MTDIFF ou Goal-Conditioned IQL abordent différemment. Le bras Panda de Franka Robotics (acquis par Agile Robots en 2021) reste la plateforme de référence en robotique manipulation académique. La prochaine étape logique serait un transfert sim-to-real sur des tâches de manipulation industrielle, et une comparaison avec des approches VLA (Vision-Language-Action) comme Pi-0 ou OpenVLA, qui opèrent elles aussi en généralisation multi-tâches mais via des modèles de fondation beaucoup plus lourds.

UEImpact indirect uniquement : le bras Franka Panda, d'origine allemande, est la plateforme de manipulation de référence dans de nombreux labos académiques européens (INRIA, CEA-List inclus), mais l'étude n'implique directement aucune institution ou entreprise française ou européenne.

RecherchePaper
1 source