Aller au contenu principal
RecherchearXiv cs.RO 

Au-delà du support de politique : apprentissage par renforcement hors ligne sous contrainte d'interaction pour la conduite autonome

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ICDP (Interaction-Constrained Drive Policy), un cadre d'apprentissage par renforcement hors ligne pour la conduite autonome, qui cible un défaut peu traité : le décalage de distribution au niveau des interactions. Le problème de base est classique. En RL hors ligne, la politique s'entraîne sur un jeu de données figé, sans exploration en ligne, et l'optimisation tend à choisir des actions peu représentées dans ces données, ce qui rend les estimations de valeur peu fiables. Les méthodes existantes contrôlent ce décalage dans l'espace d'actions de la politique elle-même. Les auteurs montrent que cela ne suffit pas en conduite : une trajectoire candidate du véhicule ego peut être bien couverte par la distribution marginale des comportements enregistrés, tout en étant très mal couverte conjointement avec le comportement des agents environnants observé dans le même log. Ils nomment cette dégradation « interaction distribution shift » (IDS). Techniquement, ils décomposent exactement la perte de support conjoint en une composante propre à l'ego et une composante résiduelle d'interaction. Cette dernière est estimée par des ratios de densité contrastifs, ce qui évite de modéliser explicitement la densité conjointe, de prédire les autres agents, ou de lancer des rollouts dans un simulateur réactif ou un modèle du monde pendant l'optimisation. Les évaluations en boucle fermée portent sur nuPlan et Interplan, ainsi que sur des essais réels avec un camion. Selon les auteurs, ICDP supprime la sélection de trajectoires à forte valeur estimée mais non soutenues par les interactions observées, et améliore les résultats dans les scénarios où l'interaction est critique. Les chiffres détaillés ne figurent pas dans le résumé.

L'intérêt pratique tient à l'angle d'attaque. Beaucoup de planificateurs appris échouent précisément dans les situations denses (insertions, croisements, négociation de priorité), où une trajectoire isolément plausible devient dangereuse face à la réaction réelle des autres usagers. Traiter ce problème par une contrainte de support apprise, sans simulateur réactif ni prédicteur d'agents dans la boucle d'entraînement, réduit le coût de calcul et évite d'injecter les erreurs d'un modèle du monde dans l'optimisation. C'est un argument pour les équipes qui veulent exploiter de gros volumes de logs de flotte sans exploration risquée. La présence d'essais sur camion suggère aussi une préoccupation de transfert vers le poids lourd, même si le résumé ne précise ni l'ampleur ni les conditions de ces tests, et si les gains annoncés restent à valider sur des benchmarks indépendants. Il s'agit d'un résultat de recherche, pas d'un produit ni d'un déploiement.

Ce travail s'inscrit dans la lignée du RL hors ligne appliqué à la conduite, où les approches dominantes limitent l'écart à la politique de comportement (contraintes de support ou pénalités de type conservateur) et où nuPlan sert de banc d'essai standard pour la planification en boucle fermée. Interplan, centré sur des scénarios interactifs, complète cette évaluation. Les concurrents directs sont les planificateurs fondés sur l'imitation, les méthodes de RL hors ligne conservatrices et les approches adossées à des simulateurs réactifs ou des modèles du monde appris. La suite logique serait une validation plus large, avec des comparaisons chiffrées face à ces références et des essais réels étendus. Une page projet accompagne la publication (mahmoud-selim.github.io/ICDP).

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

LASER : appariement adjoint dans l'espace latent pour l'apprentissage par renforcement hors ligne à entropie régularisée et support contraint

Des chercheurs du laboratoire REALM du MIT publient sur arXiv (2610.08989) LASER, un algorithme d'apprentissage par renforcement hors ligne (offline RL). Il vise à optimiser une politique à partir de jeux de données statiques, sans interaction coûteuse avec un robot ou un environnement réel. Le travail s'appuie sur une approche récente: apprendre d'abord une politique de clonage de comportement par flow matching, puis faire l'apprentissage par renforcement dans son espace latent contraint, afin que les actions restent proches de celles du jeu de données. LASER ajoute une régularisation par l'entropie, mise en œuvre par un « latent-space adjoint matching ». Cette technique permet d'entraîner des politiques de flux expressives sans rétropropagation à travers le temps. L'évaluation porte sur 40 tâches de l'OGBench, avec des jeux de données de qualité variable. LASER y atteint l'état de l'art, avec un jeu d'hyperparamètres unique et fixe pour toutes les tâches. Les références comparées, dont certaines sont réglées tâche par tâche et jeu de données par jeu de données, sont dépassées. Un site de projet et le code associé sont annoncés. Cette avancée touche un point bloquant pour le déploiement de politiques robotiques apprises: le risque d'exécuter des actions hors distribution (OOD) que le jeu de données n'a jamais couvertes. Les auteurs observent qu'optimiser naïvement la politique latente la fait s'effondrer sur un mode fragile, ou lui fait exploiter les artefacts abrupts du critique appris. Pour un robot physique, cela se traduit par des comportements instables ou dangereux. Le résultat sur les hyperparamètres compte presque autant que le score. Dans l'industrie, le réglage par tâche mobilise des ingénieurs et des essais coûteux, et il complique le passage du laboratoire à plusieurs sites clients. Une méthode qui tient sans réglage spécifique réduit ce coût. Il faut toutefois rester prudent: OGBench est un banc d'essai en simulation, centré sur des tâches de navigation et de manipulation à objectif. Rien n'est démontré ici sur du matériel réel, ni sur des modèles VLA de grande taille comme Pi-0 ou GR00T N2. Le transfert simulation vers réel reste une hypothèse non testée. Cette publication s'inscrit dans un courant qui combine politiques génératives (diffusion, flow matching) et RL hors ligne. Il répond à une limite connue: ces politiques imitent bien mais ne dépassent pas la qualité de leurs démonstrations. Les méthodes concurrentes contraignent généralement le support de la politique ou distillent un modèle de flux en une politique à une étape, ce qui impose souvent un réglage fin par tâche. LASER propose de rester dans l'espace latent du modèle de flux et d'y maintenir de l'entropie. La suite logique sera de tester la méthode sur des données robotiques réelles et sur des modèles de fondation plus larges. Aucun pilote industriel ni calendrier de déploiement n'est annoncé à ce stade. Il s'agit d'un résultat de recherche à l'état de préprint, non évalué par les pairs.

RecherchePaper
1 source
IronMan : apprentissage vidéo-action sous contrainte d'information pour la manipulation robotique
2arXiv cs.RO 

IronMan : apprentissage vidéo-action sous contrainte d'information pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.07961) IronMan, un cadre d'apprentissage vidéo-action pour la manipulation robotique, dont le nom signifie Information-constRained videO-actioN learning for robot MANipulation. Il s'inscrit dans la famille des Video Action Models (VAM), qui associent la modélisation de la dynamique visuelle à la génération d'actions. IronMan s'appuie sur le principe du goulot d'information (information bottleneck). Un module sensible à la dynamique condense des caractéristiques vidéo bruitées et enchevêtrées, calculées à un seul pas de diffusion, en représentations compactes du monde. Ces représentations suppriment l'information visuelle non pertinente et conservent les indices de dynamique utiles à l'action. Les auteurs annoncent 99,0 % de réussite sur LIBERO et 79,4 % sur RoboTwin en configuration clean2clean, au-dessus de toutes les références évaluées. Hors distribution, sur LIBERO-Plus, le taux atteint 79,1 %, soit 10,4 points de pourcentage de plus que la meilleure référence. Des expériences en conditions réelles et une inférence présentée comme efficace complètent le tableau. Il s'agit d'un travail de recherche, sans produit ni déploiement industriel. L'enjeu tient à un point faible connu des VAM : une représentation vidéo n'est pas naturellement adaptée à la génération d'actions. Exposer la politique à trop de détails visuels (textures, arrière-plans, éclairage) dégrade sa généralisation. IronMan défend l'idée inverse de la tendance à enrichir toujours davantage les représentations : contraindre l'information serait plus rentable que l'étendre. Le résultat le plus parlant est la robustesse hors distribution. C'est là que se joue l'écart entre démonstration et réalité, car un robot en atelier rencontre des changements de scène, de caméra ou de luminosité que les benchmarks propres ne couvrent pas. Pour les intégrateurs, un tel levier pourrait réduire le coût de réadaptation d'une politique à chaque nouveau site. Deux réserves s'imposent. Un score de 99 % sur LIBERO indique surtout que ce benchmark est quasi saturé. Les 79,4 % sur RoboTwin laissent une marge d'échec importante. Les résultats en conditions réelles sont résumés sans détail dans le résumé de l'article (tâches, nombre d'essais, robots), ce qui limite leur portée. Ce travail prolonge deux courants. Les politiques vision-langage-action (VLA) de type Pi-0 ou GR00T reposent sur des modèles vision-langage pré-entraînés. Les modèles vidéo génératifs servent désormais de prior de dynamique pour l'action. Les premiers manquent de compréhension physique explicite. Les seconds, coûteux en calcul et sensibles aux détails superflus, se heurtent au problème que IronMan cherche à corriger. Le recours à des caractéristiques à un seul pas vise à préserver la vitesse d'inférence, critère décisif pour un contrôle en boucle fermée. La suite dépendra de la reproduction des résultats par d'autres équipes, de l'ouverture du code et des tests sur des plateformes variées, y compris dans des environnements industriels réels. Aucune échéance de déploiement n'est annoncée.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Transformer de décision conditionné par objectif pour l'apprentissage par renforcement hors ligne multi-objectifs
3arXiv cs.RO 

Transformer de décision conditionné par objectif pour l'apprentissage par renforcement hors ligne multi-objectifs

Des chercheurs ont publié en octobre 2024 sur arXiv (identifiant 2410.06347, version 2) une méthode baptisée Goal-Conditioned Decision Transformer (GCDT), conçue pour entraîner des robots à accomplir plusieurs tâches distinctes sans interaction en temps réel avec l'environnement. L'approche repose sur l'apprentissage par renforcement hors ligne (offline RL) : le modèle apprend uniquement à partir de données collectées au préalable, sans générer de nouvelles trajectoires coûteuses. La validation se fait sur le bras collaboratif Franka Emika Panda (7 degrés de liberté), à partir d'un jeu de données offline nouvellement publié pour cette plateforme. Les résultats annoncés montrent que GCDT surpasse des baselines en ligne considérées comme état de l'art sur des tâches complexes, et conserve ses performances dans des environnements à récompenses éparses, même avec un nombre limité de démonstrations expertes. L'enjeu technique est réel : le principal frein à l'industrialisation du RL en robotique reste le coût des interactions d'entraînement, chaque collision, chaque reset prend du temps physique et use les équipements. En découplant l'apprentissage de l'exécution grâce à des données hors ligne, GCDT réduit ce verrou. Ce qui est plus notable, c'est la capacité à gérer des objectifs multiples et variables dans un seul modèle, là où la plupart des politiques offline sont entraînées tâche par tâche. La reformulation sous forme de séquences (héritage du Decision Transformer) permet d'injecter explicitement l'état-cible dans le contexte du modèle, ce qui facilite la généralisation. Il faut toutefois rester prudent : il s'agit d'un preprint non encore publié en conférence majeure, et les résultats portent sur un dataset contrôlé, pas sur un déploiement industriel réel. Le Decision Transformer original (Chen et al., 2021, Google Brain / UC Berkeley) avait montré qu'un transformer entraîné sur des trajectoires étiquetées par leur retour cumulatif pouvait rivaliser avec des méthodes RL classiques. GCDT étend cette idée au cadre multi-objectifs, un problème que des travaux concurrents comme MTDIFF ou Goal-Conditioned IQL abordent différemment. Le bras Panda de Franka Robotics (acquis par Agile Robots en 2021) reste la plateforme de référence en robotique manipulation académique. La prochaine étape logique serait un transfert sim-to-real sur des tâches de manipulation industrielle, et une comparaison avec des approches VLA (Vision-Language-Action) comme Pi-0 ou OpenVLA, qui opèrent elles aussi en généralisation multi-tâches mais via des modèles de fondation beaucoup plus lourds.

UEImpact indirect uniquement : le bras Franka Panda, d'origine allemande, est la plateforme de manipulation de référence dans de nombreux labos académiques européens (INRIA, CEA-List inclus), mais l'étude n'implique directement aucune institution ou entreprise française ou européenne.

RecherchePaper
1 source
DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution
4arXiv cs.RO 

DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution

Les robots serpents mous, capables de se faufiler et de se plier dans des environnements complexes grâce à leur structure flexible, restent difficiles à piloter car leur dynamique est fortement non linéaire et échappe aux modèles simplifiés utilisés par les contrôleurs classiques ou bio-inspirés. Une équipe de recherche propose DiSA-IQL (Distribution-Shift-Aware Implicit Q-Learning), une extension de l'algorithme d'apprentissage par renforcement hors ligne IQL, décrite dans une version révisée d'un article publié sur arXiv (identifiant 2510.00358v2). La méthode ajoute une pénalité sur les paires état-action jugées peu fiables afin de limiter la dégradation de performance causée par le décalage de distribution, un problème classique de l'apprentissage hors ligne où l'agent doit généraliser à partir d'un jeu de données figé sans pouvoir interagir en temps réel avec l'environnement. Les auteurs testent DiSA-IQL sur des tâches d'atteinte d'objectif, en distribution et hors distribution, uniquement en simulation, et rapportent des taux de réussite supérieurs, des trajectoires plus lisses et une robustesse accrue par rapport à trois références : le clonage comportemental (BC), Conservative Q-Learning (CQL) et l'IQL standard. L'enjeu dépasse le seul cas des robots serpents. L'apprentissage en ligne sur du matériel réel est coûteux et risqué pour des structures souples fragiles, ce qui pousse la recherche vers des méthodes hors ligne capables d'exploiter des jeux de données pré-collectés sans dégrader leurs performances face à des situations inédites. Si les résultats se confirment au-delà de la simulation, ils renforceraient la viabilité de pipelines d'apprentissage hors ligne pour des classes de robots à dynamique difficile à modéliser, un enjeu direct pour les intégrateurs qui cherchent à déployer des systèmes souples sans multiplier les essais physiques coûteux. Le travail s'inscrit dans la lignée directe d'IQL et de CQL, deux méthodes de référence en RL hors ligne conservateur, que les auteurs utilisent comme bases de comparaison plutôt que comme simples antécédents théoriques. Il reste à ce stade purement académique et simulé : aucune validation sur robot physique n'est rapportée, et l'article ne mentionne ni partenaire industriel ni calendrier de transfert vers du matériel réel.

RecherchePaper
1 source