Aller au contenu principal
RecherchearXiv cs.RO 

Guidage par imitation dans l'espace des tâches pour un apprentissage par renforcement efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

TIGER (Task-Space Imitation Guidance for Efficient Reinforcement Learning) est un cadre de construction de récompense et de préentraînement pour la manipulation robotique sur table avec récompense éparse, publié sur arXiv en octobre 2026 (2610.07527). Son idée centrale est de ne pas utiliser la politique d'imitation, qui prédit des séquences d'actions (action chunks), comme contrôleur ni comme prior d'actions. Elle sert d'estimateur local de progression dans l'espace de la tâche. Les chunks prédits sont convertis, via une correspondance action-mouvement qui tient compte du contrôleur, en références d'effecteur final à court horizon. L'agent RL reçoit alors des récompenses denses de progression vers ces références, tandis que la récompense éparse de l'environnement reste l'objectif dominant. Pendant le préentraînement, des signaux d'anticipation issus de l'imitation assouplissent les pénalités de valeur conservatrices pour les actions censées faire progresser la tâche. Cela limite l'exploration hors de la distribution des données au début de l'apprentissage en ligne. Les auteurs annoncent, en simulation et sur robot réel, une meilleure efficacité d'échantillonnage initiale et moins de violations de sécurité mesurées, avec un taux de succès final égal ou supérieur aux baselines RL et IL-RL.

L'intérêt tient au point faible de l'apprentissage par renforcement sur robot physique : le coût en interactions et le risque de casse pendant l'exploration. Comme la politique d'imitation n'est jamais exécutée, ses erreurs ne plafonnent pas la performance finale. Elle ne fait que guider la récompense, ce qui limite le risque d'enfermer l'agent dans les défauts des démonstrations. Pour un intégrateur, une phase d'adaptation en ligne plus courte et plus sûre se traduit directement en temps de mise en service. Il faut toutefois relativiser. Le résumé ne donne aucun chiffre (gain d'échantillons, taux de succès, nombre de violations), ne nomme ni robot ni tâches, et se limite à des scénarios sur table. On ne peut donc pas juger l'ampleur du gain ni sa portée au-delà de ces tâches.

Ce travail s'inscrit dans le courant qui cherche à combiner imitation et RL. Les modèles VLA entraînés par imitation, comme Pi-0, plafonnent en précision et en robustesse, et le RL en ligne reste la voie principale pour dépasser ce plafond. Les approches concurrentes incluent le RL résiduel, l'ajustement fin de politiques de diffusion et les méthodes hors ligne vers en ligne à pénalités conservatrices. TIGER vise surtout la phase de transition de ces dernières. Les prochaines étapes naturelles seraient des horizons plus longs, la manipulation mobile et des tâches à contacts riches, mais le résumé n'annonce ni code ni calendrier.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Directives d'exploration efficace dans l'apprentissage par renforcement sûr
1arXiv cs.RO 

Directives d'exploration efficace dans l'apprentissage par renforcement sûr

Ce papier de recherche, publié sur arXiv le 15 juillet 2026, présente ATACOM Directional Constraints (ATACOM-DC), une extension du framework ATACOM (safety layer) destinée à l'apprentissage par renforcement sûr pour la robotique. Le problème de départ est connu du secteur : en simulation, le RL permet d'apprendre des comportements robotiques complexes, mais un déploiement réel en environnement ouvert exige des garanties de sécurité fortes pour éviter tout geste dangereux. Les méthodes de Safe RL existantes imposent des contraintes de sécurité issues de la connaissance du système ou apprises depuis les données, mais cette contrainte ralentit généralement l'apprentissage et dégrade les performances de la tâche, l'agent devant résoudre un problème d'optimisation contraint plus complexe qu'en configuration non contrainte. L'innovation proposée introduit des contraintes directionnelles qui distinguent les actions s'approchant d'une frontière de sécurité de celles qui s'en éloignent, n'activant l'enforcement de la contrainte que lorsque c'est réellement nécessaire. Les auteurs évaluent leur méthode sur plusieurs tâches de contrôle robotique complexes en simulation, en mesurant à la fois le coût de violation des contraintes et les performances de tâche obtenues. Code et matériel supplémentaire disponibles sur atacom-dc.robot-learning.net. Pour l'industrie robotique, l'enjeu dépasse la seule performance académique : le compromis sécurité/performance est justement ce qui bloque aujourd'hui le passage de nombreux systèmes RL de la simulation au déploiement réel, notamment pour des bras manipulateurs ou des robots mobiles opérant en environnement humain. Une méthode qui réduit ce compromis sans sacrifier les garanties de sécurité intéresse directement les intégrateurs et les équipes R&D qui cherchent à industrialiser des politiques apprises plutôt que programmées à la main. Cela dit, il s'agit ici de résultats en simulation uniquement, sur un ensemble de tâches de contrôle choisies par les auteurs, sans validation sur robot physique ni déploiement industriel : le gap sim-to-real reste entier, et la portée réelle du gain de performance annoncé demande à être confirmée hors laboratoire. ATACOM-DC s'inscrit dans la lignée d'ATACOM, une safety layer déjà reconnue comme référence pour intégrer des contraintes de sécurité à des algorithmes de RL existants sans les reconcevoir entièrement. Le positionnement se fait ainsi moins face à des concurrents commerciaux que face aux autres approches académiques de Safe RL, généralement critiquées pour leur coût en vitesse d'apprentissage. Aucun acteur français ou européen n'est associé à ces travaux. Les auteurs annoncent la mise à disposition du code et de matériel complémentaire en ligne, ce qui ouvre la voie à une reproduction et une extension par d'autres équipes de recherche en robotique et RL sûr, sans toutefois qu'un calendrier de tests sur systèmes réels ne soit mentionné à ce stade.

RecherchePaper
1 source
Alignement des représentations maître-élève pour l'apprentissage par imitation guidé par renforcement
2arXiv cs.RO 

Alignement des représentations maître-élève pour l'apprentissage par imitation guidé par renforcement

Des chercheurs ont publié sur arXiv (2605.28372) un algorithme visant à réduire structurellement l'imitation gap dans les pipelines d'apprentissage par imitation (IL) guidés par reinforcement learning (RL). Ce fossé apparaît lorsqu'un agent teacher, entraîné par RL avec un accès complet à l'état interne de l'environnement (positions exactes, dynamiques simulées complètes), développe une politique qui exploite des informations d'état privilégiées inaccessibles à l'agent student, contraint lui à des observations partielles comme des flux caméra ou des capteurs bruités. La solution proposée construit un espace d'embedding partagé via apprentissage contrastif auto-supervisé (self-supervised contrastive learning), entraîné en parallèle à la politique teacher. Un mécanisme de blocage des gradients empêche l'encodeur de l'agent enseignant d'exploiter ses données privées, rendant la politique teacher imitable par construction et évitant le fine-tuning RL post-imitation habituellement requis. Pour la robotique industrielle, l'enjeu est concret : le pipeline sim-to-real souffre précisément de ce décalage entre un teacher simulé omniscient et un robot réel contraint à ses capteurs physiques. Forcer un fine-tuning RL sur le hardware après la phase d'imitation représente un coût significatif en calcul, en temps machine et en ingénierie. L'approche proposée vise à supprimer cette étape en alignant les représentations à la source. Les évaluations sur plusieurs benchmarks montrent une performance student supérieure aux baselines état-de-l'art avec un imitation gap substantiellement réduit. Ces résultats restent cependant produits exclusivement en simulation, ce qui en limite la portée directe pour des déploiements industriels immédiats. L'approche teacher-student en RL est un paradigme établi depuis DAgger (Ross et al., 2011) et les travaux d'Asymmetric Actor-Critic, où l'imitation gap était traditionnellement corrigé en aval par du fine-tuning plutôt qu'en amont par un alignement des représentations. La tendance actuelle aux architectures Visual Language Action (VLA), comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, aborde ce problème différemment via des modèles de fondation multimodaux qui absorbent directement des observations hétérogènes. Ce preprint, sans affiliation industrielle identifiée ni validation sur hardware réel déclarée, propose une correction structurelle au paradigme classique et ouvre la voie à une validation sur manipulateurs physiques comme prochaine étape naturelle.

RecherchePaper
1 source
UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles
3arXiv cs.RO 

UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles

UniIntervene++ est un agent d'intervention adaptatif pour l'apprentissage par renforcement (RL) en ligne sur robot réel, décrit dans un preprint arXiv publié en octobre 2026, avec code sur GitHub. Il décide, pendant l'entraînement, de qui contrôle le robot : la politique RL en cours d'apprentissage, une correction de trajectoire, ou une CodePolicy, c'est-à-dire un comportement structuré par la tâche et écrit sous forme de code. Ces trois comportements sont modélisés comme des « options » dans un processus de décision semi-markovien, dont l'agent apprend les valeurs relatives en ligne. Il sonde aussi régulièrement la politique RL en la laissant s'exécuter sans assistance, pour mesurer sa compétence réelle. Sur cinq tâches de manipulation réelles, le taux de succès moyen atteint 89,67 %, soit au moins 6 points de plus que tous les baselines. L'intervention humaine tombe à 0,77 % des pas, une réduction relative d'au moins 94,6 % face au meilleur baseline. Cela implique que celui-ci en demandait environ 14 % ou plus. L'enjeu est le coût du RL en conditions réelles, aujourd'hui dominé par le temps opérateur. Les stratégies existantes reposent sur des estimations hors ligne ou des règles fixes, qui deviennent inadaptées à mesure que la politique progresse. Passer sous 1 % d'intervention, si cela se confirme, rendrait l'amélioration d'une politique sur site beaucoup moins coûteuse pour un intégrateur. Les résultats viennent toutefois d'une seule équipe, sur cinq tâches que l'abstract ne détaille pas. Les baselines ne sont pas nommés non plus, et rien n'indique la robustesse hors de ces tâches ni le coût d'écriture des CodePolicies, qui demandent une connaissance experte de la tâche. Ce travail prolonge les approches de RL avec humain dans la boucle, où l'opérateur reprend la main pour corriger le robot, dont HIL-SERL est l'exemple le plus connu. Ces méthodes laissent l'opérateur décider seul du moment et de la manière d'intervenir, et leur charge reste élevée. UniIntervene++ remplace cette décision par un agent qui apprend quand intervenir, comment, et quand rendre le contrôle. L'expérience gagnée sous assistance sert aussi à améliorer la politique RL, dont les résultats modifient ensuite les décisions d'intervention. Il s'agit d'une recherche académique : aucun déploiement industriel ni calendrier n'est annoncé. La prochaine étape sera de voir si d'autres laboratoires reproduisent les résultats grâce au code publié, notamment sur des tâches plus longues ou des robots différents.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
eRLT : apprentissage par renforcement efficace pour les VLA grâce au routage des tokens pertinents pour l'action
4arXiv cs.RO 

eRLT : apprentissage par renforcement efficace pour les VLA grâce au routage des tokens pertinents pour l'action

Des chercheurs proposent eRLT, une méthode qui adapte par apprentissage par renforcement (RL) en ligne un modèle Vision-Langage-Action (VLA) dont les poids restent gelés. Le point de départ est l'efficacité en échantillons : elle dépend de la qualité de la représentation d'état fournie à l'acteur et au critique. Les approches existantes utilisent soit des encodeurs visuels indépendants du VLA, soit une compression fixe de ses représentations internes. eRLT construit cette représentation en acheminant l'information utile à l'action à travers les tokens et les couches du VLA. Des « tokens de routage » appris agrègent les caractéristiques visuo-linguistiques à plusieurs profondeurs. Un routeur de couches léger fusionne ensuite ces résumés en un unique « token RL » de dimension fixe. Le module est d'abord initialisé sur des démonstrations expertes, pour capter les caractéristiques qui prédisent les actions de l'expert. Il est ensuite affiné avec le retour du critique pendant les interactions en ligne, afin d'améliorer l'estimation de la valeur des actions. Sur sept tâches des benchmarks LIBERO et RoboTwin, la méthode améliore l'aire sous la courbe d'apprentissage normalisée (AUC) moyenne jusqu'à 23,7 % par rapport aux références représentatives. Sur robot réel, l'insertion d'un connecteur USB et celle d'un câble ruban de carte mère progressent respectivement de 108,9 % et 46,7 % d'AUC face à la meilleure référence. L'enjeu tient à la dernière étape du déploiement des VLA. Ces modèles fournissent de bons a priori comportementaux, mais les adapter à une tâche de précision reste coûteux en essais physiques. Les deux tâches réelles retenues, des insertions de connecteurs et de nappes, relèvent de l'assemblage électronique, où la tolérance est faible et où les démonstrations seules suffisent rarement. Si l'idée se confirme, elle réduirait le temps de mise au point sur site, un coût que supportent les intégrateurs. Elle suggère aussi que le goulot d'étranglement n'est pas toujours le modèle de base, mais la façon d'en extraire un état exploitable pour le RL. Il faut toutefois relativiser. Les gains sont exprimés en AUC relative, une mesure de vitesse d'apprentissage, et non en taux de réussite final, en temps de cycle ou en fiabilité sur de longues séries. Les résultats réels portent sur deux tâches, sans volumes ni durées d'essai communiqués dans ce résumé. Ce travail s'inscrit dans le courant de l'adaptation par RL de VLA gelés, qui cherche à dépasser le simple clonage de comportement. Il se positionne contre deux familles de référence : les encodeurs visuels séparés du VLA et la compression fixe de ses représentations. LIBERO et RoboTwin sont des benchmarks de simulation très utilisés, ce qui facilite la comparaison mais n'équivaut pas à un déploiement industriel. Il s'agit d'une prépublication arXiv (v1), sans pilote ni calendrier annoncés. Les prochaines étapes à surveiller sont une validation sur davantage de tâches et de plateformes, ainsi qu'une mesure du coût de calcul réel et de la robustesse face aux variations de conditions, des critères décisifs pour une adoption en atelier.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source