Aller au contenu principal
E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles
RecherchearXiv cs.RO 

E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent E2HiL, un framework d'apprentissage par renforcement en boucle humaine (human-in-the-loop RL) destiné à réduire le nombre d'interventions manuelles nécessaires pour entraîner des politiques de manipulation robotique en conditions réelles. Publié sur arXiv (2601.19969v2), le système a été évalué sur 10 tâches de manipulation réelle, couvrant plusieurs types de robots et plusieurs frameworks d'apprentissage. Comparé aux meilleures références HiL-RL existantes, E2HiL améliore le taux de réussite de 24,9% tout en réduisant de 9,3% les interventions humaines requises. Techniquement, la méthode calcule des fonctions d'influence mesurant l'effet de chaque échantillon sur l'entropie de la politique, via la covariance entre probabilités d'action et avantages softs, puis ne conserve que les échantillons à influence modérée, écartant les raccourcis provoquant une chute d'entropie brutale et le bruit sans effet mesurable. Les détails du projet sont disponibles sur e2hil.github.io.

L'approche cible un goulot d'étranglement bien identifié du RL réel appliqué à la manipulation: la supervision humaine nécessaire pour guider l'exploration reste coûteuse en main d'oeuvre, ce qui freine le passage à l'échelle hors simulation. En sélectionnant activement les échantillons les plus informatifs plutôt qu'en traitant chaque intervention de façon uniforme, E2HiL améliore simultanément performance et coût de supervision, un compromis rarement obtenu dans la littérature HiL-RL. Présenté comme agnostique à la politique et à l'embodiment, le module est réutilisable avec différents robots et algorithmes d'apprentissage sans reconception spécifique, ce qui intéresse les équipes cherchant à industrialiser le RL réel plutôt que de rester dépendantes du fine-tuning de modèles vision-langage-action entraînés hors ligne. Les gains chiffrés restent toutefois mesurés par les auteurs face à leurs propres baselines, sans validation indépendante à ce stade.

Le framework s'inscrit dans la lignée des méthodes de RL en boucle humaine apparues pour accélérer l'apprentissage en conditions réelles, en alternative aux approches purement imitatives ou aux grands modèles vision-langage-action entraînés hors ligne puis affinés. La mention "replace" associée à la version 2 de l'article indique une mise à jour d'une publication antérieure; le résumé fourni ne précise ni laboratoire ni affiliation institutionnelle des auteurs. Aucun partenariat industriel, pilote annoncé ou calendrier de déploiement n'est mentionné: il s'agit à ce stade d'une contribution de recherche méthodologique, conçue comme un module plug-and-play destiné à s'intégrer dans des pipelines HiL-RL existants plutôt que d'un produit ou d'un système robotique complet.

À lire aussi

Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons
1arXiv cs.RO 

Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons

Res-HIL, un framework de reinforcement learning résiduel guidé par l'humain pour la manipulation robotique dextre, a été publié sur arXiv le 25 septembre 2026 sous la référence 2609.30023. La méthode combine une politique d'imitation pré-entraînée et gelée avec une politique résiduelle corrective, entraînée à partir d'interventions humaines en temps réel : chaque intervention fournit à la fois une supervision directe de la politique résiduelle et un signal de récompense pour le comportement autonome qui l'a précédée. La politique résiduelle démarre à zéro pour stabiliser l'apprentissage en ligne. Testée sur cinq tâches de manipulation à fort contact, mêlant haute précision et longs horizons temporels, Res-HIL surpasse, avec seulement 20 démonstrations initiales et dix minutes d'entraînement en ligne, les méthodes de référence de RL human-in-the-loop à politique complète et de fine-tuning résiduel sans guidage humain. Elle dépasse également des politiques d'imitation pure entraînées avec cinq fois plus de démonstrations. Le résultat cible le principal goulot d'étranglement du déploiement de manipulateurs dextres : le coût de collecte de démonstrations humaines, qui ne garantit pas la généralisation une fois la politique déployée hors distribution. En montrant qu'une correction résiduelle guidée par l'humain, appliquée seulement dix minutes, peut égaler des politiques entraînées sur cinq fois plus de données, Res-HIL suggère que l'effort humain est mieux investi dans la correction ciblée d'une politique existante que dans la multiplication des démonstrations complètes, une remise en cause pratique de l'hypothèse dominante en apprentissage par imitation selon laquelle la qualité dépend avant tout du volume de données. Pour les intégrateurs évaluant des tâches à fort contact comme l'assemblage ou l'insertion, cela ouvre une voie d'amélioration post-déploiement moins coûteuse qu'un ré-entraînement complet. L'approche s'inscrit entre deux courants existants : l'apprentissage par imitation, dont les politiques échouent typiquement hors de la distribution des démonstrations d'entraînement, et le RL human-in-the-loop, qui exploite des corrections en ligne mais réapprend généralement une politique complète plutôt que d'affiner un modèle déjà entraîné. Res-HIL se positionne explicitement contre ces deux références, qu'il surpasse systématiquement dans l'étude comparative. Une analyse d'ablation montre que la supervision directe de la politique résiduelle est le facteur critique de performance, tandis que le façonnage de récompense sensible aux interventions améliore surtout l'efficacité de l'entraînement. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche méthodologique dont la validation sur des plateformes robotiques réelles, au-delà des cinq tâches testées, reste l'étape suivante.

RecherchePaper
1 source
ReF-HIL : structurer le critique autour des voisinages d'actions humaines pour un apprentissage par renforcement avec humain dans la boucle plus efficace
2arXiv cs.RO 

ReF-HIL : structurer le critique autour des voisinages d'actions humaines pour un apprentissage par renforcement avec humain dans la boucle plus efficace

Des chercheurs proposent ReF-HIL, un cadre d'apprentissage par renforcement avec humain dans la boucle (HIL-RL) destiné à entraîner des politiques de manipulation robotique directement dans le monde réel. Le principe est de combiner l'apprentissage autonome avec des démonstrations humaines et des corrections en ligne. Deux mécanismes sont introduits. Le premier, un « Human-Reference-Guided Value Shaping », apprend une référence de valeur indépendante à partir des seules expériences humaines réussies, pour guider l'apprentissage de la valeur en ligne, tout en intégrant des retours correctifs locaux. Le second, une « Human Action Fence », définit un voisinage d'actions humaines appris. À l'intérieur, l'optimisation guidée par la valeur s'applique sans pénalité d'imitation. À l'extérieur, les mises à jour de la politique et de la valeur sont contraintes. Testé sur cinq tâches de manipulation réelles, ReF-HIL atteint 90 % de succès autonome après 18 à 63 minutes d'entraînement actif, pour des taux de succès finaux de 91,7 à 100 %. Il s'agit d'une prépublication arXiv, sans relecture par les pairs. Le site du projet est anonymisé. Pour les intégrateurs, l'intérêt est le temps d'entraînement sur robot physique, qui reste le principal coût de l'apprentissage par renforcement réel. Une politique fiable en moins d'une heure de temps actif rapproche cette approche de la mise en service industrielle, là où l'imitation pure plafonne souvent sur les cas limites. Deux réserves s'imposent. Les résultats sont comparés à des références choisies par les auteurs (« the evaluated baselines »). Le résumé ne précise ni les tâches, ni le robot, ni le nombre d'essais, et l'écart entre 18 et 63 minutes reste large. Il s'agit d'une démonstration de laboratoire, pas d'un déploiement. Le HIL-RL s'est imposé ces dernières années comme alternative aux grands modèles vision-langage-action (VLA) entraînés par imitation à grande échelle, comme Pi-0. Il vise des tâches précises, avec peu de données et une correction humaine ciblée. Ses deux limites, que ReF-HIL cherche à lever, sont la sous-exploitation des succès humains dans l'estimation de la valeur et les pénalités d'imitation qui brident l'amélioration de la politique. La suite dépendra de la publication du code, d'une validation sur des tâches industrielles plus longues et d'une comparaison directe avec les méthodes de référence du domaine.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles
3arXiv cs.RO 

UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles

UniIntervene++ est un agent d'intervention adaptatif pour l'apprentissage par renforcement (RL) en ligne sur robot réel, décrit dans un preprint arXiv publié en octobre 2026, avec code sur GitHub. Il décide, pendant l'entraînement, de qui contrôle le robot : la politique RL en cours d'apprentissage, une correction de trajectoire, ou une CodePolicy, c'est-à-dire un comportement structuré par la tâche et écrit sous forme de code. Ces trois comportements sont modélisés comme des « options » dans un processus de décision semi-markovien, dont l'agent apprend les valeurs relatives en ligne. Il sonde aussi régulièrement la politique RL en la laissant s'exécuter sans assistance, pour mesurer sa compétence réelle. Sur cinq tâches de manipulation réelles, le taux de succès moyen atteint 89,67 %, soit au moins 6 points de plus que tous les baselines. L'intervention humaine tombe à 0,77 % des pas, une réduction relative d'au moins 94,6 % face au meilleur baseline. Cela implique que celui-ci en demandait environ 14 % ou plus. L'enjeu est le coût du RL en conditions réelles, aujourd'hui dominé par le temps opérateur. Les stratégies existantes reposent sur des estimations hors ligne ou des règles fixes, qui deviennent inadaptées à mesure que la politique progresse. Passer sous 1 % d'intervention, si cela se confirme, rendrait l'amélioration d'une politique sur site beaucoup moins coûteuse pour un intégrateur. Les résultats viennent toutefois d'une seule équipe, sur cinq tâches que l'abstract ne détaille pas. Les baselines ne sont pas nommés non plus, et rien n'indique la robustesse hors de ces tâches ni le coût d'écriture des CodePolicies, qui demandent une connaissance experte de la tâche. Ce travail prolonge les approches de RL avec humain dans la boucle, où l'opérateur reprend la main pour corriger le robot, dont HIL-SERL est l'exemple le plus connu. Ces méthodes laissent l'opérateur décider seul du moment et de la manière d'intervenir, et leur charge reste élevée. UniIntervene++ remplace cette décision par un agent qui apprend quand intervenir, comment, et quand rendre le contrôle. L'expérience gagnée sous assistance sert aussi à améliorer la politique RL, dont les résultats modifient ensuite les décisions d'intervention. Il s'agit d'une recherche académique : aucun déploiement industriel ni calendrier n'est annoncé. La prochaine étape sera de voir si d'autres laboratoires reproduisent les résultats grâce au code publié, notamment sur des tâches plus longues ou des robots différents.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Guidage par imitation dans l'espace des tâches pour un apprentissage par renforcement efficace
4arXiv cs.RO 

Guidage par imitation dans l'espace des tâches pour un apprentissage par renforcement efficace

TIGER (Task-Space Imitation Guidance for Efficient Reinforcement Learning) est un cadre de construction de récompense et de préentraînement pour la manipulation robotique sur table avec récompense éparse, publié sur arXiv en octobre 2026 (2610.07527). Son idée centrale est de ne pas utiliser la politique d'imitation, qui prédit des séquences d'actions (action chunks), comme contrôleur ni comme prior d'actions. Elle sert d'estimateur local de progression dans l'espace de la tâche. Les chunks prédits sont convertis, via une correspondance action-mouvement qui tient compte du contrôleur, en références d'effecteur final à court horizon. L'agent RL reçoit alors des récompenses denses de progression vers ces références, tandis que la récompense éparse de l'environnement reste l'objectif dominant. Pendant le préentraînement, des signaux d'anticipation issus de l'imitation assouplissent les pénalités de valeur conservatrices pour les actions censées faire progresser la tâche. Cela limite l'exploration hors de la distribution des données au début de l'apprentissage en ligne. Les auteurs annoncent, en simulation et sur robot réel, une meilleure efficacité d'échantillonnage initiale et moins de violations de sécurité mesurées, avec un taux de succès final égal ou supérieur aux baselines RL et IL-RL. L'intérêt tient au point faible de l'apprentissage par renforcement sur robot physique : le coût en interactions et le risque de casse pendant l'exploration. Comme la politique d'imitation n'est jamais exécutée, ses erreurs ne plafonnent pas la performance finale. Elle ne fait que guider la récompense, ce qui limite le risque d'enfermer l'agent dans les défauts des démonstrations. Pour un intégrateur, une phase d'adaptation en ligne plus courte et plus sûre se traduit directement en temps de mise en service. Il faut toutefois relativiser. Le résumé ne donne aucun chiffre (gain d'échantillons, taux de succès, nombre de violations), ne nomme ni robot ni tâches, et se limite à des scénarios sur table. On ne peut donc pas juger l'ampleur du gain ni sa portée au-delà de ces tâches. Ce travail s'inscrit dans le courant qui cherche à combiner imitation et RL. Les modèles VLA entraînés par imitation, comme Pi-0, plafonnent en précision et en robustesse, et le RL en ligne reste la voie principale pour dépasser ce plafond. Les approches concurrentes incluent le RL résiduel, l'ajustement fin de politiques de diffusion et les méthodes hors ligne vers en ligne à pénalités conservatrices. TIGER vise surtout la phase de transition de ces dernières. Les prochaines étapes naturelles seraient des horizons plus longs, la manipulation mobile et des tâches à contacts riches, mais le résumé n'annonce ni code ni calendrier.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source