Aller au contenu principal
RecherchearXiv cs.RO 

ReF-HIL : structurer le critique autour des voisinages d'actions humaines pour un apprentissage par renforcement avec humain dans la boucle plus efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ReF-HIL, un cadre d'apprentissage par renforcement avec humain dans la boucle (HIL-RL) destiné à entraîner des politiques de manipulation robotique directement dans le monde réel. Le principe est de combiner l'apprentissage autonome avec des démonstrations humaines et des corrections en ligne. Deux mécanismes sont introduits. Le premier, un « Human-Reference-Guided Value Shaping », apprend une référence de valeur indépendante à partir des seules expériences humaines réussies, pour guider l'apprentissage de la valeur en ligne, tout en intégrant des retours correctifs locaux. Le second, une « Human Action Fence », définit un voisinage d'actions humaines appris. À l'intérieur, l'optimisation guidée par la valeur s'applique sans pénalité d'imitation. À l'extérieur, les mises à jour de la politique et de la valeur sont contraintes. Testé sur cinq tâches de manipulation réelles, ReF-HIL atteint 90 % de succès autonome après 18 à 63 minutes d'entraînement actif, pour des taux de succès finaux de 91,7 à 100 %. Il s'agit d'une prépublication arXiv, sans relecture par les pairs. Le site du projet est anonymisé.

Pour les intégrateurs, l'intérêt est le temps d'entraînement sur robot physique, qui reste le principal coût de l'apprentissage par renforcement réel. Une politique fiable en moins d'une heure de temps actif rapproche cette approche de la mise en service industrielle, là où l'imitation pure plafonne souvent sur les cas limites. Deux réserves s'imposent. Les résultats sont comparés à des références choisies par les auteurs (« the evaluated baselines »). Le résumé ne précise ni les tâches, ni le robot, ni le nombre d'essais, et l'écart entre 18 et 63 minutes reste large. Il s'agit d'une démonstration de laboratoire, pas d'un déploiement.

Le HIL-RL s'est imposé ces dernières années comme alternative aux grands modèles vision-langage-action (VLA) entraînés par imitation à grande échelle, comme Pi-0. Il vise des tâches précises, avec peu de données et une correction humaine ciblée. Ses deux limites, que ReF-HIL cherche à lever, sont la sous-exploitation des succès humains dans l'estimation de la valeur et les pénalités d'imitation qui brident l'amélioration de la politique. La suite dépendra de la publication du code, d'une validation sur des tâches industrielles plus longues et d'une comparaison directe avec les méthodes de référence du domaine.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles
1arXiv cs.RO 

E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles

Des chercheurs présentent E2HiL, un framework d'apprentissage par renforcement en boucle humaine (human-in-the-loop RL) destiné à réduire le nombre d'interventions manuelles nécessaires pour entraîner des politiques de manipulation robotique en conditions réelles. Publié sur arXiv (2601.19969v2), le système a été évalué sur 10 tâches de manipulation réelle, couvrant plusieurs types de robots et plusieurs frameworks d'apprentissage. Comparé aux meilleures références HiL-RL existantes, E2HiL améliore le taux de réussite de 24,9% tout en réduisant de 9,3% les interventions humaines requises. Techniquement, la méthode calcule des fonctions d'influence mesurant l'effet de chaque échantillon sur l'entropie de la politique, via la covariance entre probabilités d'action et avantages softs, puis ne conserve que les échantillons à influence modérée, écartant les raccourcis provoquant une chute d'entropie brutale et le bruit sans effet mesurable. Les détails du projet sont disponibles sur e2hil.github.io. L'approche cible un goulot d'étranglement bien identifié du RL réel appliqué à la manipulation: la supervision humaine nécessaire pour guider l'exploration reste coûteuse en main d'oeuvre, ce qui freine le passage à l'échelle hors simulation. En sélectionnant activement les échantillons les plus informatifs plutôt qu'en traitant chaque intervention de façon uniforme, E2HiL améliore simultanément performance et coût de supervision, un compromis rarement obtenu dans la littérature HiL-RL. Présenté comme agnostique à la politique et à l'embodiment, le module est réutilisable avec différents robots et algorithmes d'apprentissage sans reconception spécifique, ce qui intéresse les équipes cherchant à industrialiser le RL réel plutôt que de rester dépendantes du fine-tuning de modèles vision-langage-action entraînés hors ligne. Les gains chiffrés restent toutefois mesurés par les auteurs face à leurs propres baselines, sans validation indépendante à ce stade. Le framework s'inscrit dans la lignée des méthodes de RL en boucle humaine apparues pour accélérer l'apprentissage en conditions réelles, en alternative aux approches purement imitatives ou aux grands modèles vision-langage-action entraînés hors ligne puis affinés. La mention "replace" associée à la version 2 de l'article indique une mise à jour d'une publication antérieure; le résumé fourni ne précise ni laboratoire ni affiliation institutionnelle des auteurs. Aucun partenariat industriel, pilote annoncé ou calendrier de déploiement n'est mentionné: il s'agit à ce stade d'une contribution de recherche méthodologique, conçue comme un module plug-and-play destiné à s'intégrer dans des pipelines HiL-RL existants plutôt que d'un produit ou d'un système robotique complet.

RecherchePaper
1 source
Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons
2arXiv cs.RO 

Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons

Res-HIL, un framework de reinforcement learning résiduel guidé par l'humain pour la manipulation robotique dextre, a été publié sur arXiv le 25 septembre 2026 sous la référence 2609.30023. La méthode combine une politique d'imitation pré-entraînée et gelée avec une politique résiduelle corrective, entraînée à partir d'interventions humaines en temps réel : chaque intervention fournit à la fois une supervision directe de la politique résiduelle et un signal de récompense pour le comportement autonome qui l'a précédée. La politique résiduelle démarre à zéro pour stabiliser l'apprentissage en ligne. Testée sur cinq tâches de manipulation à fort contact, mêlant haute précision et longs horizons temporels, Res-HIL surpasse, avec seulement 20 démonstrations initiales et dix minutes d'entraînement en ligne, les méthodes de référence de RL human-in-the-loop à politique complète et de fine-tuning résiduel sans guidage humain. Elle dépasse également des politiques d'imitation pure entraînées avec cinq fois plus de démonstrations. Le résultat cible le principal goulot d'étranglement du déploiement de manipulateurs dextres : le coût de collecte de démonstrations humaines, qui ne garantit pas la généralisation une fois la politique déployée hors distribution. En montrant qu'une correction résiduelle guidée par l'humain, appliquée seulement dix minutes, peut égaler des politiques entraînées sur cinq fois plus de données, Res-HIL suggère que l'effort humain est mieux investi dans la correction ciblée d'une politique existante que dans la multiplication des démonstrations complètes, une remise en cause pratique de l'hypothèse dominante en apprentissage par imitation selon laquelle la qualité dépend avant tout du volume de données. Pour les intégrateurs évaluant des tâches à fort contact comme l'assemblage ou l'insertion, cela ouvre une voie d'amélioration post-déploiement moins coûteuse qu'un ré-entraînement complet. L'approche s'inscrit entre deux courants existants : l'apprentissage par imitation, dont les politiques échouent typiquement hors de la distribution des démonstrations d'entraînement, et le RL human-in-the-loop, qui exploite des corrections en ligne mais réapprend généralement une politique complète plutôt que d'affiner un modèle déjà entraîné. Res-HIL se positionne explicitement contre ces deux références, qu'il surpasse systématiquement dans l'étude comparative. Une analyse d'ablation montre que la supervision directe de la politique résiduelle est le facteur critique de performance, tandis que le façonnage de récompense sensible aux interventions améliore surtout l'efficacité de l'entraînement. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche méthodologique dont la validation sur des plateformes robotiques réelles, au-delà des cinq tâches testées, reste l'étape suivante.

RecherchePaper
1 source
EvoHIL : optimisation évolutive de la récompense et de la politique par flow matching pour l'apprentissage par renforcement robuste avec humain dans la boucle
3arXiv cs.RO 

EvoHIL : optimisation évolutive de la récompense et de la politique par flow matching pour l'apprentissage par renforcement robuste avec humain dans la boucle

Une équipe de recherche vient de publier sur arXiv (2608.03872, début août 2026) EvoHIL, un framework d'apprentissage par renforcement avec humain dans la boucle (HIL-RL) pour la manipulation robotique riche en contacts. Le système combine trois mécanismes : une récompense auto-évolutive (SER) qui met à jour le classificateur de succès à partir d'exemples positifs validés par un humain et de négatifs faibles provisoires ; une stabilisation de flux d'actions (AFS), qui génère des séquences temporellement cohérentes via flow matching en s'appuyant sur les préfixes d'actions déjà exécutés et les démonstrations ; et un fine-tuning hors ligne dit « rétention-aware », qui rejoue des données d'interaction rééclairées tout en ancrant l'acteur-critique AFS au comportement antérieur, sans interaction robotique supplémentaire. Les auteurs ont testé EvoHIL sur six tâches de manipulation, sur des bras Franka FR3 et SO-101, sous un changement contrôlé d'éclairage. Comparé aux méthodes HIL-RL classiques et à l'imitation learning, EvoHIL améliore le taux de réussite, l'accord avec les labels de confirmation humaine, la fluidité du mouvement et le temps de complétion. L'intérêt tient à la façon dont le papier attaque trois faiblesses couplées qui plombent le HIL-RL en conditions réelles : un modèle de récompense visuel statique qui s'effondre dès que la scène change, des actions échantillonnées indépendamment qui produisent des mouvements saccadés, et des politiques vision-based fragiles face aux changements d'apparence. C'est exactement ce type de fragilité qui sépare les démonstrations de labo des déploiements industriels, où l'éclairage, le fond ou la position des objets varient en permanence. En montrant qu'un reward model, un générateur d'actions et un domaine visuel peuvent être adaptés conjointement plutôt que séparément, EvoHIL nourrit le débat sur la viabilité des politiques VLA à l'échelle, une question centrale pour tout intégrateur cherchant à sortir un bras collaboratif ou un humanoïde des conditions contrôlées d'une démo. Le travail s'inscrit dans la lignée des recherches récentes sur le flow matching appliqué aux politiques robotiques, une approche popularisée par des modèles comme Pi-0 ou GR00T N2 pour produire des trajectoires plus fluides que les méthodes de diffusion classiques. Il s'agit toutefois d'un article académique soumis en double-aveugle, avec une page projet hébergée sous un identifiant anonyme et sans affiliation d'entreprise ni de laboratoire revendiquée à ce stade, ni déploiement industriel annoncé. Les essais se limitent à deux plateformes de bras manipulateurs en environnement contrôlé, loin des volumes d'un déploiement commercial. La suite logique, si les résultats tiennent lors de la publication définitive, serait une extension à davantage de tâches, de plateformes et de variations environnementales pour confirmer la robustesse au-delà du simple changement d'éclairage testé ici.

RecherchePaper
1 source
Exploitation de l'expertise humaine pour l'assemblage robotique de précision dans la construction industrialisée : un cadre d'apprentissage par renforcement interactif avec installateur dans la boucle, économe en échantillons
4arXiv cs.RO 

Exploitation de l'expertise humaine pour l'assemblage robotique de précision dans la construction industrialisée : un cadre d'apprentissage par renforcement interactif avec installateur dans la boucle, économe en échantillons

Une équipe de recherche a publié sur arXiv, en septembre 2026, un cadre d'apprentissage par renforcement interactif pour l'assemblage robotique de fenêtres préfabriquées en construction industrialisée (arXiv:2609.13234). Le système combine démonstrations téléopérées hors ligne, reprises en main binaires de l'installateur aux seuls échecs de contact, et récompenses terminales alignées sur les critères d'acceptation, pilotées par une politique d'action séquentielle fondée sur Q-chunking et Flow Q-Learning. Testé dans le simulateur MuJoCo, de la préhension par ventouse jusqu'au positionnement à jeu serré, le pipeline atteint 100% de pose autonome réussie avec 12 à 15 minutes de supervision humaine cumulée sur 3 heures d'entraînement en ligne, pour un jeu de 2 mm par côté avec pose et frottement randomisés. Le seuil de 95% de réussite est atteint en 0,5 puis 1,5 heure selon les deux configurations testées. Ce résultat cible un verrou classique de la robotique de construction: convertir le savoir-faire tacite d'un installateur en autonomie exploitable malgré un retour d'acceptation rare et une forte variabilité de contact. En ramenant à quelques minutes la supervision nécessaire pour approcher une fiabilité totale sur des tolérances millimétriques, l'étude suggère qu'un apprentissage par renforcement guidé par l'humain reste efficace même à récompense très sparse, un enjeu direct pour les intégrateurs visant l'automatisation d'assemblages jugés jusqu'ici trop précis pour la robotique classique. Une réserve s'impose: tous les résultats proviennent de simulation, sans essai sur robot physique ni déploiement réel rapporté, et le transfert sim-to-réel sur un jeu de 2 mm reste l'inconnue principale avant toute application industrielle. La méthode prolonge les travaux récents sur l'apprentissage hors ligne vers en ligne et sur les politiques d'action segmentées (Q-chunking), associées ici à Flow Q-Learning pour capturer des manœuvres de récupération multimodales en cas d'échec de contact, avec une phase de warm-start pour stabiliser la transition. Elle se distingue des approches tout-autonome ou tout-téléopérées en ne sollicitant l'opérateur qu'aux frontières d'échec de contact. L'article ne cite ni partenaire industriel, ni site de déploiement, ni concurrent nommé, ni calendrier de pilote: il s'agit d'une contribution méthodologique validée par ablations isolant les apports de l'abstraction temporelle, de l'intervention humaine et du calibrage du warm-start, sans feuille de route de production précisée.

RecherchePaper
1 source