Aller au contenu principal
RecherchearXiv cs.RO 

UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

UniIntervene++ est un agent d'intervention adaptatif pour l'apprentissage par renforcement (RL) en ligne sur robot réel, décrit dans un preprint arXiv publié en octobre 2026, avec code sur GitHub. Il décide, pendant l'entraînement, de qui contrôle le robot : la politique RL en cours d'apprentissage, une correction de trajectoire, ou une CodePolicy, c'est-à-dire un comportement structuré par la tâche et écrit sous forme de code. Ces trois comportements sont modélisés comme des « options » dans un processus de décision semi-markovien, dont l'agent apprend les valeurs relatives en ligne. Il sonde aussi régulièrement la politique RL en la laissant s'exécuter sans assistance, pour mesurer sa compétence réelle. Sur cinq tâches de manipulation réelles, le taux de succès moyen atteint 89,67 %, soit au moins 6 points de plus que tous les baselines. L'intervention humaine tombe à 0,77 % des pas, une réduction relative d'au moins 94,6 % face au meilleur baseline. Cela implique que celui-ci en demandait environ 14 % ou plus.

L'enjeu est le coût du RL en conditions réelles, aujourd'hui dominé par le temps opérateur. Les stratégies existantes reposent sur des estimations hors ligne ou des règles fixes, qui deviennent inadaptées à mesure que la politique progresse. Passer sous 1 % d'intervention, si cela se confirme, rendrait l'amélioration d'une politique sur site beaucoup moins coûteuse pour un intégrateur. Les résultats viennent toutefois d'une seule équipe, sur cinq tâches que l'abstract ne détaille pas. Les baselines ne sont pas nommés non plus, et rien n'indique la robustesse hors de ces tâches ni le coût d'écriture des CodePolicies, qui demandent une connaissance experte de la tâche.

Ce travail prolonge les approches de RL avec humain dans la boucle, où l'opérateur reprend la main pour corriger le robot, dont HIL-SERL est l'exemple le plus connu. Ces méthodes laissent l'opérateur décider seul du moment et de la manière d'intervenir, et leur charge reste élevée. UniIntervene++ remplace cette décision par un agent qui apprend quand intervenir, comment, et quand rendre le contrôle. L'expérience gagnée sous assistance sert aussi à améliorer la politique RL, dont les résultats modifient ensuite les décisions d'intervention. Il s'agit d'une recherche académique : aucun déploiement industriel ni calendrier n'est annoncé. La prochaine étape sera de voir si d'autres laboratoires reproduisent les résultats grâce au code publié, notamment sur des tâches plus longues ou des robots différents.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

UniIntervene : intervention à base d'agents pour un apprentissage par renforcement efficace en conditions réelles
1arXiv cs.RO 

UniIntervene : intervention à base d'agents pour un apprentissage par renforcement efficace en conditions réelles

UniIntervene est un modèle d'intervention autonome présenté dans un preprint arXiv (2606.12372, juin 2026) qui cible un goulot d'étranglement concret de l'apprentissage par renforcement en boucle humaine (HiL-RL) pour la manipulation robotique réelle. Le système combine trois composants : un estimateur de valeur d'action conditionné sur le futur, qui prédit les conséquences latentes d'une action et évalue leur valeur avant exécution ; un critique temporel de risque de valeur (temporal value-risk critic), qui agrège la dynamique récente des signaux de valeur et déclenche une intervention dès qu'une stagnation ou dégradation soutenue est détectée ; et une politique de récupération conditionnée sur un objectif, qui extrait une cible de haute valeur depuis une mémoire d'épisodes d'intervention passés et génère des actions correctives exécutables. Sur des tâches de manipulation en conditions réelles, UniIntervene améliore le taux de succès moyen de 8,6 points de pourcentage tout en réduisant les interventions humaines de 57 % par rapport aux baselines HiL-RL de l'état de l'art. L'enjeu industriel est direct : le HiL-RL est l'une des approches les plus prometteuses pour déployer des bras manipulateurs apprenants hors du laboratoire, mais son coût opérateur reste prohibitif à l'échelle. Chaque correction humaine représente du temps d'ingénieur ou de technicien immobilisé devant le robot. En délégant la majorité des interventions à un agent autonome -- tout en conservant la supervision humaine pour les cas limites -- UniIntervene ouvre un chemin vers un fine-tuning continu en production sans équipe dédiée. La réduction de 57 % est notable, mais les auteurs ne précisent pas la nature exacte des tâches testées ni si les vidéos publiées sont représentatives de l'ensemble du benchmark ; prudence donc sur la généralisabilité immédiate. Le HiL-RL pour la robotique réelle a connu une accélération depuis les travaux de DAgger (Ross et al., 2011) et leurs dérivés, avec des systèmes récents comme RLIF et IWR qui ont montré que l'intervention humaine ponctuelle surpasse le RL pur en environnements non structurés. UniIntervene s'inscrit dans cette lignée mais déplace le curseur : là où IWR demande à l'humain de décider quand intervenir, ici c'est le modèle lui-même qui prend cette décision via son critic temporel. Les concurrents directs incluent les approches de HITL proposées par des équipes de Chelsea Finn (Stanford) et Pieter Abbeel (UC Berkeley / Covariant). Aucun partenaire industriel ni timeline de déploiement n'est mentionné dans le preprint ; il s'agit pour l'instant d'une contribution de recherche sans pilote annoncé.

IA physiquePaper
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
2arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source
Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles
3arXiv cs.RO 

Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles

Des chercheurs ont publié sur arXiv (réf. 2604.07945, version 2) une méthode baptisée IRRL, Incremental Residual Reinforcement Learning, conçue pour permettre aux robots mobiles d'apprendre à naviguer parmi les piétons directement dans des environnements physiques réels, sans passer par une étape de simulation exhaustive. L'approche combine deux mécanismes distincts : l'apprentissage incrémental, un processus léger qui ne nécessite ni replay buffer ni mise à jour par batch, et le RL résiduel, qui restreint l'apprentissage aux corrections à apporter par rapport à une politique de base préexistante. Les expériences couvrent à la fois des environnements simulés et des déploiements réels sur robot physique, avec pour cible explicite les dispositifs edge à ressources computationnelles contraintes. L'enjeu industriel est concret : la navigation sociale, faire circuler un robot autonome parmi des piétons en respectant les conventions implicites de déplacement, est un verrou majeur pour les AMR déployés dans des espaces publics, des entrepôts partagés ou des établissements de santé. Le problème du sim-to-real gap est ici particulièrement prononcé, car les dynamiques piétonnes varient fortement selon les régions, les cultures et les configurations d'espace, rendant toute couverture exhaustive par simulation illusoire. IRRL propose une réponse directe : laisser le robot continuer à apprendre une fois déployé, en se limitant aux résidus par rapport à une politique de base, ce qui réduit drastiquement la charge computationnelle. Les résultats publiés montrent des performances comparables aux méthodes classiques avec replay buffer en simulation, et une supériorité sur les approches d'apprentissage incrémental existantes. Les expériences en environnement réel confirment une adaptation effective à des situations inédites. Ces résultats restent toutefois à interpréter avec prudence : il s'agit d'un preprint académique, sans benchmark standardisé ni déploiement à l'échelle annoncé. Le domaine de la navigation sociale par deep RL est actif depuis plusieurs années, porté par des travaux comme CrowdNav (ICRA 2019) ou des méthodes basées sur ORCA et ses extensions apprenantes. L'approche résiduelle n'est pas nouvelle en soi, elle est notamment utilisée dans le contrôle de robots manipulateurs pour corriger une politique classique, mais son application à la navigation sociale en conditions réelles avec contrainte edge reste peu explorée. Aucune institution ni entreprise n'est identifiée dans l'abstract disponible, et aucun partenariat industriel ni pilote terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes AMR commerciales (type Clearpath ou unitree) et une confrontation aux benchmarks publics de navigation sociale tels que BARN ou SocNavBench.

RecherchePaper
1 source
E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles
4arXiv cs.RO 

E2HiL : sélection d'échantillons guidée par l'entropie pour un apprentissage par renforcement humain-dans-la-boucle efficace en conditions réelles

Des chercheurs présentent E2HiL, un framework d'apprentissage par renforcement en boucle humaine (human-in-the-loop RL) destiné à réduire le nombre d'interventions manuelles nécessaires pour entraîner des politiques de manipulation robotique en conditions réelles. Publié sur arXiv (2601.19969v2), le système a été évalué sur 10 tâches de manipulation réelle, couvrant plusieurs types de robots et plusieurs frameworks d'apprentissage. Comparé aux meilleures références HiL-RL existantes, E2HiL améliore le taux de réussite de 24,9% tout en réduisant de 9,3% les interventions humaines requises. Techniquement, la méthode calcule des fonctions d'influence mesurant l'effet de chaque échantillon sur l'entropie de la politique, via la covariance entre probabilités d'action et avantages softs, puis ne conserve que les échantillons à influence modérée, écartant les raccourcis provoquant une chute d'entropie brutale et le bruit sans effet mesurable. Les détails du projet sont disponibles sur e2hil.github.io. L'approche cible un goulot d'étranglement bien identifié du RL réel appliqué à la manipulation: la supervision humaine nécessaire pour guider l'exploration reste coûteuse en main d'oeuvre, ce qui freine le passage à l'échelle hors simulation. En sélectionnant activement les échantillons les plus informatifs plutôt qu'en traitant chaque intervention de façon uniforme, E2HiL améliore simultanément performance et coût de supervision, un compromis rarement obtenu dans la littérature HiL-RL. Présenté comme agnostique à la politique et à l'embodiment, le module est réutilisable avec différents robots et algorithmes d'apprentissage sans reconception spécifique, ce qui intéresse les équipes cherchant à industrialiser le RL réel plutôt que de rester dépendantes du fine-tuning de modèles vision-langage-action entraînés hors ligne. Les gains chiffrés restent toutefois mesurés par les auteurs face à leurs propres baselines, sans validation indépendante à ce stade. Le framework s'inscrit dans la lignée des méthodes de RL en boucle humaine apparues pour accélérer l'apprentissage en conditions réelles, en alternative aux approches purement imitatives ou aux grands modèles vision-langage-action entraînés hors ligne puis affinés. La mention "replace" associée à la version 2 de l'article indique une mise à jour d'une publication antérieure; le résumé fourni ne précise ni laboratoire ni affiliation institutionnelle des auteurs. Aucun partenariat industriel, pilote annoncé ou calendrier de déploiement n'est mentionné: il s'agit à ce stade d'une contribution de recherche méthodologique, conçue comme un module plug-and-play destiné à s'intégrer dans des pipelines HiL-RL existants plutôt que d'un produit ou d'un système robotique complet.

RecherchePaper
1 source