UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles
UniIntervene++ est un agent d'intervention adaptatif pour l'apprentissage par renforcement (RL) en ligne sur robot réel, décrit dans un preprint arXiv publié en octobre 2026, avec code sur GitHub. Il décide, pendant l'entraînement, de qui contrôle le robot : la politique RL en cours d'apprentissage, une correction de trajectoire, ou une CodePolicy, c'est-à-dire un comportement structuré par la tâche et écrit sous forme de code. Ces trois comportements sont modélisés comme des « options » dans un processus de décision semi-markovien, dont l'agent apprend les valeurs relatives en ligne. Il sonde aussi régulièrement la politique RL en la laissant s'exécuter sans assistance, pour mesurer sa compétence réelle. Sur cinq tâches de manipulation réelles, le taux de succès moyen atteint 89,67 %, soit au moins 6 points de plus que tous les baselines. L'intervention humaine tombe à 0,77 % des pas, une réduction relative d'au moins 94,6 % face au meilleur baseline. Cela implique que celui-ci en demandait environ 14 % ou plus.
L'enjeu est le coût du RL en conditions réelles, aujourd'hui dominé par le temps opérateur. Les stratégies existantes reposent sur des estimations hors ligne ou des règles fixes, qui deviennent inadaptées à mesure que la politique progresse. Passer sous 1 % d'intervention, si cela se confirme, rendrait l'amélioration d'une politique sur site beaucoup moins coûteuse pour un intégrateur. Les résultats viennent toutefois d'une seule équipe, sur cinq tâches que l'abstract ne détaille pas. Les baselines ne sont pas nommés non plus, et rien n'indique la robustesse hors de ces tâches ni le coût d'écriture des CodePolicies, qui demandent une connaissance experte de la tâche.
Ce travail prolonge les approches de RL avec humain dans la boucle, où l'opérateur reprend la main pour corriger le robot, dont HIL-SERL est l'exemple le plus connu. Ces méthodes laissent l'opérateur décider seul du moment et de la manière d'intervenir, et leur charge reste élevée. UniIntervene++ remplace cette décision par un agent qui apprend quand intervenir, comment, et quand rendre le contrôle. L'expérience gagnée sous assistance sert aussi à améliorer la politique RL, dont les résultats modifient ensuite les décisions d'intervention. Il s'agit d'une recherche académique : aucun déploiement industriel ni calendrier n'est annoncé. La prochaine étape sera de voir si d'autres laboratoires reproduisent les résultats grâce au code publié, notamment sur des tâches plus longues ou des robots différents.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




