Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons
Res-HIL, un framework de reinforcement learning résiduel guidé par l'humain pour la manipulation robotique dextre, a été publié sur arXiv le 25 septembre 2026 sous la référence 2609.30023. La méthode combine une politique d'imitation pré-entraînée et gelée avec une politique résiduelle corrective, entraînée à partir d'interventions humaines en temps réel : chaque intervention fournit à la fois une supervision directe de la politique résiduelle et un signal de récompense pour le comportement autonome qui l'a précédée. La politique résiduelle démarre à zéro pour stabiliser l'apprentissage en ligne. Testée sur cinq tâches de manipulation à fort contact, mêlant haute précision et longs horizons temporels, Res-HIL surpasse, avec seulement 20 démonstrations initiales et dix minutes d'entraînement en ligne, les méthodes de référence de RL human-in-the-loop à politique complète et de fine-tuning résiduel sans guidage humain. Elle dépasse également des politiques d'imitation pure entraînées avec cinq fois plus de démonstrations.
Le résultat cible le principal goulot d'étranglement du déploiement de manipulateurs dextres : le coût de collecte de démonstrations humaines, qui ne garantit pas la généralisation une fois la politique déployée hors distribution. En montrant qu'une correction résiduelle guidée par l'humain, appliquée seulement dix minutes, peut égaler des politiques entraînées sur cinq fois plus de données, Res-HIL suggère que l'effort humain est mieux investi dans la correction ciblée d'une politique existante que dans la multiplication des démonstrations complètes, une remise en cause pratique de l'hypothèse dominante en apprentissage par imitation selon laquelle la qualité dépend avant tout du volume de données. Pour les intégrateurs évaluant des tâches à fort contact comme l'assemblage ou l'insertion, cela ouvre une voie d'amélioration post-déploiement moins coûteuse qu'un ré-entraînement complet.
L'approche s'inscrit entre deux courants existants : l'apprentissage par imitation, dont les politiques échouent typiquement hors de la distribution des démonstrations d'entraînement, et le RL human-in-the-loop, qui exploite des corrections en ligne mais réapprend généralement une politique complète plutôt que d'affiner un modèle déjà entraîné. Res-HIL se positionne explicitement contre ces deux références, qu'il surpasse systématiquement dans l'étude comparative. Une analyse d'ablation montre que la supervision directe de la politique résiduelle est le facteur critique de performance, tandis que le façonnage de récompense sensible aux interventions améliore surtout l'efficacité de l'entraînement. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche méthodologique dont la validation sur des plateformes robotiques réelles, au-delà des cinq tâches testées, reste l'étape suivante.
Dans nos dossiers




