
Revue de la littérature et étude expérimentale sur l'apprentissage par renforcement à partir de retours humains pour la collaboration humain-robot
Une équipe de chercheurs publie sur arXiv (2610.09891) une revue de cadrage suivie d'une expérience en réalité virtuelle sur l'apprentissage par renforcement à partir de retours humains (RLHF) appliqué à la collaboration humain-robot (HRC). La revue suit les lignes directrices PRISMA : sur 199 références examinées, 20 publications évaluées par des pairs (2020-2025) ont été retenues, couvrant plusieurs domaines de la HRC. Les auteurs affirment qu'il s'agit de la première revue centrée sur la conception bidirectionnelle en boucle fermée du RLHF. Elle recense plusieurs modalités de retour (donc plusieurs formats de données), qui peuvent être intégrées à différentes étapes de l'entraînement, ce qui donne un développement en plusieurs phases. Les systèmes sont le plus souvent évalués par des expériences pilotes, avec des métriques côté humain et côté robot. Pour tester une lacune identifiée, l'équipe a mené une expérience en environnement virtuel, en groupes indépendants (between-subjects), comparant un retour initié par le système et un retour initié par l'utilisateur, sur le comportement proxémique d'un robot qui navigue en sécurité autour d'une personne.
Les résultats reposent sur des modèles bayésiens qui relient les retours collectés à deux mesures de sécurité : la sécurité psychologique, relevée par questionnaire après l'expérience, et la sécurité physique, mesurée par l'inverse du temps avant collision. Le retour initié par l'utilisateur traduit mieux la sécurité perçue que celui déclenché par le système. Le moment où le retour est demandé influence donc directement sa qualité. L'abstract ne donne ni taille d'échantillon ni effets chiffrés, et l'expérience porte sur un scénario simulé et un seul comportement (la navigation), de sorte que la portée industrielle reste à démontrer. Pour les intégrateurs, le message est pragmatique : la manière de collecter les retours (quand, à l'initiative de qui) pèse autant que l'algorithme sur la sécurité d'un robot collaboratif. Une interface où l'opérateur signale lui-même un inconfort ou une trajectoire trop proche produirait des signaux d'entraînement plus fiables que des sondages automatiques à intervalles fixes. Le travail relativise aussi l'idée que davantage de données humaines suffit, puisque leur qualité dépend du protocole de collecte.
Le contexte est celui de l'Industrie 4.0 et de la personnalisation de masse, où la HRC doit permettre des lignes flexibles sans cloisonner l'homme et la machine. Le RLHF, popularisé par les modèles de langage, est transposé à la robotique physique avec des contraintes propres : la sécurité pendant l'apprentissage, le bruit et la fatigue des évaluateurs humains, et l'adaptation mutuelle entre l'humain et le robot. Les auteurs identifient un manque d'expériences HRC réalistes qui comparent les méthodes de collecte de retours. Ils recommandent d'en faire la priorité de la recherche à venir, en mesurant leurs effets sur des métriques humaines et robotiques. Il s'agit d'un travail académique sans produit ni déploiement annoncé, et ses conclusions devront être confirmées sur robots réels, en environnement industriel et avec des échantillons plus larges.
Dans nos dossiers




