Efficacité de l'apprentissage par renforcement en ligne pour la manipulation robotique via entraînement centralisé et décomposition du critique
Une équipe de recherche présente HIL-HARC, une méthode d'apprentissage par renforcement en ligne appliquée directement sur des bras robotiques réels, sans phase de simulation préalable et avec intervention humaine ponctuelle pendant l'entraînement. Le système combine un entraînement centralisé à exécution décentralisée (CTDE) avec une architecture de récompense hybride (HRA) : plusieurs bras partagent un même critique multi-tête, décomposé en une tête "tâche" liée à une récompense éparse et une tête "préhension" fondée sur un potentiel de saisie. Les objectifs du critique et de l'acteur ont été reformulés pour exploiter ces valeurs Q décomposées, en tenant compte de la distribution catégorielle propre au contrôle discret de la pince. La méthode a été testée sur deux bras robotiques réels et sur un robot humanoïde simulé, pour des tâches de préhension-dépôt d'une balle de tennis et d'une banane, de repositionnement d'une casserole, et de déplacement de blocs en simulation, avec une plage de randomisation de domaine 5 à 25 fois plus large que dans les travaux antérieurs. Comparée à une référence de l'état de l'art, la méthode fait passer le taux de réussite de 60% à 80% sur la balle de tennis, de 60% à 90% sur la banane, et de 25% à 95% sur le déplacement de blocs simulé, tout en réussissant une tâche sur laquelle la référence échoue systématiquement.
Ce résultat s'attaque à deux limites connues du RL en ligne avec intervention humaine : la faible tolérance aux variations d'environnement, jusqu'ici restreinte à de petites plages de randomisation, et l'instabilité provoquée par l'entraînement simultané de plusieurs agents, qui rend les cibles d'apprentissage non stationnaires. En montrant qu'un critique centralisé partagé absorbe une randomisation bien plus large tout en améliorant l'efficacité d'échantillonnage, ces travaux nuancent l'idée selon laquelle seule une simulation massive permettrait d'obtenir des politiques robustes aux variations physiques. Pour les intégrateurs et équipes de R&D en manipulation robotique, cela ouvre une piste pour affiner des politiques directement sur site industriel, sans dépendre d'un pipeline sim-to-real coûteux à calibrer, un enjeu d'autant plus actuel que les architectures vision-langage-action cherchent à généraliser au-delà de démonstrations scriptées.
Le travail s'inscrit dans la lignée du RL avec intervention humaine en temps réel, en réutilisant des briques issues du RL multi-agent, l'entraînement centralisé à exécution décentralisée et la décomposition de récompense, pour les appliquer à un contexte mono-robot multi-tâche. Aucun système commercial n'est nommé dans la comparaison, et l'ensemble reste à ce stade un résultat de recherche publié en préprint sur arXiv plutôt qu'un produit déployé : les essais réels se limitent à un nombre restreint de tâches de préhension, et le volet humanoïde n'a été validé qu'en simulation. Les auteurs mettent à disposition vidéos et détails complémentaires sur un site dédié, sans annoncer de calendrier de transfert vers un humanoïde physique ni de partenariat industriel.
Dans nos dossiers




