Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique
Une nouvelle méthode d'apprentissage par renforcement (RL) entraînée directement sur un robot physique, sans simulation préalable ni démonstrations humaines, a été détaillée dans un article publié sur arXiv (2609.14878v1). Le système associe un contrôleur prédictif par échantillonnage (MPC) à un apprenant Soft Actor-Critic hors politique pour piloter une main robotique Allegro à 16 degrés de liberté. Concrètement, 20 trajectoires générées par le MPC sur le matériel réel, collectées en 12 minutes, servent d'abord à préremplir un buffer de rejeu et à pré-entraîner l'acteur et le critique. Pendant la phase en ligne, le MPC continue de guider la collecte de données par intermittence, tandis que le contrôle bascule progressivement vers la politique apprise. Sur une tâche de rotation continue d'objet en main, la politique atteint 100% de réussite en évaluation autonome (5 essais sur 5) après seulement 7 minutes d'apprentissage en ligne, moyennant environ trois chutes d'objet durant l'entraînement. Après 20 minutes, elle tourne plus de cinq fois plus vite que le contrôleur MPC initial et enchaîne 1000 rotations consécutives sur plus de 110 minutes sans lâcher l'objet.
Ce résultat s'attaque à l'un des obstacles les plus concrets du RL en robotique: l'exploration initiale aléatoire, lente et destructrice pour le matériel réel. En ancrant l'apprentissage dans l'expérience d'un contrôleur classique plutôt que dans des démonstrations humaines téléopérées, coûteuses à produire en volume, la méthode réduit fortement le temps d'intervention et le nombre d'échecs physiques nécessaires avant d'obtenir une politique fiable. Pour les équipes travaillant sur la manipulation dextre, c'est un indice que l'apprentissage sur robot réel, longtemps jugé trop lent et risqué face au sim-to-real, peut converger en quelques dizaines de minutes sur une tâche à haute dimensionnalité, à condition de structurer l'exploration plutôt que de la laisser libre. Le résultat nuance aussi l'hypothèse selon laquelle des démonstrations humaines seraient indispensables pour amorcer ce type de politique.
La démonstration reste toutefois limitée à une tâche de référence en conditions de laboratoire, sans institution ni calendrier de publication du code précisés. Les ablations montrent que le pré-entraînement MPC, la conservation de cette expérience dans le buffer et le guidage MPC en ligne apportent chacun un gain distinct et complémentaire, ce qui distingue l'approche des pipelines purement sim-to-real ou de l'apprentissage par imitation à partir de téléopération, aujourd'hui dominant dans la manipulation dextre humanoïde. Les auteurs rapportent en complément une adaptation rapide à d'autres géométries d'objets et une réorientation conditionnée par objectif, sans annoncer de partenariat industriel ni de déploiement au-delà du résultat de recherche.
Dans nos dossiers




