ADEPT : accélérer la dextérité par pré-entraînement et post-entraînement via apprentissage par renforcement
ADEPT, pour Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning, est un système d'apprentissage par renforcement (RL) à grande échelle décrit dans un preprint publié sur arXiv en août 2026 (référence 2608.19182), qui transfère une dextérité robotique du simulateur au monde réel sur des bras et mains à haut nombre de degrés de liberté (DoF). La méthode pré-entraîne une politique générique de repositionnement d'objets, puis affine des politiques spécialisées à partir de ce socle commun, évitant de réapprendre les mêmes compétences de base pour chaque nouvelle tâche. Elle a été testée sur deux plateformes : un bras Kuka couplé à une main Allegro (23 DoF, deux caméras RGB) et un bras Flexiv associé à une main Sharpa (29 DoF, deux caméras RGB et cinq capteurs tactiles à base de vision). Les politiques finales, distillées en modèles perceptifs compacts, exécutent des tâches longues à partir d'états initiaux difficiles, à une vitesse proche du niveau humain, avec un transfert direct vers le réel sans réentraînement supplémentaire.
Ce travail répond à un problème connu du RL appliqué à la robotique dextre : un simple réglage fin de la politique pré-entraînée dégrade rapidement les capacités acquises lors du transfert vers une nouvelle tâche. Pour l'éviter, les auteurs combinent distillation par clonage comportemental, préchauffage du critique et mises à jour on-policy conservatrices. Ils ajoutent un "Geometric Fabric" dans l'espace articulaire, une couche qui médiatise entre la politique RL et le robot pour exploiter en sécurité toute l'amplitude cinématique sans mouvements incontrôlés. Pour l'industrie de la manipulation dextre, ADEPT illustre une alternative aux modèles vision-langage-action massifs type Pi-0 ou GR00T N2 : un RL pré-entraîné et réutilisable plutôt qu'une imitation pure à partir de démonstrations, avec un transfert validé directement sur du matériel multi-doigts réel.
L'apprentissage de la dextérité fine avec des mains multi-doigts et une perception visuo-tactile brute reste l'un des verrous majeurs de la robotique d'apprentissage, en raison du coût et du risque d'endommager le matériel pendant l'entraînement en conditions réelles. Les approches précédentes entraînaient généralement une politique par tâche depuis zéro, un processus coûteux et peu réutilisable à grande échelle. ADEPT se positionne ainsi face aux efforts d'autres acteurs de la robotique humanoïde et de la manipulation, dont les systèmes associés à Figure 03, Optimus Gen 3 ou Helix, qui misent davantage sur de gros modèles entraînés sur des données de téléopération. Classé comme nouvelle publication sur arXiv, l'article ne mentionne aucun déploiement commercial ni partenariat industriel : il s'agit d'un résultat de recherche validé sur deux bancs robotiques de laboratoire, sans calendrier annoncé pour un produit ou un pilote client.
Le bras robotique Kuka (Allemagne) sert de plateforme materielle a cette recherche, mais l'article ne mentionne aucune retombee industrielle ou reglementaire en France/UE.
Dans nos dossiers




