Aller au contenu principal
ADEPT : accélérer la dextérité par pré-entraînement et post-entraînement via apprentissage par renforcement
RecherchearXiv cs.RO 

ADEPT : accélérer la dextérité par pré-entraînement et post-entraînement via apprentissage par renforcement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ADEPT, pour Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning, est un système d'apprentissage par renforcement (RL) à grande échelle décrit dans un preprint publié sur arXiv en août 2026 (référence 2608.19182), qui transfère une dextérité robotique du simulateur au monde réel sur des bras et mains à haut nombre de degrés de liberté (DoF). La méthode pré-entraîne une politique générique de repositionnement d'objets, puis affine des politiques spécialisées à partir de ce socle commun, évitant de réapprendre les mêmes compétences de base pour chaque nouvelle tâche. Elle a été testée sur deux plateformes : un bras Kuka couplé à une main Allegro (23 DoF, deux caméras RGB) et un bras Flexiv associé à une main Sharpa (29 DoF, deux caméras RGB et cinq capteurs tactiles à base de vision). Les politiques finales, distillées en modèles perceptifs compacts, exécutent des tâches longues à partir d'états initiaux difficiles, à une vitesse proche du niveau humain, avec un transfert direct vers le réel sans réentraînement supplémentaire.

Ce travail répond à un problème connu du RL appliqué à la robotique dextre : un simple réglage fin de la politique pré-entraînée dégrade rapidement les capacités acquises lors du transfert vers une nouvelle tâche. Pour l'éviter, les auteurs combinent distillation par clonage comportemental, préchauffage du critique et mises à jour on-policy conservatrices. Ils ajoutent un "Geometric Fabric" dans l'espace articulaire, une couche qui médiatise entre la politique RL et le robot pour exploiter en sécurité toute l'amplitude cinématique sans mouvements incontrôlés. Pour l'industrie de la manipulation dextre, ADEPT illustre une alternative aux modèles vision-langage-action massifs type Pi-0 ou GR00T N2 : un RL pré-entraîné et réutilisable plutôt qu'une imitation pure à partir de démonstrations, avec un transfert validé directement sur du matériel multi-doigts réel.

L'apprentissage de la dextérité fine avec des mains multi-doigts et une perception visuo-tactile brute reste l'un des verrous majeurs de la robotique d'apprentissage, en raison du coût et du risque d'endommager le matériel pendant l'entraînement en conditions réelles. Les approches précédentes entraînaient généralement une politique par tâche depuis zéro, un processus coûteux et peu réutilisable à grande échelle. ADEPT se positionne ainsi face aux efforts d'autres acteurs de la robotique humanoïde et de la manipulation, dont les systèmes associés à Figure 03, Optimus Gen 3 ou Helix, qui misent davantage sur de gros modèles entraînés sur des données de téléopération. Classé comme nouvelle publication sur arXiv, l'article ne mentionne aucun déploiement commercial ni partenariat industriel : il s'agit d'un résultat de recherche validé sur deux bancs robotiques de laboratoire, sans calendrier annoncé pour un produit ou un pilote client.

Impact France/UE

Le bras robotique Kuka (Allemagne) sert de plateforme materielle a cette recherche, mais l'article ne mentionne aucune retombee industrielle ou reglementaire en France/UE.

À lire aussi

R³ : entraîner des robots à raisonner en langage naturel par apprentissage par renforcement
1arXiv cs.RO 

R³ : entraîner des robots à raisonner en langage naturel par apprentissage par renforcement

Des chercheurs présentent R³ (R-cubed), une méthode de post-entraînement qui transforme des modèles vision-langage (VLM) génériques en « raisonneurs robotiques » capables de guider des politiques de manipulation bas niveau. La recette se déroule en deux temps : un VLM est d'abord entraîné (mid-training) sur des traces de raisonnement générées par des experts pour installer un style de raisonnement adapté, puis affiné par apprentissage par renforcement à un pas, fondé sur des grilles d'évaluation (rubric-based RL), à partir de données d'action hors ligne. L'équipe a testé R³ sur deux bancs d'essai contrôlés : Language Table et une tâche simulée d'emballage de courses à deux bras (bimanual grocery packing). Sur ces deux benchmarks, R³ améliore l'exploration et la généralisation vers des tâches non vues à l'entraînement, et surpasse nettement des références d'apprentissage par imitation guidées uniquement par instruction. Le travail est publié en préprint sur arXiv (2608.26053, août 2026) et une page de projet est disponible à robotic-reasoner.github.io. La particularité de R³ tient à la nature du raisonnement produit : contrairement aux méthodes robotiques antérieures, qui utilisent des traces structurées comme simple supervision auxiliaire à l'entraînement, R³ entraîne le modèle à produire un raisonnement en langage libre qui sert directement de guidage au moment de l'exécution, pour piloter des politiques bas niveau souvent bruyantes. L'enjeu dépasse l'exercice académique : les tâches robotiques à long horizon exigent de suivre une progression partielle, de raisonner sur les relations entre objets et de détecter puis corriger des erreurs, des compétences que l'apprentissage par imitation pure peine à capturer. Ces résultats apportent un signal utile au débat en cours dans le secteur des modèles vision-langage-action (VLA), où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à doter bras manipulateurs et robots humanoïdes d'un raisonnement transférable de la simulation au monde réel. R³ suggère que le raisonnement en langage libre, popularisé par les modèles de type o1 sur des problèmes textuels complexes, peut aussi fonctionner comme mécanisme de calcul au moment du test pour la manipulation robotique. Ce travail s'inscrit dans une tendance plus large visant à transférer aux robots les gains obtenus par les modèles de fondation lorsqu'ils « réfléchissent » avant d'agir, capacité qui a déjà transformé les performances des grands modèles de langage sur les problèmes nécessitant décomposition et anticipation des conséquences. Jusqu'ici, les approches de raisonnement robotique se contentaient le plus souvent d'un signal auxiliaire sans que ce raisonnement pilote réellement l'action finale, ce que R³ cherche précisément à corriger. Les résultats publiés restent toutefois circonscrits à des environnements contrôlés et largement simulés, sans démonstration sur un déploiement réel à grande échelle ni comparaison directe avec des systèmes commerciaux déjà en service. Les auteurs ne précisent pas de calendrier de portage vers des robots physiques ou de tests sur des tâches industrielles plus complexes, ce qui situe R³ comme une contribution de recherche amont plutôt qu'un produit prêt à l'intégration.

RecherchePaper
1 source
TEMPO : post-entraînement par apprentissage par renforcement à découplage sémantique-action pour modèles vision-langage-action
2arXiv cs.RO 

TEMPO : post-entraînement par apprentissage par renforcement à découplage sémantique-action pour modèles vision-langage-action

Une équipe de recherche publie sur arXiv (référence 2608.07314v1, mise en ligne le 10 août 2026) un article intitulé TEMPO, décrivant une méthode de post-entraînement par apprentissage par renforcement pour les modèles vision-langage-action (VLA), ces architectures qui traduisent une instruction en langage naturel et une image caméra en commandes motrices pour un bras ou un robot manipulateur. Le principe : geler le backbone vision-langage pré-entraîné pour préserver ses représentations sémantiques générales, puis n'adapter que deux sous-modules via des boucles de RL distinctes, une couche de projection sémantique mise à jour peu fréquemment pour stabiliser l'action latente, et un expert d'action bas niveau mis à jour à haute fréquence pour intégrer rapidement le retour de l'interaction en ligne. Les auteurs testent cette approche à deux échelles temporelles sur le benchmark de simulation CALVIN, une référence académique pour la manipulation conditionnée par le langage, ainsi que sur des tâches de manipulation réelles, où TEMPO dépasserait à la fois les modèles VLA pré-entraînés de référence et une base RL classique à mise à jour uniforme. L'abstract ne fournit toutefois aucun chiffre précis, ni gain en pourcentage, ni degrés de liberté, ni temps de cycle, ce qui limite l'évaluation indépendante des résultats annoncés. L'enjeu dépasse la seule performance brute : les approches actuelles de fine-tuning des VLA butent soit sur le désalignement de distribution du SFT classique, soit sur l'instabilité provoquée par des mises à jour RL uniformes qui perturbent les représentations sémantiques apprises en pré-entraînement. En découplant les échelles temporelles d'apprentissage, TEMPO répond directement à un point de friction connu dans le déploiement de politiques génératives sur robots réels, où l'apprentissage en ligne doit rester stable tout en s'adaptant vite au feedback de contrôle. Pour les intégrateurs et laboratoires travaillant avec des VLA de type Pi-0, GR00T N2 ou Helix, ce type de méthode de post-entraînement plus fine pourrait réduire le fossé entre démonstration en simulation et robustesse en conditions réelles, sans nécessiter un réentraînement complet du modèle. Ce travail s'inscrit dans la lignée des recherches sur l'adaptation des modèles VLA pré-entraînés à grande échelle, où le SFT reste la méthode dominante malgré ses limites, et où le RL post-entraînement commence à s'imposer comme alternative pour affiner le comportement en environnement réel. Il s'agit ici d'un article de recherche déposé en preprint, sans lien avec un produit commercialisé ni un déploiement industriel annoncé, et sans mention d'affiliation d'entreprise dans le résumé disponible.

RechercheActu
1 source
Efficacité de l'apprentissage par renforcement en ligne pour la manipulation robotique via entraînement centralisé et décomposition du critique
3arXiv cs.RO 

Efficacité de l'apprentissage par renforcement en ligne pour la manipulation robotique via entraînement centralisé et décomposition du critique

Une équipe de recherche présente HIL-HARC, une méthode d'apprentissage par renforcement en ligne appliquée directement sur des bras robotiques réels, sans phase de simulation préalable et avec intervention humaine ponctuelle pendant l'entraînement. Le système combine un entraînement centralisé à exécution décentralisée (CTDE) avec une architecture de récompense hybride (HRA) : plusieurs bras partagent un même critique multi-tête, décomposé en une tête "tâche" liée à une récompense éparse et une tête "préhension" fondée sur un potentiel de saisie. Les objectifs du critique et de l'acteur ont été reformulés pour exploiter ces valeurs Q décomposées, en tenant compte de la distribution catégorielle propre au contrôle discret de la pince. La méthode a été testée sur deux bras robotiques réels et sur un robot humanoïde simulé, pour des tâches de préhension-dépôt d'une balle de tennis et d'une banane, de repositionnement d'une casserole, et de déplacement de blocs en simulation, avec une plage de randomisation de domaine 5 à 25 fois plus large que dans les travaux antérieurs. Comparée à une référence de l'état de l'art, la méthode fait passer le taux de réussite de 60% à 80% sur la balle de tennis, de 60% à 90% sur la banane, et de 25% à 95% sur le déplacement de blocs simulé, tout en réussissant une tâche sur laquelle la référence échoue systématiquement. Ce résultat s'attaque à deux limites connues du RL en ligne avec intervention humaine : la faible tolérance aux variations d'environnement, jusqu'ici restreinte à de petites plages de randomisation, et l'instabilité provoquée par l'entraînement simultané de plusieurs agents, qui rend les cibles d'apprentissage non stationnaires. En montrant qu'un critique centralisé partagé absorbe une randomisation bien plus large tout en améliorant l'efficacité d'échantillonnage, ces travaux nuancent l'idée selon laquelle seule une simulation massive permettrait d'obtenir des politiques robustes aux variations physiques. Pour les intégrateurs et équipes de R&D en manipulation robotique, cela ouvre une piste pour affiner des politiques directement sur site industriel, sans dépendre d'un pipeline sim-to-real coûteux à calibrer, un enjeu d'autant plus actuel que les architectures vision-langage-action cherchent à généraliser au-delà de démonstrations scriptées. Le travail s'inscrit dans la lignée du RL avec intervention humaine en temps réel, en réutilisant des briques issues du RL multi-agent, l'entraînement centralisé à exécution décentralisée et la décomposition de récompense, pour les appliquer à un contexte mono-robot multi-tâche. Aucun système commercial n'est nommé dans la comparaison, et l'ensemble reste à ce stade un résultat de recherche publié en préprint sur arXiv plutôt qu'un produit déployé : les essais réels se limitent à un nombre restreint de tâches de préhension, et le volet humanoïde n'a été validé qu'en simulation. Les auteurs mettent à disposition vidéos et détails complémentaires sur un site dédié, sans annoncer de calendrier de transfert vers un humanoïde physique ni de partenariat industriel.

RecherchePaper
1 source
SLAC : apprentissage par renforcement sûr et efficace pour robots réels via pré-entraînement non supervisé en simulation
4arXiv cs.RO 

SLAC : apprentissage par renforcement sûr et efficace pour robots réels via pré-entraînement non supervisé en simulation

Le robot mobile bimanuel de niveau industriel exige de maîtriser des systèmes à degrés de liberté (DoF) élevés, un défi classique pour l'apprentissage par renforcement (RL). Une équipe de recherche présente SLAC (Safe and Efficient Real-Robot Reinforcement Learning), une méthode qui rend le RL directement en environnement réel viable pour des robots complexes. L'approche s'appuie sur un simulateur basse fidélité pour pré-entraîner, hors ligne, un espace d'actions latent indépendant de toute tâche spécifique. Cet espace est construit via une méthode de découverte de compétences non supervisée, conçue pour favoriser l'abstraction temporelle, la désentrelation des variables et la sécurité des mouvements. Une fois cet espace latent appris, SLAC l'utilise comme interface d'action pour un nouvel algorithme RL off-policy, qui apprend ensuite des tâches concrètes par interaction directe avec le monde réel. Sur une série de tâches de manipulation mobile bimanuelle avec contact riche, la méthode atteint des performances état de l'art, apprenant des comportements complets du corps du robot en moins d'une heure d'interactions réelles, sans démonstrations humaines ni comportements pré-programmés à la main. Ce résultat s'attaque à deux limites structurelles qui freinent le déploiement du RL sur des robots industriels ou domestiques à haut DoF : l'apprentissage direct en réel est risqué et gourmand en données, tandis que le sim-to-real reste fragile à cause de l'écart de réalité entre simulation et monde physique. En pré-entraînant un espace d'actions latent plutôt qu'une politique complète en simulation, SLAC évite de transférer des comportements calibrés sur un modèle imparfait du monde, ce qui limite l'impact du reality gap. Pour les intégrateurs et décideurs robotique, la promesse concrète est celle d'un apprentissage de tâches en usine ou en environnement domestique sans phase de collecte de démonstrations coûteuse, un frein connu à l'adoption du RL en dehors des laboratoires de recherche. Le papier, republié en version révisée sur arXiv (2506.04147v5), s'inscrit dans la lignée des travaux récents sur les architectures vision-langage-action (VLA) et les politiques génériques de manipulation, à l'image de GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence, qui cherchent elles aussi à réduire la dépendance aux démonstrations massives. SLAC se distingue en misant sur la découverte de compétences non supervisée plutôt que sur l'apprentissage par imitation à grande échelle. Les auteurs mettent à disposition des vidéos et documents complémentaires sur robo-rl.github.io ; les prochaines étapes attendues concernent l'extension à un plus grand nombre de tâches et embodiments, ainsi que la validation sur des plateformes robotiques industrielles au-delà du cadre expérimental académique actuel.

RecherchePaper
1 source