Décomposer et réorganiser : planification par primitives et politiques visuomotrices apprises par démonstration
Traduction/résumé en cours, article de recherche robotique (arXiv), pas de deploiement produit, j'adapte la structure à ce contenu académique.
Une équipe de chercheurs propose DR-LfD (Decomposed and Reorganized Skills Learned from Demonstrations), un nouveau cadre pour la manipulation robotique dextre à long horizon, détaillé dans un article publié sur arXiv (référence 2607.25397v1). Le système décompose des démonstrations humaines en compétences élémentaires ("atomic skills"), identifiées à partir des relations de contact entre le robot et les objets manipulés. Chaque compétence est ensuite reproduite soit sous forme de politique visuomotrice (un modèle qui associe directement perception visuelle et commande motrice), soit sous forme de primitive centrée sur l'objet. Ces briques sont intégrées dans un système de planification de tâches et de mouvements (TAMP), avec un modélisation précise des conditions de déclenchement, d'arrêt et des contraintes de chaque politique. Les auteurs ont testé leur approche sur des bancs d'essai réels et simulés couvrant des scénarios variés, incluant des tâches à étapes multiples, des configurations inédites et des contraintes physiques spécifiques.
L'enjeu principal est de résoudre une tension classique du secteur : les méthodes de planification symbolique (TAMP) excellent en raisonnement de haut niveau mais deviennent fragiles dès que les opérations impliquent des contacts complexes, tandis que l'apprentissage par imitation (IL) gère bien le retour visuel mais généralise mal dans l'espace et peine sur les tâches multi-étapes. En combinant les deux, DR-LfD change surtout l'économie des données d'entraînement : au lieu de nécessiter un volume de démonstrations qui croît de façon exponentielle avec le nombre de séquences de tâches possibles, le besoin en données ne dépend plus que du nombre de types de compétences distincts, chacune nécessitant relativement peu d'exemples. C'est une piste concrète pour réduire le coût d'apprentissage sur des tâches longues et variées, un frein connu au déploiement de politiques visuomotrices à l'échelle industrielle.
Le travail s'inscrit dans la lignée des recherches cherchant à réconcilier planification symbolique et apprentissage par démonstration, deux approches historiquement développées séparément dans la littérature robotique. Les auteurs mettent en avant la capacité de leur méthode à réorganiser des compétences apprises depuis des sources différentes, un point clé pour la modularité. Le site du projet (dr-lfd.github.io) propose des démonstrations complémentaires à l'article.
Dans nos dossiers



