
Manipulation prensile et non prensile simultanées : une approche pratique des tâches dextres multi-étapes
Des chercheurs présentent DexMulti, une méthode d'apprentissage pour mains robotiques dextres capables de manipulation concurrente préhensile et non préhensile, c'est-à-dire tenir un objet tout en agissant sur un second. L'article, publié sur arXiv (2603.11655, version révisée), a été testé sur trois tâches multi-étapes représentatives de gestes du quotidien : saisir et tirer, saisir et ouvrir, saisir et saisir. Les essais ont été menés sur deux mains robotiques différentes, Allegro et LEAP, pour un total de plus de 1 000 essais en conditions réelles. Avec seulement 3 à 4 démonstrations par objet, DexMulti atteint un taux de réussite moyen de 66 % sur les objets d'entraînement, soit 2 à 3 fois mieux que les politiques de diffusion utilisées comme référence, tout en nécessitant nettement moins de données. La méthode généralise aussi à des objets jamais vus et à des variations spatiales allant jusqu'à 25 centimètres.
L'intérêt de ces résultats tient moins à la performance brute qu'à l'efficacité d'apprentissage : la manipulation dextre multi-objets et riche en contacts est réputée gourmande en données pour les politiques de bout en bout, ce qui freine leur déploiement réel. En démontrant qu'une poignée de démonstrations par objet suffit à obtenir un comportement robuste et généralisable, ces travaux répondent directement à l'un des goulots d'étranglement identifiés dans l'apprentissage par imitation pour la robotique dextre, un enjeu qui concerne aussi bien les laboratoires de recherche que les intégrateurs cherchant à déployer des mains robotiques dans des tâches industrielles ou domestiques variées sans réentraînement massif à chaque nouvel objet.
Plutôt que d'entraîner une politique monolithique, DexMulti décompose les démonstrations en compétences centrées sur l'objet, dotées de frontières temporelles claires, puis les récupère et les aligne sur l'état observé de l'objet via un estimateur qui suit son centre et son orientation, avant de les exécuter selon un paradigme de récupération-alignement-exécution. Cette architecture s'inscrit dans une tendance plus large de la recherche en manipulation dextre, qui cherche des alternatives aux politiques de diffusion et aux modèles vision-langage-action entraînés de bout en bout, jugés trop coûteux en données pour certaines tâches contraintes. Les auteurs annoncent vouloir étendre l'approche à un plus grand nombre de tâches et de configurations d'objets dans de futurs travaux.
Dans nos dossiers




