DexPolicy : exploration planifiée pour la manipulation dextre guidée par trajectoires
Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.00360) DexPolicy, une méthode qui traite l'amplitude du bruit d'action comme une fonction explicite du nombre de pas d'entraînement, décroissant d'une exploration large vers une exploration étroite. Elle est testée dans le cadre de ViViDex, où l'apprentissage par renforcement (RL) affine des trajectoires main-objet extraites de vidéos humaines. Dans ce cadre, les runs PPO de référence finissent après 5 millions de pas près de leur bruit initial. La perte, l'architecture, la récompense et l'optimiseur restent identiques. Trois variantes sont comparées : PPO, une continuation GRPO sans critique et une version de PPO à politique paramétrée par flow (FPO). En simulation, sur cinq objets YCB et trois graines, le succès déterministe moyen passe de 49,4 % à 68,1 % pour FPO, de 14,1 % à 45,4 % pour GRPO et de 32,0 % à 35,7 % pour PPO. Sur robot réel, un bras RealMan RM75 équipé d'une main Inspire RH56, 360 essais sur trois objets font passer le succès moyen de 25,0 % à 85,0 % (FPO), de 10,0 % à 63,3 % (GRPO) et de 8,3 % à 43,3 % (PPO), avec un modèle entraîné par couple objet-méthode. Le code est publié.
Le résultat intéresse les équipes qui cherchent à rendre le RL dextre fiable. Le bruit qui aide à découvrir les contacts doigt-objet gêne ensuite le contrôle fin de l'objet. Le gain vient d'un seul paramètre, ce qui en fait un levier peu coûteux à reproduire. Le gain est très inégal selon l'algorithme : il est marginal pour PPO en simulation (+3,7 points) et massif pour FPO et GRPO. Les auteurs notent aussi que le retour d'entraînement, le succès déterministe et la tolérance au bruit d'exécution se dissocient. Ils en déduisent qu'un calendrier d'exploration se juge sur le succès terminal dans les conditions d'exécution visées, tâche par tâche. Pour un intégrateur, c'est un rappel que les courbes d'entraînement ne prédisent pas la performance réelle. Le calendrier retenu pour PPO bat aussi une simple décroissance linéaire aux mêmes bornes sur trois objets, mais l'écart n'est établi que sur ces trois objets.
Il faut toutefois relativiser la portée. La validation réelle porte sur trois objets, une seule plateforme et un modèle par condition, sans test de généralisation à des objets inédits. Les échantillons sont petits : 360 essais répartis sur trois méthodes, avant et après calendrier, et trois objets. Le travail prolonge ViViDex, qui apprend la manipulation à partir de vidéos humaines, dans un champ où les politiques dextres par RL et les approches VLA ou par diffusion et flow se multiplient. Aucun acteur industriel européen n'est impliqué. Il s'agit d'un preprint, sans déploiement ni produit annoncé, et les prochaines étapes dépendront d'une réplication sur d'autres mains, d'autres tâches et d'objets hors du jeu YCB.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




