Planification de mouvement générative masquée avec recherche de jetons guidée par la géométrie
Des chercheurs proposent Masked Generative Motion Planning (MGMP), un planificateur de mouvement génératif qui utilise un transformeur génératif masqué pour produire en parallèle des trajectoires discrètes, puis les répare au moment de l'inférence grâce à une méthode baptisée Geometry-Guided Token Search (GGTS). Les trajectoires sont encodées sous forme de jetons discrets. GGTS s'appuie sur la géométrie de la scène pour décider quels segments modifier et quelles alternatives, déjà soutenues par l'a priori appris, méritent d'être évaluées. Les auteurs annoncent 96 % de réussite sur le benchmark Ring Maze et 82 % de réussite de réparation sur Controlled Route Invalidation avec un bras Kuka. Cela dépasse de 23 et 25 points de pourcentage les meilleures références externes testées. La méthode est aussi évaluée sur des agencements inédits, des obstacles supplémentaires, des géométries jamais vues, la planification à un et deux bras, ainsi que sur des tâches réelles avec un robot Baxter. Le travail est publié sur arXiv (2610.10646v1) et n'a pas encore été relu par des pairs.
Les planificateurs génératifs actuels, notamment ceux à base de diffusion, utilisent l'a priori appris pour générer la trajectoire initiale, puis confient la correction à un raffinement continu local, de type descente de gradient ou déformation de trajectoire. Cette approche échoue quand l'obstacle impose de changer de route, par exemple de contourner un mur par l'autre côté. MGMP transforme cette réparation en recherche discrète parmi des alternatives de mouvement plausibles. Il permet ainsi une restructuration au niveau de la route, là où une déformation locale reste coincée dans le mauvais bassin d'attraction. Pour les intégrateurs et les équipes qui déploient des bras en environnement changeant (cellules logistiques, ateliers reconfigurables), la capacité à replanifier quand une voie est bloquée compte autant que la qualité du premier tir. Deux réserves s'imposent toutefois. Les benchmarks sont en grande partie synthétiques (labyrinthe en anneau, invalidation contrôlée de route). La validation réelle se limite à un Baxter, plateforme ancienne et peu précise, sans temps de calcul ni taux de réussite détaillés dans le résumé. Les chiffres de latence face aux planificateurs classiques à échantillonnage (RRT*, par exemple) restent donc à vérifier dans l'article complet.
Ce travail s'inscrit dans la lignée de la planification par diffusion (Diffuser, Motion Planning Diffusion) et des transformeurs génératifs masqués, popularisés par MaskGIT en vision, que les auteurs transposent à la robotique. Il se positionne face aux planificateurs de référence à échantillonnage ou à optimisation (RRT*, CHOMP, TrajOpt, cuRobo accéléré sur GPU) et aux générateurs par diffusion avec raffinement guidé. Ces derniers constituent vraisemblablement les « baselines externes » dépassées. La suite logique est de tester la méthode sur des scènes dynamiques, des manipulateurs plus récents et des tâches de manipulation de précision. Un code ou un jeu de données public faciliterait la reproduction. Aucun calendrier de transfert industriel n'est annoncé : il s'agit de recherche académique, loin d'un produit livré ou d'un déploiement.
Dans nos dossiers




