Aller au contenu principal
RecherchearXiv cs.RO 

Planification de mouvement générative masquée avec recherche de jetons guidée par la géométrie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Masked Generative Motion Planning (MGMP), un planificateur de mouvement génératif qui utilise un transformeur génératif masqué pour produire en parallèle des trajectoires discrètes, puis les répare au moment de l'inférence grâce à une méthode baptisée Geometry-Guided Token Search (GGTS). Les trajectoires sont encodées sous forme de jetons discrets. GGTS s'appuie sur la géométrie de la scène pour décider quels segments modifier et quelles alternatives, déjà soutenues par l'a priori appris, méritent d'être évaluées. Les auteurs annoncent 96 % de réussite sur le benchmark Ring Maze et 82 % de réussite de réparation sur Controlled Route Invalidation avec un bras Kuka. Cela dépasse de 23 et 25 points de pourcentage les meilleures références externes testées. La méthode est aussi évaluée sur des agencements inédits, des obstacles supplémentaires, des géométries jamais vues, la planification à un et deux bras, ainsi que sur des tâches réelles avec un robot Baxter. Le travail est publié sur arXiv (2610.10646v1) et n'a pas encore été relu par des pairs.

Les planificateurs génératifs actuels, notamment ceux à base de diffusion, utilisent l'a priori appris pour générer la trajectoire initiale, puis confient la correction à un raffinement continu local, de type descente de gradient ou déformation de trajectoire. Cette approche échoue quand l'obstacle impose de changer de route, par exemple de contourner un mur par l'autre côté. MGMP transforme cette réparation en recherche discrète parmi des alternatives de mouvement plausibles. Il permet ainsi une restructuration au niveau de la route, là où une déformation locale reste coincée dans le mauvais bassin d'attraction. Pour les intégrateurs et les équipes qui déploient des bras en environnement changeant (cellules logistiques, ateliers reconfigurables), la capacité à replanifier quand une voie est bloquée compte autant que la qualité du premier tir. Deux réserves s'imposent toutefois. Les benchmarks sont en grande partie synthétiques (labyrinthe en anneau, invalidation contrôlée de route). La validation réelle se limite à un Baxter, plateforme ancienne et peu précise, sans temps de calcul ni taux de réussite détaillés dans le résumé. Les chiffres de latence face aux planificateurs classiques à échantillonnage (RRT*, par exemple) restent donc à vérifier dans l'article complet.

Ce travail s'inscrit dans la lignée de la planification par diffusion (Diffuser, Motion Planning Diffusion) et des transformeurs génératifs masqués, popularisés par MaskGIT en vision, que les auteurs transposent à la robotique. Il se positionne face aux planificateurs de référence à échantillonnage ou à optimisation (RRT*, CHOMP, TrajOpt, cuRobo accéléré sur GPU) et aux générateurs par diffusion avec raffinement guidé. Ces derniers constituent vraisemblablement les « baselines externes » dépassées. La suite logique est de tester la méthode sur des scènes dynamiques, des manipulateurs plus récents et des tâches de manipulation de précision. Un code ou un jeu de données public faciliterait la reproduction. Aucun calendrier de transfert industriel n'est annoncé : il s'agit de recherche académique, loin d'un produit livré ou d'un déploiement.

Dans nos dossiers

À lire aussi

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
1arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
Optimisation générative guidée par un modèle et sensible à la géométrie pour la planification de locomotion sous contraintes
2arXiv cs.RO 

Optimisation générative guidée par un modèle et sensible à la géométrie pour la planification de locomotion sous contraintes

Des chercheurs publient sur arXiv (2610.07772) une méthode baptisée 2GO, pour Model-Based Geometry-Aware Generative Optimization, destinée à la planification de locomotion sous contraintes (Constrained Locomotion Planning, CLP) de quadrupèdes et d'humanoïdes. Le robot doit y respecter en même temps l'évitement de collisions, la cohérence des contacts, la faisabilité cinématique et les contraintes de support. 2GO s'appuie sur les approches Model-Based Diffusion (MBD), qui traitent l'optimisation de trajectoire comme un échantillonnage a posteriori. Ces approches utilisent la dynamique connue et des rollouts Monte Carlo pour estimer analytiquement la fonction de score de débruitage, sans apprentissage à partir de démonstrations. Trois mécanismes transforment la géométrie des contraintes actives en opérateurs de débruitage exécutables : une métrique modelée par les normales aux contraintes, un filtrage stochastique dans l'espace tangent et une rétraction fondée sur CFS. 2GO découple aussi le transport génératif de la stochasticité inverse grâce à un calendrier adaptatif qui mêle diffusion et dynamique de type flow. Les essais portent sur la sélection discrète de points d'appui et sur la planification continue de posture. Les auteurs annoncent de meilleurs taux de succès, moins de violations de contraintes et une meilleure compatibilité à l'exécution. L'intérêt est surtout méthodologique. La planification de locomotion sous contraintes reste un point dur des quadrupèdes et des humanoïdes, car la dynamique est de grande dimension et les environnements sont très non convexes (escaliers, terrains discontinus, appuis rares). 2GO suit une voie différente des politiques apprises par imitation ou par apprentissage par renforcement : elle réutilise le modèle physique et se passe de données de démonstration, ce qui retire un coût de collecte. L'idée centrale est que la géométrie des contraintes actives doit orienter la direction du score et le bruit injecté, au lieu d'être traitée comme une simple pénalité. Pour un intégrateur, la promesse est une planification plus fiable aux contacts, où se concentrent les échecs sur terrain réel. Il faut toutefois rester prudent. Le résumé ne donne aucun chiffre : ni taux de succès, ni temps de calcul, ni comparaison chiffrée, ni plateforme matérielle. Rien n'indique non plus si les essais ont eu lieu uniquement en simulation, et la question du temps réel, décisive pour un déploiement embarqué, n'est pas abordée. Il s'agit d'un preprint non évalué par les pairs, sans produit ni déploiement associé. Le travail prolonge les variantes contraintes de MBD, qui intégraient déjà la faisabilité dans les rollouts de score. Les auteurs leur reprochent l'absence de géométrie de contrainte modulée par la tâche et l'usage d'un transport inverse déterministe de type DDPM, sans ordonnancement adaptatif. Il se place face aux approches de diffusion apprise et aux politiques VLA, qui visent plutôt la manipulation et le comportement de haut niveau. Les prochaines étapes à surveiller sont la publication du code, des benchmarks chiffrés et une validation sur robot physique.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DuetHOI : génération de mouvements bimanuels main-objet guidée par le langage, avec planification d'articulation et raffinement des contacts
3arXiv cs.RO 

DuetHOI : génération de mouvements bimanuels main-objet guidée par le langage, avec planification d'articulation et raffinement des contacts

Un article de recherche intitulé DuetHOI, publié en version 3 sur arXiv (2603.08390), propose un nouveau cadre pour générer automatiquement des mouvements de mains bimanuels interagissant avec des objets articulés, comme l'ouverture d'un tiroir ou la manipulation d'un objet à deux charnières, à partir d'une simple instruction en langage naturel. Le système repose sur quatre modules assemblés en pipeline. ContactVAE prédit d'abord, à partir du texte et de la géométrie de l'objet, où les mains doivent entrer en contact avec sa surface. ArtPlanner utilise cette intention spatiale pour établir une trajectoire d'articulation de référence, c'est à dire comment l'objet doit s'ouvrir ou se déplacer au fil du temps. DualFormer génère ensuite le mouvement global en combinant l'état de l'objet, la position des mains par rapport à celui-ci, et des jetons compacts de pose de main appris par un second module, ManiVAE. Enfin, ProxiRefine corrige localement la trajectoire des deux mains, sans toucher à celle de l'objet, en s'appuyant sur la proximité main-objet mesurée à ce stade pour affiner l'alignement de surface. L'enjeu dépasse la simple animation graphique. La génération de mouvements main-objet réalistes et cohérents en contact sert de données d'entraînement pour l'apprentissage par imitation en robotique, notamment pour les modèles vision-langage-action qui doivent apprendre à manipuler des objets à deux mains, une tâche nettement plus complexe que la préhension à une main sur objet rigide, faute de coordination bimanuelle et de suivi de l'évolution de l'articulation. Les résultats rapportés montrent que DuetHOI dépasse trois méthodes de référence adaptées sur la plupart des métriques de contact et de cohérence main-objet, avec un avantage particulièrement marqué sur les scénarios bimanuels avec objets articulés, précisément le cas le plus difficile. Le papier s'inscrit dans un courant de recherche en génération de mouvements humains conditionnée par le langage, où la modélisation d'objets rigides à une main est déjà relativement mature mais où la coordination bimanuelle sur objets articulés reste peu traitée par les architectures existantes, qui encodent objet et mains dans une séquence unique de haute dimension mal adaptée aux échelles différentes du problème. Aucune date de disponibilité de code ni application robotique concrète n'est mentionnée dans l'abstract, ce qui situe pour l'instant ces travaux au stade de la recherche méthodologique plutôt que du déploiement.

RecherchePaper
1 source
G-MAPP : planification et perception multi-agents accélérées par GPU pour la génération de mouvement réactif
4arXiv cs.RO 

G-MAPP : planification et perception multi-agents accélérées par GPU pour la génération de mouvement réactif

G-MAPP (GPU-accelerated Multi-Agent Planning and Perception) est un framework de génération de mouvement réactif présenté dans un preprint arXiv (2606.12579) publié en juin 2026. Le système cible un problème persistant en robotique manipulatrice : produire des trajectoires sans collision en temps réel dans des environnements non structurés et dynamiques. L'architecture repose sur deux composants GPU : un moteur de modélisation du monde alimenté par des capteurs de profondeur grand public, et un planificateur par champs vectoriels permettant une exploration parallèle quasi-globale des états. Validé sur un bras Franka Emika 7 axes (7-DoF), le système affiche un gain de vitesse mesuré jusqu'à 5x par rapport à la version CPU équivalente, avec des évitements de collision réussis dans des configurations physiques simples et complexes. Le point dur que G-MAPP tente de résoudre est double : la charge de calcul pour planifier sur des représentations haute fidélité du monde, et le délai d'intégration entre la perception et le planificateur. Historiquement, les architectures existantes choisissaient entre planification globale (précise mais lente, réservée aux environnements statiques) et planification locale conservative (rapide mais myope). En fusionnant les deux boucles sur GPU, G-MAPP vise à éliminer ce compromis. Pour un intégrateur industriel ou un COO de ligne d'assemblage, cela ouvre la voie à des cellules robotiques reconfigurables sans reprogrammation manuelle, avec des bras capables de coexister avec des opérateurs humains en mouvement, à condition que les performances tiennent sur des géométries de charge plus représentatives. La génération de mouvement réactif mobilise depuis plusieurs années des approches concurrentes : planificateurs neuronaux (MPINETS, MotionBenchMaker), champs de potentiel riemanniens (RMP-Flow, STORM), et méthodes MPC sur horizon glissant. G-MAPP se positionne dans la lignée des planificateurs par champs vectoriels accélérés, avec la particularité de traiter la perception et la planification dans le même pipeline GPU. Le Franka Emika reste une plateforme académique standard, et aucun partenariat industriel ni roadmap de commercialisation n'est mentionné dans le preprint : il s'agit d'une contribution de recherche à confirmer sur des bras à charge utile plus élevée, des vitesses d'obstacles plus importantes, et des environnements multi-agents. Les prolongements naturels incluent les architectures multi-bras et l'intégration avec des pipelines de perception sémantique.

RecherchePaper
1 source