Aller au contenu principal
Structured-Diffuser : diffusion à priors structurés conditionnés par la tâche pour la planification de mouvement
RecherchearXiv cs.RO 

Structured-Diffuser : diffusion à priors structurés conditionnés par la tâche pour la planification de mouvement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente Structured-Diffuser, un planificateur de mouvement par diffusion décrit dans la troisième version d'un article déposé sur arXiv (2509.25685v3). Au lieu du bruit gaussien isotrope classique utilisé par les planificateurs de diffusion standards, la méthode dérive la moyenne et la covariance de la corruption d'un modèle de planification par processus gaussien (GPMP), encodant ainsi directement la fluidité de la trajectoire et la sémantique de la tâche dans le bruit lui-même. Une architecture à deux niveaux extrait d'abord des états clés épars et leur timing pour instancier cet a priori gaussien structuré, puis débruite la trajectoire complète en s'appuyant sur ces états comme observations bruitées. Sur trois tâches de planification de mouvement testées, les auteurs rapportent une meilleure réussite des tâches, un entraînement plus rapide et, selon les cas, des gains en efficacité des données et en fluidité de trajectoire, avec en complément une démonstration sur un humanoïde physique G1.

Pour les équipes de recherche en robotique, ce travail confirme une tendance à vouloir réduire la dépendance des planificateurs de diffusion à de gros volumes de données d'entraînement, un frein connu pour les modèles vision-langage-action comme Pi-0 ou GR00T N2. Les études d'ablation des auteurs indiquent qu'un bruit explicitement structuré apporte un bénéfice distinct du simple conditionnement neuronal du réseau de débruitage, ce qui nuance l'idée qu'un réseau bien conditionné suffirait à compenser un bruit générique. Le test sur un G1 réel reste toutefois une démonstration de recherche et non un déploiement produit, dans un domaine où l'écart entre performance en simulation et robustesse en conditions réelles demeure la principale zone d'incertitude.

La méthode s'inscrit dans la lignée des planificateurs de diffusion appliqués à la robotique, en les hybridant avec l'optimisation classique de trajectoire par processus gaussien de type GPMP. Elle se positionne comme une alternative de bas niveau, centrée sur la génération de trajectoires physiquement cohérentes, face aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui apprennent directement des politiques à partir d'entrées visuelles et langagières. Aucun acteur français ou européen n'apparaît dans cette publication, qui reste à ce stade un travail de recherche publié sur arXiv, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement commercial.

À lire aussi

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
1arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source
Modélisation par diffusion optimale pour la planification de mouvement multi-robots
2arXiv cs.RO 

Modélisation par diffusion optimale pour la planification de mouvement multi-robots

Des chercheurs présentent MDOC (Model-Based Diffusion Optimal Control), un planificateur de trajectoires pour flottes multi-robots fondé sur la diffusion, décrit dans un preprint publié sur arXiv (2607.12423). Contrairement aux approches récentes qui traitent la planification de trajectoires comme un problème d'inférence probabiliste et apprennent leurs fonctions de score à partir de larges jeux de données de démonstration, MDOC s'appuie directement sur des modèles de dynamique connus, sans données d'entraînement. Sa mécanique de sécurité combine ces modèles avec des projections contraintes par des Control Barrier Functions (CBF), et le système passe à l'échelle multi-robots grâce à la méthode de Conflict-Based Search (CBS), qui résout les conflits de trajectoires entre agents de façon hiérarchique. Les auteurs rapportent, en simulation, de meilleures performances que des planificateurs de référence en termes d'efficacité d'échantillonnage, de fluidité géométrique des trajectoires et de taux de réussite, tout en réduisant le temps de calcul et en garantissant des trajectoires sans collision. L'enjeu dépasse l'exercice académique : la planification de mouvement multi-robots en environnement continu se heurte à une explosion combinatoire de l'espace des trajectoires conjointes, et les méthodes par diffusion existantes peinent à garantir rigoureusement la faisabilité dynamique et les contraintes de sécurité strictes lors de l'échantillonnage. En s'affranchissant de la dépendance aux données de démonstration tout en conservant des garanties formelles de sécurité, MDOC répond à un frein réel à l'adoption industrielle de ces techniques pour des flottes d'AMR ou de robots collaboratifs, où l'absence de collision n'est pas négociable. Le travail s'inscrit dans la lignée des approches récentes qui recadrent la planification de trajectoires comme un problème d'inférence par diffusion, en s'en distinguant par son caractère "model-based" plutôt que piloté par les données. Il se positionne aussi comme une alternative aux méthodes classiques d'optimisation de trajectoire et de recherche multi-agents. À ce stade, les résultats restent limités à des expériences en simulation ; aucun déploiement sur robots physiques n'est mentionné, ce qui en fait une contribution méthodologique à confirmer avant tout usage en conditions réelles.

RecherchePaper
1 source
Diffusion à somme de coûts avec guidage dynamique pour la planification de mouvement
3arXiv cs.RO 

Diffusion à somme de coûts avec guidage dynamique pour la planification de mouvement

Une équipe de recherche publie en mai 2026 (arXiv:2605.24690) une nouvelle méthode de planification de trajectoires pour la manipulation robotique, basée sur les modèles de diffusion. L'approche, baptisée "Sum of Costs Diffusion with Dynamic Guidance", guide le processus de débruitage du modèle de diffusion par le gradient du coût total de collision, c'est-à-dire la somme des coûts de collision sur l'ensemble de la trajectoire candidate. Autre contribution clé : une heuristique dynamique pour sélectionner l'étape de départ à partir de laquelle ce guidage par gradient est activé. Sur le benchmark Mπnets, un jeu de données de référence pour la planification en environnements encombrés, la méthode obtient les meilleures performances parmi l'ensemble des approches comparées. La généralisation reste le verrou principal de la planification de mouvement en manipulation robotique. Les planificateurs classiques (familles RRT, OMPL) peinent à s'adapter à de nouveaux environnements sans replanification coûteuse, tandis que les approches deep learning souffrent d'une généralisation limitée hors distribution. Le guidage par gradient de coût de collision, appliqué dynamiquement au cours du débruitage, offre une alternative : le modèle ajuste la trajectoire en continu selon la géométrie réelle de la scène, sans retraining. La sélection dynamique du step de départ du guidage adresse un problème connu des modèles de diffusion guidés, le compromis entre force du guidage et diversité des échantillons. Les résultats sur la diversité des configurations de test de Mπnets soutiennent l'hypothèse que cette formulation est plus robuste que les stratégies de guidage par coût ponctuel utilisées dans les travaux antérieurs. Cela dit, l'article est une prépublication non encore révisée par les pairs, et les métriques gagneraient à être validées sur des benchmarks physiques réels. L'intérêt pour les modèles de diffusion en planification robotique s'est accéléré depuis 2023 avec des travaux comme Diffusion Policy (Chi et al.) ou SE(3)-DiffusionFields. Les approches concurrentes directement comparées incluent MPinets et CuRobo (NVIDIA), deux méthodes learning-based de référence sur Mπnets. La méthode proposée s'inscrit dans un courant qui cherche à marier la flexibilité générative des modèles de diffusion avec des contraintes de sécurité physique (évitement de collision) sans passer par un planificateur externe. La prochaine étape logique sera une validation sur hardware réel et des environnements dynamiques, conditions nécessaires pour que ce type d'approche intéresse les intégrateurs industriels.

RecherchePaper
1 source
PccDiffuser : planification de mouvement multi-solutions pour robots à corps continu
4arXiv cs.RO 

PccDiffuser : planification de mouvement multi-solutions pour robots à corps continu

Une équipe de recherche présente PccDiffuser, un cadre de diffusion conditionnelle pour la planification de mouvement des robots continuum, dans un preprint arXiv publié en septembre 2026 (2609.09745v1). Le système apprend une distribution multimodale de trajectoires dans l'espace des configurations et génère plusieurs solutions candidates en parallèle, converties en trajectoire exécutable par allocation temporelle respectant les contraintes des actionneurs. Sa cinématique, modélisée par courbure constante par morceaux avec des coordonnées exponentielles, s'appuie sur un réseau de neurones sur graphe pour encoder un nombre variable d'obstacles et sur une cinématique différentielle analytique intégrée au débruitage pour améliorer précision et dégagement du corps entier. Sur un jeu de test allant de zéro à quatre obstacles, le taux de réussite atteint 91 %, supérieur aux méthodes par échantillonnage ou optimisation, avec un gain d'efficacité de calcul. Des essais sur un robot continuum à trois sections actionné par câbles confirment la planification multi-solutions et l'évitement d'obstacle du corps entier. Les robots continuum, structures souples et hyper-redondantes utilisées en chirurgie mini-invasive, en inspection de zones confinées et en recherche-sauvetage, restent difficiles à piloter automatiquement en raison d'un espace de configuration quasi infini et d'une cinématique non linéaire. Les méthodes classiques par échantillonnage ou optimisation peinent à capturer la multimodalité du problème, c'est-à-dire l'existence de plusieurs chemins valides distincts, et deviennent lentes quand l'environnement se complexifie. En atteignant 91 % de réussite tout en restant plus rapide que ces références, PccDiffuser démontre que les modèles de diffusion, déjà répandus pour les bras robotiques rigides, se transposent aux robots mous. Il s'agit toutefois d'un résultat de recherche en preprint, validé sur un seul robot de laboratoire et un environnement limité à quatre obstacles, et non d'un produit commercial ni d'un déploiement industriel. La planification des robots continuum s'appuyait jusqu'ici sur des solveurs de cinématique inverse et des planificateurs par échantillonnage adaptés au modèle de courbure constante par morceaux, une représentation standard depuis le milieu des années 2000. Les modèles de diffusion, popularisés pour les bras rigides, avaient jusqu'à présent peu été appliqués aux structures continues, faute d'encodage adapté à une cinématique non linéaire et à un nombre variable d'obstacles. Sans acteur industriel ni calendrier annoncé, ce travail de recherche ouvre la voie à des validations sur des robots continuum plus complexes et des environnements encombrés, avant tout transfert éventuel vers des applications comme la chirurgie robotisée ou l'inspection industrielle.

RecherchePaper
1 source