Aller au contenu principal
RecherchearXiv cs.RO 

Planification de trajectoire sans données de trajectoire : une approche guidée par les variétés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose Ariadne, une méthode de planification de trajectoire qui se passe entièrement de données de trajectoires d'experts. L'approche habituelle consiste à entraîner un modèle génératif sur de grandes collections de trajectoires, puis à lui demander, à l'inférence, de produire un chemin exécutable à partir des contraintes de la tâche (point de départ, objectif). Ariadne apprend à la place la variété (manifold) sous-jacente de l'espace d'états, puis construit les trajectoires en exploitant la géométrie de cette variété. L'entraînement ne requiert que des observations d'états, sans séquences d'actions ni chemins complets. Les expériences portent sur Maze2D et sur des benchmarks de planification de mouvement robotique. Selon les auteurs, Ariadne produit des chemins faisables à partir d'une supervision limitée aux états et généralise à des paires départ-objectif jamais vues. Sur une tâche de planification à deux bras en haute dimension, la méthode reste "compétitive" face à des approches supervisées par trajectoires et à des planificateurs classiques, sans aucune donnée de trajectoire. Le résumé ne donne aucun chiffre précis (taux de réussite, temps de calcul, nombre de DOF).

L'enjeu est d'abord économique. Les méthodes génératives par trajectoires dépendent d'une supervision coûteuse : il faut collecter ou synthétiser des démonstrations expertes, ce qui pèse sur le passage à l'échelle. Les auteurs soulignent aussi deux faiblesses connues de ces méthodes : elles se dégradent avec la longueur des séquences et généralisent mal aux contraintes nouvelles, comme un couple départ-objectif absent des données d'entraînement. Si le résultat tient, il réduirait la dépendance à des jeux de démonstrations propriétaires, un goulot d'étranglement pour les intégrateurs qui veulent adapter un planificateur à une nouvelle cellule robotisée. À nuancer : "compétitif" n'est pas "supérieur", et la plupart des évaluations se font en simulation. Maze2D est un banc d'essai de faible dimension, et la tâche à deux bras n'est décrite que de façon qualitative. Les performances en temps de calcul, face à des planificateurs par échantillonnage éprouvés, restent à établir. La robustesse face à des obstacles dynamiques ou à du bruit de perception n'est pas non plus documentée.

Ce travail s'inscrit dans un débat plus large sur le coût des données en robotique. D'un côté, les approches par diffusion et les politiques apprises à partir de démonstrations (imitation learning) ont fait progresser la planification et la manipulation. De l'autre, les planificateurs classiques à base d'échantillonnage, de type RRT ou PRM, n'ont besoin d'aucune donnée mais peinent en haute dimension et dans les espaces contraints. Ariadne se place entre les deux : un apprentissage non supervisé de la géométrie de l'espace d'états, suivi d'une planification qui exploite cette structure. Le papier, publié sur arXiv (2610.08863, version 1), n'annonce ni code ni déploiement industriel. Les prochaines étapes à surveiller sont la validation sur robot réel, des comparaisons chiffrées sur des bras à 7 DOF ou plus, et le test sur des scènes encombrées avec des contraintes de collision changeantes.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

LiftNav : planification de trajectoire par élévation sémantique dans un Gaussian Splatting guidé par TSDF
1arXiv cs.RO 

LiftNav : planification de trajectoire par élévation sémantique dans un Gaussian Splatting guidé par TSDF

Une équipe de chercheurs a publié LiftNav sur arXiv (référence 2605.31376), un système de planification de trajectoires pour robots autonomes en environnements intérieurs inconnus. Le système repose sur une carte duale combinant TSDF (Truncated Signed Distance Function, représentation géométrique précise pour l'évitement d'obstacles) et Gaussian Splatting (GS, méthode de rendu à base de primitives gaussiennes 3D), en s'appuyant sur l'architecture GSFusion comme fondation. À cette base hybride s'ajoutent, en temps réel, une détection d'objets par YOLO, un mécanisme de "lifting" 3D ancré dans le TSDF pour projeter les détections sémantiques dans l'espace volumique, et une optimisation de trajectoire par splines B. Pour améliorer fluidité et sécurité, les auteurs introduisent une pénalité de collision basée sur la hinge loss. Évalué en simulation sur le dataset Replica (environnements intérieurs synthétiques de haute fidélité de Meta), LiftNav atteint un taux de faisabilité de 100% et génère des trajectoires plus courtes qu'un système de référence basé sur les champs de radiance neuraux. Ce résultat s'attaque à un compromis fondamental de la navigation robotique : les représentations classiques comme le TSDF garantissent la sécurité géométrique mais sont aveugles sémantiquement, tandis que les méthodes photorréalistes de type Gaussian Splatting offrent une compréhension visuelle riche mais présentent des géométries floues peu fiables pour l'évitement de collision. LiftNav propose de réconcilier les deux sans recourir à des embeddings 3D denses, souvent coûteux en mémoire et en calcul, ce qui constitue l'argument différenciant central. Pour les intégrateurs robotique, c'est une architecture susceptible de réduire la complexité de déploiement de robots de service dans des espaces non structurés. Il convient toutefois de souligner que ces performances sont mesurées exclusivement en simulation, sans aucune validation sur robot physique rapportée dans cette publication. LiftNav s'inscrit dans une dynamique de recherche active autour de la navigation sémantique : des travaux comme ConceptFusion ou LERF intègrent des embeddings de type CLIP dans des NeRF ou des GS, mais au prix d'une empreinte computationnelle élevée. L'approche par lifting TSDF retenue ici est plus légère, au potentiel détriment d'une richesse sémantique fine. Les concurrents directs incluent les pipelines combinant SLAM 3D avec des couches de détection dense comme Mask3D, ainsi que les systèmes NeRF-Nav. La prochaine étape naturelle serait une validation sur plateforme physique pour quantifier le gap sim-to-real, point clé que les auteurs ne mentionnent pas dans cet abstract.

RecherchePaper
1 source
SPADE : planification de trajectoires guidée par croquis et augmentée par des experts en diffusion
2arXiv cs.RO 

SPADE : planification de trajectoires guidée par croquis et augmentée par des experts en diffusion

Une équipe de chercheurs a publié sur arXiv (référence 2506.03512) un framework baptisé SPADE, pour Sketch-guided Path Planning Augmented with Diffusion Experts, destiné à améliorer la planification de trajectoires pour les robots mobiles autonomes (AMR). Le système repose sur deux contributions distinctes : un outil d'annotation repensé de zéro sur ROS 2, permettant une collecte de démonstrations expertes plus robuste, et une stratégie d'entraînement inédite qui intègre une augmentation par diffusion dans des modèles de clonage comportemental (behavioral cloning). Sur les métriques publiées, SPADE affiche une erreur de pose absolue (APE) inférieure de 39,1 % et une distance FID (Fréchet Inception Distance) réduite de 33,5 % par rapport aux méthodes de référence, avec 93,8 % de paramètres entraînables en moins. Ce résultat est notable parce qu'il attaque un compromis longtemps considéré comme structurel dans le domaine : les modèles de diffusion généralisent bien à des environnements non vus mais sont trop lents pour un déploiement embarqué en temps réel, tandis que les modèles de clonage comportemental légers s'exécutent rapidement mais peinent à sortir de leur distribution d'entraînement. SPADE prétend combiner les deux propriétés sans sacrifier l'une pour l'autre, ce qui, si confirmé sur des benchmarks tiers, représenterait un levier direct pour les intégrateurs d'AMR en logistique et en industrie manufacturière. La réduction drastique du nombre de paramètres ouvre également la voie à un déploiement sur du matériel embarqué contraint. Les approches actuelles de planification avec préférences humaines s'appuient typiquement soit sur du reward engineering manuel, soit sur des solutions matérielles lourdes. Le clonage comportemental via imitation learning a émergé récemment comme alternative, avec des travaux de référence que SPADE cite sans les nommer dans l'abstract. L'outil d'annotation basé sur ROS 2 adresse spécifiquement le problème de la qualité des démonstrations, souvent le maillon faible des pipelines d'imitation learning. Il s'agit pour l'instant d'un preprint sans évaluation indépendante publiée ; les ablations présentées dans l'article restent auto-évaluées par les auteurs, ce qui impose une lecture critique avant toute intégration dans un pipeline de production.

RecherchePaper
1 source
DexPolicy : exploration planifiée pour la manipulation dextre guidée par trajectoires
3arXiv cs.RO 

DexPolicy : exploration planifiée pour la manipulation dextre guidée par trajectoires

Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.00360) DexPolicy, une méthode qui traite l'amplitude du bruit d'action comme une fonction explicite du nombre de pas d'entraînement, décroissant d'une exploration large vers une exploration étroite. Elle est testée dans le cadre de ViViDex, où l'apprentissage par renforcement (RL) affine des trajectoires main-objet extraites de vidéos humaines. Dans ce cadre, les runs PPO de référence finissent après 5 millions de pas près de leur bruit initial. La perte, l'architecture, la récompense et l'optimiseur restent identiques. Trois variantes sont comparées : PPO, une continuation GRPO sans critique et une version de PPO à politique paramétrée par flow (FPO). En simulation, sur cinq objets YCB et trois graines, le succès déterministe moyen passe de 49,4 % à 68,1 % pour FPO, de 14,1 % à 45,4 % pour GRPO et de 32,0 % à 35,7 % pour PPO. Sur robot réel, un bras RealMan RM75 équipé d'une main Inspire RH56, 360 essais sur trois objets font passer le succès moyen de 25,0 % à 85,0 % (FPO), de 10,0 % à 63,3 % (GRPO) et de 8,3 % à 43,3 % (PPO), avec un modèle entraîné par couple objet-méthode. Le code est publié. Le résultat intéresse les équipes qui cherchent à rendre le RL dextre fiable. Le bruit qui aide à découvrir les contacts doigt-objet gêne ensuite le contrôle fin de l'objet. Le gain vient d'un seul paramètre, ce qui en fait un levier peu coûteux à reproduire. Le gain est très inégal selon l'algorithme : il est marginal pour PPO en simulation (+3,7 points) et massif pour FPO et GRPO. Les auteurs notent aussi que le retour d'entraînement, le succès déterministe et la tolérance au bruit d'exécution se dissocient. Ils en déduisent qu'un calendrier d'exploration se juge sur le succès terminal dans les conditions d'exécution visées, tâche par tâche. Pour un intégrateur, c'est un rappel que les courbes d'entraînement ne prédisent pas la performance réelle. Le calendrier retenu pour PPO bat aussi une simple décroissance linéaire aux mêmes bornes sur trois objets, mais l'écart n'est établi que sur ces trois objets. Il faut toutefois relativiser la portée. La validation réelle porte sur trois objets, une seule plateforme et un modèle par condition, sans test de généralisation à des objets inédits. Les échantillons sont petits : 360 essais répartis sur trois méthodes, avant et après calendrier, et trois objets. Le travail prolonge ViViDex, qui apprend la manipulation à partir de vidéos humaines, dans un champ où les politiques dextres par RL et les approches VLA ou par diffusion et flow se multiplient. Aucun acteur industriel européen n'est impliqué. Il s'agit d'un preprint, sans déploiement ni produit annoncé, et les prochaines étapes dépendront d'une réplication sur d'autres mains, d'autres tâches et d'objets hors du jeu YCB.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Convex-Neural RRT* : échantillonnage guidé par apprentissage pour une planification de trajectoire robotique rapide et fiable
4arXiv cs.RO 

Convex-Neural RRT* : échantillonnage guidé par apprentissage pour une planification de trajectoire robotique rapide et fiable

Une équipe de recherche a publié en mai 2026 sur arXiv (réf. 2605.25006) les travaux sur Convex-Neural RRT, une variante de l'algorithme de planification de chemin RRT intégrant un guidage neuronal pour accélérer la recherche de trajectoires optimales. Le principe : un réseau de neurones prédit des régions "waypoints" prometteuses autour des chemins de haute qualité, puis des zones convexes sont extraites de ces prédictions pour concentrer l'exploration sur les zones géométriquement pertinentes tout en maintenant une couverture globale de l'espace. Évalué sur 18 cartes de benchmark réparties en 3 types d'environnements, l'algorithme réduit le temps de calcul de 30 à 75 % par rapport aux variantes neurales existantes (Neural RRT, Neural Informed RRT), et de 88 à 98 % par rapport à LTA. La longueur des chemins produits diminue en moyenne de 5 % par rapport au RRT classique, avec des gains plus marqués dans les environnements complexes. Le taux de succès reste supérieur à 99 % quelle que soit la densité d'obstacles. Ces résultats s'attaquent à un goulot d'étranglement bien documenté du planning probabiliste : les méthodes à base d'échantillonnage sont théoriquement complètes mais lentes à converger vers des solutions de qualité, ce qui freine leur déploiement embarqué où le temps de réponse est critique (robots mobiles, bras industriels, véhicules autonomes). L'utilisation de zones convexes comme proxy des prédictions neuronales est une décision d'ingénierie notable : elle préserve les garanties de convergence de RRT* tout en rendant l'heuristique géométriquement tractable, évitant les dérives habituelles des méthodes purement apprises qui échouent hors distribution. À noter que les gains de 5 % en longueur de chemin restent modestes et que les benchmarks sont réalisés en simulation ; aucune validation sur robot physique n'est rapportée. RRT (Rapidly-exploring Random Tree Star), introduit par Karaman et Frazzoli en 2011, est devenu un standard en planification de mouvement robotique. Ses variantes neurales récentes ont cherché à apprendre des heuristiques d'échantillonnage depuis des données de trajectoires, mais au prix d'une surcharge computationnelle qui annulait souvent le bénéfice. Convex-Neural RRT s'inscrit dans cette lignée en ajoutant une contrainte géométrique qui assainit les prédictions. Les concurrents directs incluent LTA, IRRT et les approches par diffusion (Motion Planning Diffusion). Cette publication préliminaire ne mentionne aucun déploiement industriel ; les prochaines étapes attendues sont une validation sur robots physiques et une extension aux espaces de configuration de haute dimension, notamment les bras 6-7 DOF et les humanoïdes.

RecherchePaper
1 source