
X-NavDP : généralisation d'une politique de diffusion de navigation à de nouveaux comportements et corps grâce à un appariement repondéré par Q-score de groupe
Wandercraft, Exotec, Pollen et Enchanted Tools n'apparaissent pas dans cette étude, qui reste un travail de recherche en robotique mobile publié sur arXiv (2607.28560v1). Voici l'article :
Une équipe de recherche a publié X-NavDP, une politique de navigation par diffusion entraînée pour généraliser à des robots de morphologies différentes, accompagnée d'un nouveau cadre de post-entraînement par renforcement baptisé GQRM (Group Q-score Reweighted Matching). Le papier, disponible sur arXiv sous la référence 2607.28560v1, rapporte des gains de performance substantiels : le taux de réussite en navigation passe de 61,20 % à 84,28 % en simulation, et de seulement 10 % à 65 % sur des cas difficiles en conditions réelles. Le code et les modèles sont mis à disposition publiquement sur une page de projet dédiée (yty-sky.github.io/x-navdp-project-page).
Cette avancée s'attaque à un problème central pour l'industrie robotique : les politiques de navigation par diffusion sont aujourd'hui pré-entraînées sur des démonstrations générées par un planificateur oracle disposant d'une connaissance complète de l'environnement, calibré pour un seul robot type. Cela limite fortement leur capacité à s'adapter à d'autres morphologies ou à des scénarios exigeants comme sortir d'une impasse ou contourner un obstacle long, situations qui demandent des comportements réactifs locaux à partir des seules observations embarquées. Pour les intégrateurs travaillant avec des flottes hétérogènes d'AMR ou de robots mobiles, disposer d'une politique unique capable de généraliser sans démonstrations spécifiques à chaque plateforme réduirait significativement les coûts d'ingénierie et de collecte de données.
Les tentatives précédentes de post-entraînement par renforcement des politiques de diffusion n'apportaient que des améliorations marginales, freinées par la vraisemblance intraitable de ces modèles, qui rend les gradients de politique instables et l'exploration inefficace. GQRM contourne ce verrou grâce à deux mécanismes complémentaires : une stratégie d'exploration auto-amorcée avec perturbation comportementale qui préserve les acquis du pré-entraînement, et une normalisation de groupe des scores Q calculant des valeurs par trajectoire à chaque état pour un appariement de scores pondéré plus efficace. L'entraînement s'est fait en ligne et de façon distribuée sur des robots aux morphologies variées, une méthodologie qui pourrait inspirer d'autres équipes travaillant sur le transfert cross-embodiment.
Dans nos dossiers




