EmbodiedDiffusion : diffusion visuelle guidée par la franchissabilité pour la navigation de robots hétérogènes
Des chercheurs présentent EmbodiedDiffusion, un framework basé sur la diffusion qui prédit simultanément des cartes de franchissabilité (traversability) et génère des trajectoires directement à partir d'images RGB, sans carte ni planificateur séparé. Le système distille les connaissances sémantiques d'un modèle vision-langage (VLM) enseignant vers un modèle étudiant léger pendant l'entraînement, ce qui permet une inférence sans prompt, en temps réel, une fois déployé. Un mécanisme de conditionnement modulaire basé sur FiLM isole le raisonnement spécifique à chaque plateforme robotique dans un sous-ensemble compact et entraînable du réseau, sans toucher au backbone visuel ni au modèle de diffusion de trajectoire. Testé en environnements intérieurs sur des robots quadrupèdes et aériens, le système atteint un taux de réussite de navigation de 80 à 100% en régime de données complètes, avec un temps d'inférence de 90 millisecondes, et s'adapte à une nouvelle plateforme robotique avec seulement 10 minutes de collecte de données visuelles. Il s'agit d'une quatrième version révisée d'un article déposé sur arXiv, donc d'un travail académique et non d'un produit commercialisé.
L'intérêt principal tient à l'unification de deux tâches habituellement traitées séparément, l'estimation de franchissabilité et la planification de trajectoire, dans un seul modèle bout-en-bout qui se passe de cartographie lourde et de réglage manuel. Pour les intégrateurs travaillant avec des flottes hétérogènes (drones, quadrupèdes, à terme humanoïdes), la promesse clé est la portabilité rapide entre plateformes robotiques sans réentraînement complet, un point de friction connu des pipelines de navigation actuels. Le chiffre de 90 ms d'inférence, s'il se confirme hors laboratoire, positionnerait l'approche comme compatible temps réel sur du matériel embarqué, un critère souvent absent des démonstrations VLM à base de prompts.
Les approches dominantes en navigation autonome reposent soit sur des VLM pilotés par prompts, coûteux en latence, soit sur des pipelines découplés associant cartographie SLAM et planificateurs classiques, longs à déployer et à calibrer par robot. EmbodiedDiffusion s'inscrit dans la tendance plus large des modèles vision-action (VLA) qui cherchent à remplacer ces chaînes modulaires par un apprentissage de bout en bout, dans la lignée des travaux sur la généralisation cross-embodiment. Les résultats restent pour l'instant limités à des environnements intérieurs contrôlés avec deux types de plateformes ; leur validation sur des cas industriels réels et sur davantage de morphologies robotiques reste une étape à venir.
Dans nos dossiers




