Aller au contenu principal
RecherchearXiv cs.RO 

Apprendre à conduire sur Mars : estimation visuelle multimodale de la franchissabilité pour la navigation hors Terre

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un consortium de chercheurs publie le 22 septembre sur arXiv (2609.24952) un nouveau jeu de données et une méthode d'estimation de la traversabilité des terrains pour la navigation martienne. Depuis son atterrissage dans le cratère Jezero, le rover Perseverance de la mission Mars 2020 a parcouru 45 kilomètres en 500 sols, entre dunes de sable, zones rocheuses et affleurements de roche plate, sous contrôle humain ou via son planificateur embarqué ENav. Le jeu de données assemblé à partir de ces trajets combine images stéréo en niveaux de gris, poses, mesures d'accéléromètre, angles de la suspension rocker-bogie, ainsi que des estimations d'inclinaison et de glissement des roues. Entraîné sur ces données multimodales, le modèle proposé, sensible à l'incertitude, atteint un AUROC de 0,874 et un score F1 de 0,758 sur le jeu Mars 2020, devançant la meilleure méthode existante de 0,058 et 0,156 point respectivement, avec les meilleures précision et rappel moyens. Les représentations visuelles obtenues ont ensuite été intégrées au planificateur ENav et testées sur un banc d'essai physique de rover.

Ce travail comble un manque concret pour l'autonomie robotique hors monde connu: l'absence de jeux de données à grande échelle pour entraîner des systèmes de navigation par apprentissage dans des environnements où la latence de communication interdit tout télépilotage réactif. Le gain de performance mesuré sur des données réelles de mission, et non simulées, appuie l'idée que des représentations visuelles apprises peuvent compléter les heuristiques géométriques classiques pour juger de la franchissabilité d'un terrain. Pour les équipes concevant des rovers ou des robots terrestres destinés à des environnements non cartographiés, comme des mines, des sites sinistrés ou d'autres corps planétaires, l'étude confirme la viabilité d'une approche fondée sur l'expérience de conduite multimodale et livre un jeu de référence réutilisable au-delà du seul cas martien.

Le jeu de données s'appuie sur l'exploitation opérationnelle de Perseverance, dont le planificateur autonome ENav a progressivement pris en charge une part croissante des déplacements depuis l'atterrissage en 2021, dans la lignée des systèmes AutoNav utilisés par les précédentes missions Spirit, Opportunity et Curiosity du JPL/NASA. Cette nouvelle approche se positionne comme une extension par apprentissage automatique de méthodes historiquement fondées sur la stéréo-vision géométrique. Les auteurs annoncent la mise à disposition prochaine du jeu de données complet, du code et de vidéos de démonstration sur un site dédié, ouvrant la voie à des comparaisons avec d'autres méthodes de traversabilité alors que de futures missions, retour d'échantillons martiens ou exploration lunaire, devront elles aussi arbitrer entre autonomie embarquée et supervision humaine limitée par la latence.

Dans nos dossiers

À lire aussi

Apprentissage de marges de sécurité adaptatives pour la navigation visuelle
1arXiv cs.RO 

Apprentissage de marges de sécurité adaptatives pour la navigation visuelle

Des chercheurs présentent un nouveau système de sélection de trajectoires pour la navigation robotique en intérieur encombré, détaillé dans un preprint arXiv (2607.18200v1). Le problème ciblé : les marges de sécurité fixes utilisées par les robots mobiles sont mal calibrées, trop conservatrices elles provoquent détours et dépassements de temps, trop permissives elles autorisent des trajectoires limites dangereuses en cas de biais de perception. Les auteurs proposent un "safety critic" conditionné par le contexte qui apprend une préférence de dégagement adaptative pour classer les propositions générées par un planificateur par diffusion à partir d'images RGB-D égocentriques. Le critique combine trois composantes : un terme de sécurité avec pénalité de budget de dégagement et résidu de fonction barrière de contrôle, un terme d'efficacité mêlant lissage et pénalité de détour conditionnée à la sécurité, et un terme d'ancrage aux clearances ESDF réelles pour éviter l'effondrement de la marge apprise. L'entraînement s'appuie sur une géométrie ESDF privilégiée en simulation, puis le modèle est distillé en un sélecteur ne nécessitant que la perception, via une procédure enseignant-élève en deux temps. Sur les benchmarks PointGoal HM3D et MP3D, y compris en transfert cross-dataset, la méthode obtient les meilleurs taux de réussite et scores SPL face à des références par diffusion, par optimisation et par apprentissage par renforcement. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement concret : la plupart des planificateurs par diffusion génèrent déjà des trajectoires diverses et valables, mais peinent à choisir laquelle exécuter en toute sécurité. Une marge de sécurité apprise et adaptative plutôt que codée en dur pourrait réduire les échecs de navigation des robots déployés en environnements réels, entrepôts, usines, intérieurs domestiques, sans réglage manuel site par site. Le transfert direct vers un humanoïde Unitree G1, entraîné uniquement en simulation et sans ajustement spécifique à la tâche, illustre une réduction crédible de l'écart simulation-réel, un point sensible pour les intégrateurs qui restent souvent méfiants face aux démonstrations purement simulées. Ce travail s'inscrit dans la lignée des planificateurs par diffusion pour la navigation, une approche récente qui a gagné du terrain face aux méthodes d'optimisation classiques et au RL, en s'appuyant sur les fonctions barrière de contrôle et les champs de distance signée (ESDF) pour formaliser la sécurité. Le papier reste à ce stade une publication de recherche non revue par les pairs, sans lien annoncé avec un acteur industriel ; aucune date de déploiement produit ni partenariat n'est mentionné.

RecherchePaper
1 source
EmbodiedDiffusion : diffusion visuelle guidée par la franchissabilité pour la navigation de robots hétérogènes
2arXiv cs.RO 

EmbodiedDiffusion : diffusion visuelle guidée par la franchissabilité pour la navigation de robots hétérogènes

Des chercheurs présentent EmbodiedDiffusion, un framework basé sur la diffusion qui prédit simultanément des cartes de franchissabilité (traversability) et génère des trajectoires directement à partir d'images RGB, sans carte ni planificateur séparé. Le système distille les connaissances sémantiques d'un modèle vision-langage (VLM) enseignant vers un modèle étudiant léger pendant l'entraînement, ce qui permet une inférence sans prompt, en temps réel, une fois déployé. Un mécanisme de conditionnement modulaire basé sur FiLM isole le raisonnement spécifique à chaque plateforme robotique dans un sous-ensemble compact et entraînable du réseau, sans toucher au backbone visuel ni au modèle de diffusion de trajectoire. Testé en environnements intérieurs sur des robots quadrupèdes et aériens, le système atteint un taux de réussite de navigation de 80 à 100% en régime de données complètes, avec un temps d'inférence de 90 millisecondes, et s'adapte à une nouvelle plateforme robotique avec seulement 10 minutes de collecte de données visuelles. Il s'agit d'une quatrième version révisée d'un article déposé sur arXiv, donc d'un travail académique et non d'un produit commercialisé. L'intérêt principal tient à l'unification de deux tâches habituellement traitées séparément, l'estimation de franchissabilité et la planification de trajectoire, dans un seul modèle bout-en-bout qui se passe de cartographie lourde et de réglage manuel. Pour les intégrateurs travaillant avec des flottes hétérogènes (drones, quadrupèdes, à terme humanoïdes), la promesse clé est la portabilité rapide entre plateformes robotiques sans réentraînement complet, un point de friction connu des pipelines de navigation actuels. Le chiffre de 90 ms d'inférence, s'il se confirme hors laboratoire, positionnerait l'approche comme compatible temps réel sur du matériel embarqué, un critère souvent absent des démonstrations VLM à base de prompts. Les approches dominantes en navigation autonome reposent soit sur des VLM pilotés par prompts, coûteux en latence, soit sur des pipelines découplés associant cartographie SLAM et planificateurs classiques, longs à déployer et à calibrer par robot. EmbodiedDiffusion s'inscrit dans la tendance plus large des modèles vision-action (VLA) qui cherchent à remplacer ces chaînes modulaires par un apprentissage de bout en bout, dans la lignée des travaux sur la généralisation cross-embodiment. Les résultats restent pour l'instant limités à des environnements intérieurs contrôlés avec deux types de plateformes ; leur validation sur des cas industriels réels et sur davantage de morphologies robotiques reste une étape à venir.

RechercheActu
1 source
Apprentissage continu pour la prédiction de franchissabilité avec adaptation sensible à l'incertitude
3arXiv cs.RO 

Apprentissage continu pour la prédiction de franchissabilité avec adaptation sensible à l'incertitude

Des chercheurs présentent, dans un preprint publié sur arXiv (arXiv:2609.17141v1), un nouveau cadre d'apprentissage continu pour la prédiction de traversabilité des robots mobiles en environnement non structuré, c'est-à-dire la capacité à estimer si un terrain donné peut être franchi sans perte de traction ni instabilité dynamique. Le système combine un modèle génératif de rappel d'expérience, qui permet au robot de conserver la connaissance des terrains déjà rencontrés sans stocker de données brutes, à une estimation de l'incertitude des échantillons générés, utilisée pour guider l'adaptation à de nouveaux environnements. La méthode a été validée en conditions réelles sur un robot à direction par glissement (skid-steering), testé sur une série d'environnements variés, avec des résultats montrant une adaptation progressive aux nouveaux terrains tout en limitant l'oubli catastrophique des terrains précédemment appris. Ce travail cible un verrou concret pour l'autonomie robotique en extérieur : les modèles de traversabilité appris par apprentissage automatique s'ajustent en général mal à un terrain inédit, et lorsqu'ils y parviennent, ils tendent à oublier ce qu'ils savaient des terrains précédents, l'oubli catastrophique. Ce défaut est rédhibitoire pour tout robot destiné à opérer en continu sur des sites hétérogènes (carrières, chantiers, zones agricoles ou d'intervention), où le stockage exhaustif de données de navigation pour du réentraînement périodique est coûteux, voire impossible en embarqué. Une approche capable d'apprendre en ligne, sans rejouer un historique complet, tout en quantifiant sa propre incertitude, intéresse directement les intégrateurs de robots à roues ou chenilles tout-terrain (UGV) confrontés à la variabilité des sols. La prédiction de traversabilité s'appuie traditionnellement sur des capteurs visuels ou proprioceptifs couplés à des réseaux appris hors ligne, une approche qui bute sur la généralisation aux terrains non vus pendant l'entraînement. Le recours à un modèle génératif pour le rejeu d'expérience s'inscrit dans une famille de méthodes de replay génératif étudiées en apprentissage continu, alternative aux approches classiques par mémoire tampon de données brutes. L'article ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit à ce stade d'une contribution de recherche validée en laboratoire sur un seul type de plateforme, sans indication de transfert vers un produit commercial.

RecherchePaper
1 source
Joint apprentissage sur et hors politique pour la navigation vision-langage
4arXiv cs.RO 

Joint apprentissage sur et hors politique pour la navigation vision-langage

Une équipe de chercheurs présente JOP-VLN, un nouveau framework d'apprentissage pour la navigation par instructions en langage naturel (Vision-and-Language Navigation, VLN), où un agent embarqué doit se déplacer dans un environnement physique en suivant des consignes textuelles. L'article, publié sur arXiv (2607.13461v1), combine pour la première fois deux approches jusqu'ici traitées séparément : l'apprentissage par imitation (IL) à partir de démonstrations expertes, renforcé par l'algorithme DAgger pour corriger les erreurs de trajectoire, et l'apprentissage par renforcement (RL) piloté par des récompenses vérifiables pour améliorer le raisonnement et l'exploration. Le pipeline se déroule en trois étapes : acquisition des compétences de base par imitation, génération de trajectoires d'exploration heuristiques via DAgger pour muscler la récupération d'erreurs, puis une phase conjointe on-policy/off-policy combinant échantillonnage de trajectoires à haute entropie et un tri priorisant la correction d'erreurs. Résultat : 69,9% de taux de réussite sur le benchmark VLN-CE R2R et 68,0% sur RxR, un nouveau record sur R2R. Ces chiffres comptent parce qu'ils comblent un angle mort méthodologique de la navigation par modèles vision-langage : la plupart des systèmes actuels choisissent soit l'imitation (stable mais peu exploratoire, sujette à la dérive en cas d'erreur), soit le renforcement (meilleur en exploration mais coûteux et instable à entraîner). Prouver qu'une combinaison structurée des deux surpasse chaque approche isolée est un signal pour les équipes qui développent des agents de navigation embarqués, notamment pour les robots mobiles autonomes (AMR) ou les futurs humanoïdes devant suivre des instructions en environnement non contrôlé, un domaine où la robustesse aux erreurs reste le principal verrou avant tout déploiement réel. Le travail s'inscrit dans la lignée des modèles vision-langage appliqués à la robotique, où des architectures VLA comme GR00T N2 ou Pi-0 cherchent à unifier perception, langage et action. JOP-VLN se positionne spécifiquement sur les benchmarks de référence R2R et RxR, sans annonce de déploiement matériel ni de partenariat industriel à ce stade ; il s'agit pour l'instant d'un résultat de recherche évalué en simulation, la page projet dédiée servant de vitrine aux résultats.

RecherchePaper
1 source