Aller au contenu principal
RecherchearXiv cs.RO 

DGT-Map : cartographie directionnelle globale de praticabilité par apprentissage multitâche pour véhicules hétérogènes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente DGT-MAP dans un preprint publié sur arXiv (arXiv:2609.30461v1), un système de cartographie de la traversabilité hors-piste qui tient compte à la fois de la direction de déplacement et du type de véhicule. Par apprentissage auto-supervisé à partir d'images RGB-D et de signaux de locomotion, il génère des cartes de coût indexées par cap, utilisables par un planificateur sensible à la direction. Son architecture combine un tronc commun multi-tâches, qui apprend des traits de terrain partagés entre plusieurs véhicules d'entraînement, et des têtes de prédiction propres à chaque plateforme. Testé en simulation via une pile de navigation Hybrid A*, sur des pentes franchissables en descente mais pas en montée et une crête traversable par certains véhicules seulement, DGT-MAP obtient le meilleur taux de réussite, ou un score ex aequo, face à des références géométriques, binaires et apprises mais non directionnelles.

L'enjeu tient au fait que la plupart des cartes de traversabilité globales attribuent un coût isotrope unique à chaque zone, sans distinguer le sens de parcours, alors qu'une pente ou une crête peut être franchissable dans un sens et pas dans l'autre. Les estimateurs appris existants sont en outre généralement entraînés séparément pour chaque véhicule, ce qui empêche de mutualiser les représentations de terrain entre plateformes. Pour des flottes hétérogènes de robots terrestres ou d'AMR opérant hors-piste (agriculture, défense, inspection), cela ouvre la voie à un modèle partagé unique couvrant plusieurs types de véhicules, avec un comportement adapté à chacun, réduisant potentiellement les données et le temps d'entraînement nécessaires. Ces résultats restent toutefois cantonnés à la simulation, sans déploiement sur robot réel évoqué, ce qui appelle à la prudence.

L'estimation de traversabilité hors-piste reposait jusqu'ici soit sur des heuristiques géométriques ou des cartes binaires, isotropes et indifférentes au véhicule, soit sur des modèles appris à partir de capteurs RGB-D et de signaux proprioceptifs mais entraînés véhicule par véhicule. DGT-MAP combine ces deux limites en un seul cadre auto-supervisé, mêlant apprentissage multi-tâches sur flotte hétérogène et cartes directionnelles, une piste qui rejoint les efforts plus larges de la recherche en autonomie robotique hors-piste. Les auteurs ne mentionnent aucun essai matériel ni calendrier de déploiement réel: la validation sur robots physiques reste l'étape suivante pour confirmer que les gains observés en simulation se transposent au terrain.

Dans nos dossiers

À lire aussi

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure
1arXiv cs.RO 

Mono-Hydra++ : construction en temps réel de graphes de scènes monoculaires par apprentissage multi-tâches pour la cartographie 3D intérieure

Des chercheurs ont publié en mai 2026 (arXiv:2605.17661) Mono-Hydra++, un pipeline temps réel capable de construire des graphes de scène 3D hiérarchiques d'intérieurs en n'utilisant qu'une caméra RGB monoculaire et une IMU, sans capteur de profondeur actif. Le coeur du système repose sur M2H-MX, un modèle multi-tâches fondé sur DINOv3 qui estime simultanément la profondeur et la sémantique des images. Ces estimations alimentent un front-end d'odométrie visuelle-inertielle (VIO) enrichi de contraintes de profondeur prédites creuses, d'un masquage sémantique des zones dynamiques et d'un alignement temporel tenant compte de la pose, avant fusion volumétrique dans le backend Mono-Hydra. Sur le sous-ensemble d'évaluation Go-SLAM/ScanNet, le système affiche 1,6 % d'erreur de trajectoire en moins que le meilleur baseline RGB-D testé ; sur le benchmark calibré 7-Scenes, il réduit l'ATE moyen de 29,8 % par rapport au meilleur concurrent calibré. Le modèle de perception M2H-MX-L, exporté en ONNX/TensorRT FP16, tourne à 25,53 FPS sur un Jetson Orin NX 16 Go, et le pipeline a été validé dans un déploiement réel dans un bâtiment ITC avec une caméra RealSense RGB + IMU. L'impact industriel est direct pour les plateformes à contraintes sévères : drones d'inspection, robots humanoïdes légers et AMR embarquant peu de puissance. Jusqu'ici, la construction de graphes de scène 3D, qui organisent l'espace en objets, pièces et relations spatiales, nécessitait des capteurs actifs (RGB-D ou LiDAR) impraticables dès que le payload ou la consommation électrique sont limités. Mono-Hydra++ démontre qu'il est possible d'atteindre, voire de dépasser, la précision de ces baselines lourds avec une seule caméra et une IMU bas coût. Pour un intégrateur ou un COO industriel, cela signifie une réduction substantielle du coût matériel embarqué et l'ouverture de cas d'usage où le RGB-D n'est pas envisageable. Il convient toutefois de noter que les résultats sont issus de benchmarks académiques standardisés : la robustesse sur des scènes industrielles non contrôlées, avec éclairages difficiles ou textures répétitives, reste à confirmer dans des conditions opérationnelles réelles. Mono-Hydra++ s'inscrit dans la lignée du système Hydra du MIT, qui a posé les bases de la représentation hiérarchique en graphe de scène pour la robotique. L'utilisation de DINOv3 comme backbone de vision fondationnelle est cohérente avec la tendance forte à extraire simultanément géométrie et sémantique depuis des modèles pré-entraînés à grande échelle. Sur ce terrain, les concurrents directs incluent les systèmes basés sur RGB-D comme Go-SLAM, iMAP ou NICE-SLAM, ainsi que des approches VIO-sémantiques récentes, mais peu proposent la combinaison complète cartographie métrique, sémantique et graphe de scène en temps réel sur matériel embarqué contraint. En tant que preprint arXiv non encore évalué par les pairs, les prochaines étapes attendues sont la publication en conférence (IROS, ICRA), des tests sur plateformes aériennes effectives et une éventuelle intégration dans des stacks robotiques open-source comme ROS 2.

UELes constructeurs européens d'AMR légers et de drones d'inspection pourraient à terme réduire leurs coûts matériels embarqués en remplaçant les capteurs RGB-D par une caméra monoculaire, sous réserve de validation dans des conditions industrielles non contrôlées.

RecherchePaper
1 source
Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile
2arXiv cs.RO 

Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile

Des chercheurs publient SBP (Seeing the Bigger Picture), une méthode d'apprentissage de politiques pour la manipulation mobile fondée sur une carte 3D de caractéristiques latentes plutôt que sur de simples images, documentée sur arXiv sous la référence 2510.03885 en quatrième version. La méthode fusionne de manière incrémentale des observations multi-vues dans une grille de caractéristiques propre à chaque scène ; un décodeur pré-entraîné reconstruit des embeddings cibles à partir de ces caractéristiques, permettant d'optimiser la carte en ligne pendant l'exécution de la tâche. La politique, entraînable par clonage comportemental ou apprentissage par renforcement, traite cette carte comme variable d'état. Sur une tâche de manipulation séquentielle sur table, SBP améliore le taux de réussite de 15 % par rapport à une politique fondée uniquement sur des images, dans des scènes déjà vues comme inédites. Ce résultat cible une limite connue des politiques de type VLA (vision-language-action), qui raisonnent généralement image par image et perdent toute mémoire de ce qui sort du champ de la caméra. Pour un robot mobile devant se souvenir d'un objet vu dans une autre pièce ou enchaîner des sous-tâches dans la durée, cette absence de mémoire spatiale persistante est un frein concret. En montrant qu'une représentation 3D explicite et réoptimisable en continu surpasse une politique purement image-vers-action, l'étude suggère que le raisonnement spatial long-terme ne se résoudra pas seulement en augmentant modèles et données : la structure de la représentation d'état compte, un signal utile pour les intégrateurs de robots mobiles et humanoïdes. Ce travail s'inscrit dans une recherche plus large combinant cartographie 3D (voxels, champs de caractéristiques, représentations type NeRF) et apprentissage de politiques, en alternative aux approches VLA tout-image qui dominent les annonces du secteur. Le résumé ne précise ni institution ni plateforme robotique commerciale associée : il s'agit d'une contribution académique publiée sur arXiv, déjà révisée au moins quatre fois, signe d'un travail encore en affinement plutôt que d'un produit fini. Aucune date de déploiement ni partenariat industriel n'est mentionné ; la portée reste celle d'une preuve de concept en laboratoire, sans indication de transfert vers un robot physique déployé à grande échelle.

RecherchePaper
1 source
LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne
3arXiv cs.RO 

LatentAM : cartographie d'attention gaussienne latente en temps réel et à grande échelle par apprentissage de dictionnaire en ligne

Une équipe de recherche a publié une version révisée de l'article LatentAM sur arXiv (référence 2602.12314), qui présente un système de cartographie 3D par Gaussian Splatting en ligne destiné à la perception robotique en vocabulaire ouvert. À partir d'un flux RGB-D continu, chaque primitive gaussienne reçoit un vecteur de requête compact, converti en embedding de modèle vision-langage (VLM) approximatif via un mécanisme d'attention couplé à un dictionnaire appris en ligne, sans pré-entraînement ni décodeur spécifique à un VLM donné. Pour tenir sur de longues trajectoires, la carte est gérée par hachage de voxels : une zone locale active est optimisée sur GPU, tandis que la carte globale reste stockée et indexée sur CPU afin de borner la mémoire GPU consommée. Sur des benchmarks publics et un jeu de données maison à grande échelle, LatentAM dépasse les méthodes de référence en fidélité de reconstruction des caractéristiques, tout en tournant à une vitesse quasi temps réel de 12 à 35 images par seconde, code et page projet étant déjà publics. L'enjeu pour l'industrie tient au découplage proposé entre carte sémantique et modèle VLM : la plupart des pipelines existants figent le modèle dès l'entraînement, obligeant à redistiller toute la carte à chaque changement. En rendant cette étape agnostique au modèle et sans pré-entraînement dédié, l'approche permettrait aux intégrateurs de faire évoluer leurs modules de perception, y compris vers de futurs modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sans reconstruire toute la pile cartographique. La vitesse annoncée, jusqu'à 35 images par seconde, vise un traitement embarqué plutôt qu'un post-traitement hors ligne, un point clé pour des robots mobiles ou humanoïdes devant comprendre une scène en temps réel. Il s'agit toutefois d'un résultat évalué sur benchmarks et données internes, pas d'un déploiement en production, la robustesse en environnement industriel non contrôlé restant à démontrer. LatentAM s'inscrit dans la continuité des travaux récents mêlant Gaussian Splatting et distillation de features VLM pour la cartographie sémantique de scènes, une famille de méthodes qui couplent généralement chaque élément de carte à un modèle précis, au prix d'un réentraînement à chaque mise à jour. En substituant un dictionnaire appris en ligne à un décodeur spécifique, les auteurs cherchent à lever ce verrou tout en maîtrisant l'empreinte mémoire GPU grâce au hachage de voxels. La mention « replace » sur arXiv signale une version révisée d'une soumission antérieure, preuve d'itérations en cours sur la méthode ; code et page projet étant déjà accessibles, la communauté pourra en tester la reproductibilité, mais aucun calendrier d'intégration sur une plateforme robotique commerciale n'est évoqué à ce stade.

RecherchePaper
1 source
CableVLA : apprentissage de représentations globales-locales assisté par simulation pour le guidage de câbles
4arXiv cs.RO 

CableVLA : apprentissage de représentations globales-locales assisté par simulation pour le guidage de câbles

Des chercheurs présentent CableVLA, un framework vision-langage-action (VLA) de bout en bout dédié au routage de câbles, une tâche qui combine le contrôle de la topologie globale du câble et la gestion de contacts locaux changeants. Le système repose sur deux modules: TopoHead, qui distille des informations de physique au niveau des nœuds ainsi que la topologie actuelle et future du câble dans un contexte visuel causal exploité par l'expert d'action, et TacSense, qui combine des branches image et taxel pour apprendre la dynamique de contact à partir de réseaux résistifs, supervisées par des données cinématiques et des événements de contact issus du simulateur. Une porte de contact active des résidus force-tactiles qui affinent les huit prochaines actions du bras et de la pince d'une politique conditionnée par la topologie et gelée. Sur 345 évaluations menées dans le simulateur physique MuJoCo, le taux de réussite passe de 62,6% pour la politique visuelle de référence Pi-0.5-V à 84,9% avec CableVLA. TacSense montre par ailleurs des gains marqués dans la détection des transitions de glissement par rapport à une base CNN-LSTM de taille comparable, avantage qui se maintient même lorsque l'encodeur est figé. Le papier, publié sous la référence arXiv 2609.25606v1, complète ces résultats par une évaluation de la prédiction topologique et par 57 tâches tactiles. Ce travail illustre une approche alternative à la simple mise à l'échelle de données réelles pour entraîner des politiques VLA: injecter, en amont, une supervision "privilégiée" issue de la simulation (topologie du câble, événements de contact) que le robot ne peut pas mesurer directement en conditions réelles. Pour les intégrateurs travaillant sur le câblage automobile, l'assemblage électronique ou les harnais industriels, où la manipulation d'objets déformables reste un point faible des politiques génériques, ce résultat suggère une voie pour combler l'écart entre démonstration et robustesse. Il faut toutefois noter que le gain de performance annoncé provient uniquement d'évaluations en simulation MuJoCo, et non d'un déploiement à grande échelle sur robot réel. CableVLA s'inscrit dans la lignée des politiques génériques de manipulation de type Pi-0 et Pi-0.5, développées par Physical Intelligence, ainsi que dans la mouvance plus large des modèles VLA tels que GR00T N2 de NVIDIA ou Helix de Figure, mais se distingue en ciblant spécifiquement la manipulation d'objets déformables plutôt que d'objets rigides. Les auteurs annoncent des comparaisons cross-simulateurs et des tests sur robot réel pour évaluer le transfert zero-shot face à des changements de dynamique et de capteurs, sans toutefois préciser de calendrier ni de partenaire industriel, le travail restant à ce stade une démonstration de recherche.

RechercheOpinion
1 source