Aller au contenu principal
RecherchearXiv cs.RO 

STAG : une représentation en graphe épars tenant compte de la traversabilité, issue de cartes de coûts en grille pour la navigation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent STAG (Sparse Traversability-Aware Graph), une méthode qui convertit les cartes de coûts en grille (costmaps) utilisées par les rovers autonomes en graphes compacts, afin d'accélérer la planification globale de trajectoire. Le graphe repose sur trois types d'éléments : un squelette topologique construit par axe médian, des nœuds représentatifs pour les zones de traversabilité homogène, et des nœuds de transition placés près des forts gradients de traversabilité. Les arêtes encodent à la fois la géométrie et la difficulté du terrain, de sorte que le calcul tient compte de la longueur du chemin et de la nature du sol. Les auteurs comparent l'algorithme A exécuté sur STAG avec A sur grille dense, sur des cartes de grottes synthétiques, des cartes de mines et le jeu de données DARPA CERBERUS. Sur cinq catégories de benchmarks, soit 203 cartes et 101 200 requêtes, STAG réduit le temps de planification médian d'un facteur 3,4 à 9,9 et la mémoire de pointe par requête d'un facteur 2,1 à 15,4. L'écart médian de longueur de trajectoire par rapport à la grille dense va de -2,9 % à +7,6 %.

Le problème visé est concret pour la robotique mobile en environnement non structuré : la recherche sur grille dense voit son coût de calcul et de mémoire croître avec la surface cartographiée, ce qui devient pénalisant pour des rovers qui explorent de grandes zones, par exemple en mines, grottes ou tunnels, avec un calculateur embarqué limité. Un gain de 3 à 10 fois en temps et jusqu'à 15 fois en mémoire peut permettre une replanification plus fréquente ou l'usage de processeurs plus modestes. Il faut toutefois lire les résultats avec prudence. Les auteurs reconnaissent eux-mêmes un compromis : STAG sacrifie l'optimalité vis-à-vis de la traversabilité de la grille dense au profit de la vitesse. Un écart médian peut masquer des cas défavorables, et le benchmark est en partie synthétique. Aucun essai sur robot réel n'est mentionné dans le résumé. Il s'agit donc d'un résultat de recherche en simulation et sur données enregistrées, pas d'un système déployé.

Le travail s'inscrit dans la lignée des méthodes de réduction de l'espace de recherche (graphes de visibilité, feuilles de route probabilistes, cartes topologiques, squelettes par axe médian) et dans l'effort autour de l'autonomie en milieux souterrains, dont le défi DARPA Subterranean a servi de référence, avec l'équipe CERBERUS comme source de données. L'apport de STAG est de combiner structure topologique et information de traversabilité dans un même graphe, là où beaucoup d'approches compactes traitent surtout la connectivité. Ce type de représentation concerne les acteurs de l'exploration planétaire, de l'inspection minière et de la robotique de terrain. Les suites logiques seraient une validation sur matériel, la gestion de cartes mises à jour en continu et une évaluation face à d'autres planificateurs hiérarchiques. Aucun calendrier n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

Apprentissage de représentations de traversabilité conditionnées par le langage pour une navigation visuelle adaptative

Des chercheurs présentent sur arXiv (2610.11622) LaTraNav, un cadre de navigation visuelle qui apprend des représentations de traversabilité conditionnées par le langage. L'architecture est asynchrone: un modèle vision-langage (VLM) lent produit des représentations latentes de la traversabilité et du but de navigation, tandis qu'un planificateur rapide par flow matching, conditionné sur ces représentations, génère les trajectoires directement dans l'espace pixel. L'entraînement repose sur un pipeline de génération de données en simulation, avec trajectoires contrôlables, qui fournit des observations associées à des instructions en langage naturel, des cartes de traversabilité, des positions de but et des trajectoires variées. Une étape de traduction d'image photoréaliste réduit l'écart visuel avec le monde réel. Les évaluations, menées sur des jeux de données de sources multiples, portent sur la segmentation de traversabilité guidée par le langage et la localisation du but (VLM lent), ainsi que sur la planification adaptative de chemin (planificateur rapide). Le résultat chiffré principal est une cadence de mise à jour des trajectoires multipliée par 6,05 à cadence sémantique identique grâce à l'ordonnancement asynchrone. L'intérêt tient à ce que la traversabilité cesse d'être codée en dur. Les chaînes classiques reposent sur des cartes de coûts explicites ou des masques de segmentation avec des critères prédéfinis, qui exigent des règles manuelles et un réglage minutieux pour chaque robot. Ici, la même perception peut s'adapter aux capacités d'une plateforme ou aux préférences d'un opérateur par simple instruction (par exemple éviter l'herbe, accepter un gravier ou franchir un petit obstacle). Pour les intégrateurs, cela réduit le coût de re-paramétrage d'une flotte hétérogène. Le résultat le plus instructif est que le conditionnement latent surpasse l'usage de masques de segmentation explicites, ce qui nuance l'idée que la sortie intermédiaire interprétable est toujours préférable. Les masques dépendent aussi du point de vue et deviennent obsolètes quand la latence de perception augmente, un problème que l'approche asynchrone contourne en laissant le planificateur rapide corriger la trajectoire entre deux mises à jour sémantiques. Ce travail s'inscrit dans la tendance des architectures à deux vitesses, popularisées en manipulation et en humanoïde par des systèmes comme Helix de Figure ou GR00T de NVIDIA, où un module de raisonnement lent guide un contrôleur rapide. Il transpose cette logique à la navigation visuelle, face aux approches VLM directes, trop lentes pour le contrôle réactif, et aux pipelines de cartes de coûts classiques, plus rapides mais rigides. Il faut toutefois rester prudent: l'entraînement est majoritairement simulé, les données d'évaluation sont des jeux de données et non des déploiements sur robot, et le gain de 6,05 fois mesure une fréquence de mise à jour, pas une réussite de mission. Aucun déploiement sur robot réel, plateforme matérielle ni calendrier de transfert industriel n'est annoncé dans le résumé. La validation sur robot physique, en environnement non structuré et sous latence réelle, sera l'étape décisive.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

État du monde traçable : une représentation d'état tenant compte de la provenance et un cadre de rejeu déterministe pour les systèmes robotiques

Des chercheurs proposent Traceable World State (TWS), une représentation sémantique et un runtime de référence, indépendants du middleware, destinés à rendre l'état du monde d'un robot traçable. Un instantané TWS contient les entités, les relations, les observations, les niveaux de confiance et les métadonnées de révision. Les mises à jour sont validées et produisent chacune un nouvel instantané immuable. Leur ordre permet un rejeu déterministe. Une chaîne de hachage SHA-256 canonique rend les journaux infalsifiables, au sens où toute modification est détectable. L'évaluation couvre la conformité au schéma, les cycles de vie complets d'état, le rejeu et l'injection de fautes. Le cadre passe 38 tests sous Python 3.10 à 3.14 et détecte les enregistrements corrompus, les liens de hachage rompus, les ruptures de séquence et les incohérences de monde. Sur dix définitions de tâches publiques de BEHAVIOR-1K, TWS a importé 153 entités et 146 relations avec validation réussie. Sur 103 trajectoires simulées d'un Unitree G1 dans l'environnement NVIDIA, soit 78 369 images, le rejeu a restitué exactement l'état terminal dans tous les épisodes. Les 412 corruptions injectées sur 412 ont été détectées, pour un surcoût de stockage de 1,72 % par rapport à un simple journal JSONL. L'enjeu touche un angle mort de la robotique de service et d'usine. Un robot qui travaille sur de longues tâches agrège des observations arrivées à des instants différents, avec des confiances variables, et parfois révisées. La plupart des architectures ne gardent que la dernière estimation, ce qui empêche de savoir pourquoi le robot a décidé ce qu'il a décidé. Pour un intégrateur ou un responsable qualité, cette lacune bloque l'analyse d'incidents, l'audit d'exécution et la reproduction d'un comportement défaillant. Un journal infalsifiable avec rejeu exact répond à ces besoins, et peut intéresser les exigences de conformité qui montent autour des systèmes pilotés par des modèles d'IA. Un surcoût de 1,72 % rend l'approche économiquement plausible. Il faut toutefois relativiser. Toute la validation est faite en simulation ou sur des définitions de tâches, sans robot physique, sans perception bruitée réelle et sans mesure de latence en boucle de contrôle. Les 412 corruptions sont synthétiques, donc le taux de détection de 100 % reflète surtout la nature d'une chaîne de hachage face à des fautes que les auteurs ont eux-mêmes conçues. Ce travail s'inscrit dans un mouvement plus large pour auditer les agents incarnés, à mesure que les politiques VLA (vision-langage-action) et les modèles de fondation remplacent les piles logicielles déterministes. Les représentations existantes, comme les graphes de scène sémantiques, les bases de connaissances ou les journaux de middleware de type rosbag dans ROS 2, enregistrent des données brutes ou le dernier état sans modèle commun de provenance ni de révision. TWS se positionne en couche neutre au-dessus de ces outils. Le choix de BEHAVIOR-1K et du G1 simulé s'appuie sur des bancs d'essai publics, ce qui facilite la reproduction par d'autres équipes. Les prochaines étapes logiques sont un test sur matériel réel, une intégration avec des politiques apprenantes et une mesure du coût en production. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé, et il s'agit d'un préprint arXiv en première version, non évalué par des pairs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
KING : réseau neuronal de graphe cinématique tenant compte de l'incarnation pour une représentation unifiée du mouvement des robots à pattes et à roues
3arXiv cs.RO 

KING : réseau neuronal de graphe cinématique tenant compte de l'incarnation pour une représentation unifiée du mouvement des robots à pattes et à roues

Des chercheurs de l'AIST (National Institute of Advanced Industrial Science and Technology, Japon) publient KING, un modèle cinématique basé sur un réseau de neurones à graphes (GNN) capable d'estimer l'odométrie de robots à roues comme à pattes avec un seul et même réseau. Le système, décrit dans un preprint arXiv publié début août 2026, représente l'embodiment du robot (nombre d'articulations, points de contact au sol, roues ou pieds) sous forme de graphe commun, unifiant ainsi des cinématiques jusqu'ici traitées séparément. KING s'appuie uniquement sur une description du robot au format URDF et sur la proprioception embarquée (encodeurs et IMU), sans capteurs extéroceptifs. Entraîné sur des jeux de données couvrant plusieurs types de robots, il peut ensuite s'adapter à un nouvel embodiment via un apprentissage few-shot ne nécessitant qu'une minute de données, plutôt qu'un réentraînement complet. Les auteurs mettent en avant une précision d'odométrie supérieure aux méthodes cinématiques classiques dans des environnements réels. L'enjeu dépasse la seule performance technique. L'odométrie par capteurs extéroceptifs (caméras, lidars) se dégrade dans les environnements sans repères visuels, et l'intégration IMU seule dérive rapidement ; les modèles cinématiques restent donc une brique essentielle de la localisation robotique. Jusqu'ici, chaque nouvel embodiment imposait de réentraîner un modèle dédié, un frein concret pour les intégrateurs opérant des flottes hétérogènes mêlant AMR à roues et robots à pattes. Un modèle généraliste adaptable en quelques minutes de données réduirait significativement ce coût d'ingénierie, un argument qui parlera aux fabricants de robots quadrupèdes ou humanoïdes cherchant à mutualiser leur stack logicielle avec des plateformes à roues. Le travail s'inscrit dans une tendance plus large de représentations unifiées pour la robotique, portée notamment par les modèles vision-langage-action (VLA) qui cherchent eux aussi à généraliser au-delà d'un seul robot. KING reste à ce stade une publication de recherche, sans déploiement industriel annoncé ; une page projet est disponible en ligne, mais aucun partenaire matériel ni calendrier de commercialisation n'est mentionné.

RecherchePaper
1 source
CORNAV : raisonnement tenant compte des travaux pour la navigation de robots sur chantiers actifs
4arXiv cs.RO 

CORNAV : raisonnement tenant compte des travaux pour la navigation de robots sur chantiers actifs

CORNAV, un cadre de navigation pour robots publié sur arXiv (2610.03622), vise à faire circuler des robots mobiles sur des chantiers actifs à partir de plans CAD 2D et de plannings de projet, sans exiger de maquette numérique BIM. Le système aligne les plans architecturaux sur des graphes de scène 3D hiérarchiques à vocabulaire ouvert pour ancrer les requêtes en langage naturel. Il convertit ensuite le planning en contraintes de navigation variables dans le temps. Un module de sécurité fondé sur un LLM valide chaque demande et fait remonter les zones dangereuses avant la planification. Un planificateur A* impose enfin des zones d'exclusion obligatoires et évite de préférence les zones à risque élevé. Les tests ont eu lieu dans un bureau intérieur et sur un vrai chantier. L'ancrage par plans fait passer le taux de réussite des tâches de 13,0 % à 72,2 %, par rapport à la seule récupération sémantique. La prise en compte du planning supprime toutes les violations de zones strictes. Le module de sécurité rejette correctement les demandes dangereuses issues de plannings mal étiquetés. Ces résultats comptent d'abord parce qu'ils visent une limite connue des systèmes de navigation guidés par le langage. Ceux-ci reposent sur la seule compréhension sémantique de la scène et localisent mal les éléments permanents du bâtiment. Le saut de 13,0 % à 72,2 % montre que le goulot d'étranglement est le contexte métier plutôt que la perception brute. Exploiter des plans 2D et des plannings déjà présents sur la plupart des chantiers abaisse la barrière d'entrée, car peu de chantiers disposent d'un BIM à jour. Pour les intégrateurs et les responsables de sites, l'intérêt est une navigation qui respecte les zones interdites évolutives. Le rejet de requêtes issues de plannings erronés répond à un risque réel : les données de chantier sont souvent incomplètes ou fausses. Il faut toutefois rester prudent. Les résultats viennent d'un travail académique, sur un nombre limité d'environnements, et le seul site réel testé ne dit rien de la robustesse à grande échelle. Les auteurs partent d'un constat économique : la construction souffre de pénuries de main-d'œuvre, d'une faible productivité estimée à plus de 1 600 milliards de dollars de coût annuel pour l'économie mondiale, et d'un des taux d'accidents les plus élevés parmi les grands secteurs. Ces facteurs alimentent l'intérêt pour les robots autonomes sur chantier, déjà explorés par des acteurs comme Boston Dynamics avec Spot pour la capture de l'avancement. Les approches de navigation par graphes de scène à vocabulaire ouvert, qui servent de base ici, restent peu adaptées aux contraintes réglementaires et temporelles d'un chantier. CORNAV est un travail de recherche, pas un produit ni un déploiement commercial, et aucun calendrier de pilote n'est annoncé. Les suites logiques seraient des essais sur davantage de sites, une intégration avec des robots de terrain et une évaluation de la fiabilité du module de sécurité face à des plannings dégradés.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source