Aller au contenu principal
RecherchearXiv cs.RO 

Test de robustesse généralisable des systèmes de navigation robotique basés sur des DNN, guidé par l'IA explicable (XAI)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode de test de robustesse pour les robots de navigation pilotés par réseaux de neurones profonds (DNN), publiée sur arXiv en octobre 2026. L'approche combine un algorithme évolutionnaire multi-objectif avec des techniques d'explicabilité (XAI). Elle génère des perturbations « éparses », c'est-à-dire limitées à quelques zones de l'image, appliquées à des images représentatives des observations opérationnelles du robot. Ces images sont sélectionnées par un regroupement visuel et comportemental. Les gradients intégrés agrégés (Aggregated Integrated Gradients) orientent les mutations vers les régions les plus influentes pour la décision du réseau. Les tests ont été menés sur un LeoRover piloté par DNN dans le simulateur Gazebo. Une étude d'ablation a complété l'évaluation, et un sous-ensemble stratifié de perturbations a été rejoué sur le robot physique. Le taux de succès médian atteint 70,0 %, contre 53,85 % pour une recherche non guidée, et l'hypervolume médian passe de 0,65 à 0,73. L'optimisation sur plusieurs images fait passer le taux de succès de 50,0 % à 57,5 %, et le guidage XAI le porte ensuite à 70,0 %.

Ces résultats visent un problème connu : de petites variations d'entrée peuvent provoquer un comportement dangereux au niveau du système entier. La plupart des méthodes existantes optimisent une perturbation pour une seule image et ne la valident qu'en simulation, ce qui limite leur portée pratique. Ici, les tests restent efficaces sur l'ensemble des observations typiques. Le volet sim-to-real est le plus utile pour les intégrateurs et les responsables qualité. La simulation obtient une précision de 0,95 et un rappel de 0,67. Autrement dit, presque tous les échecs détectés en simulation se reproduisent sur le robot réel, mais un tiers des échecs réels n'apparaît pas en simulation. Les temps d'échec simulés et physiques sont corrélés positivement (0,617), ce qui permet de hiérarchiser les cas à vérifier. Gazebo reste donc un filtre fiable, mais pas un substitut à la validation physique. Il faut néanmoins noter que la validation porte sur un seul robot de recherche, de petite taille, et sur un sous-ensemble de perturbations. Ces chiffres ne se transposent pas directement à des humanoïdes ou à des AMR industriels.

Ce travail s'inscrit dans la montée des politiques apprises de bout en bout, des contrôleurs de navigation aux modèles vision-langage-action (VLA), qui posent la question de la certification des systèmes cyber-physiques. Les approches adverses classiques, souvent pensées pour la classification d'images, restent peu représentatives des défaillances au niveau du système. Le LeoRover est une plateforme mobile courante en recherche, ce qui facilite la reproduction. Les auteurs ne donnent pas de calendrier de déploiement industriel. Les prochaines étapes logiques sont l'extension à d'autres robots, d'autres architectures de contrôle et des environnements plus variés. Elles pourraient aussi porter sur l'intégration de ces tests dans les chaînes de validation avant mise en service.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Raisonnement guidé par ontologie pour des explications fondées sur les affordances en navigation robotique
1arXiv cs.RO 

Raisonnement guidé par ontologie pour des explications fondées sur les affordances en navigation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.00117) une méthode d'explication de la navigation robotique fondée sur le raisonnement ontologique et la théorie des affordances. L'approche construit, en temps réel, une ontologie locale représentant les entités proches du robot avec leurs affordances (ce qu'elles permettent de faire), leurs états possibles, et leurs relations spatiales qualitatives. Face à un obstacle, le système ne se contente pas de détecter le blocage : il évalue des hypothèses de changement d'état -- une porte peut-elle être ouverte, une chaise déplacée -- afin de générer des explications actionnables sur la manière de poursuivre la navigation. L'approche est validée sur un benchmark centré sur un scénario de robot bibliothécaire, avec des cas de navigation générés de manière procédurale. Les résultats montrent que le raisonnement ontologique identifie les facteurs d'explication pertinents avec une précision supérieure à une approche purement sémantique (semantic-only baseline), et reste robuste lorsque la densité d'objets non pertinents augmente -- ce qu'on appelle le semantic clutter, l'un des talons d'Achille des systèmes de navigation en environnement humain réel. Pour un intégrateur déployant des robots dans des espaces partagés (entrepôts mixtes, hôpitaux, bureaux), la capacité à expliquer les décisions de navigation répond à une exigence opérationnelle et réglementaire croissante, notamment sous l'AI Act européen. L'explication n'est pas ici cosmétique : elle est structurellement liée au raisonnement, ce qui la rend vérifiable et auditable par un opérateur humain. L'approche s'inscrit dans le courant de l'IA explicable (XAI) appliquée à la robotique. La théorie des affordances, conceptualisée par le psychologue James Gibson dans les années 1970, connaît un regain d'intérêt depuis l'émergence des vision-language models (VLMs) et des LLMs. Les approches concurrentes incluent les scene graphs sémantiques utilisés par Boston Dynamics et Sanctuary AI, ainsi que les planificateurs fondés sur LLM comme SayCan (Google DeepMind). Par rapport à ces méthodes, l'ontologie locale proposée ici est plus légère et plus explicite formellement, mais reste évaluée sur un benchmark synthétique limité -- le passage à des environnements réels non contrôlés reste à démontrer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : ce travail est une contribution académique de fond, pas un produit en voie de commercialisation.

UEL'approche répond structurellement aux exigences de l'AI Act pour les systèmes autonomes navigant en environnement humain, en fournissant des explications auditables sur les décisions de navigation, pertinent pour les intégrateurs européens déployant des robots en espaces partagés.

RecherchePaper
1 source
Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable
2arXiv cs.RO 

Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable

Un preprint arXiv (2609.16737, mis en ligne mi-septembre 2026) présente CueNav, un système de navigation robotique combinant planification vidéo guidée par indices visuels et modèle inverse-dynamique (IDM) propre a chaque plateforme. Le planificateur vidéo s'appuie sur deux indices : une carte vue-du-dessus (Bird's-Eye View) donnant le contexte global de la tache, et le maintien d'une partie du corps du robot dans le champ égocentrique pour exposer le contexte d'embodiment. L'IDM traduit ensuite les champs de flux optique extraits de la vidéo en commandes d'actuation. Sur un test de labyrinthe, CueNav quasiment double le taux de réussite par rapport a une planification sans indice global, et atteint 70% de réussite dans un couloir étroit la ou les méthodes comparées échouent majoritairement. Les auteurs démontrent aussi une navigation conditionnée sémantiquement en zero-shot et le déploiement d'un même planificateur vidéo sur plusieurs plateformes robotiques, avec code et résultats sur cuenav.github.io. Le travail cible un angle mort des approches actuelles de navigation par modèle vidéo, qui conditionnent généralement la planification sur un horizon court et récupèrent des points de passage géométriques via reconstruction de scene, au détriment du long horizon et d'une traduction vidéo-vers-action précise. En couplant contexte global et ancrage d'action spécifique a l'embodiment, CueNav esquisse une piste pour transformer les modèles vidéo génératifs en véritable backbone de politique de navigation généralisable, plutôt qu'en simple outil de visualisation a court terme. Pour les intégrateurs qui explorent les architectures vision-langage-action (VLA) au-delà de la manipulation, cela suggère qu'une même logique de planification vidéo peut se transférer entre plateformes, un enjeu pour les flottes hétérogènes d'AMR et de robots humanoïdes. Ce travail s'inscrit dans une tendance ou des modèles vidéo génératifs sont testes comme backbone de politiques robotiques, en parallèle d'architectures VLA comme Pi-0 ou GR00T N2 employées en manipulation, et se positionne explicitement contre les méthodes limitant la planification a un horizon court avec reconstruction géométrique. Il s'agit d'un preprint non encore revu par les pairs, dont les taux de réussite annonces (quasi-doublement en labyrinthe, 70% en couloir étroit) proviennent de bancs d'essai contrôles propres a l'étude, sans précision sur le nombre d'essais ni déploiement en environnement industriel réel. Aucune entreprise ni feuille de route commerciale n'est associée a l'annonce : il s'agit d'une contribution académique, sans calendrier de pilote a ce jour.

RecherchePaper
1 source
Modèle du monde pour la navigation sociale de robots guidée par la logique
3arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source
Système de navigation autonome pour robot de bibliothèque basé sur Unitree Go2 Edu
4arXiv cs.RO 

Système de navigation autonome pour robot de bibliothèque basé sur Unitree Go2 Edu

Des chercheurs ont publié sur arXiv (réf. 2606.03340) une architecture ROS 2 de navigation autonome déployée sur un Unitree Go2 Edu, robot quadrupède équipé d'un LiDAR 4D, d'une caméra de profondeur frontale et d'une centrale inertielle (IMU). L'objectif : faire circuler ce robot dans les allées étroites d'une bibliothèque réelle, en présence de lecteurs, de chaises, de sacs et de chariots, sans recourir aux hypothèses simplificatrices du terrain accidenté. La pile technique combine RTAB-Map pour la cartographie visuelle-LiDAR (SLAM), une fusion de capteurs par AMCL et filtre de Kalman étendu (EKF) pour la localisation, et la suite Nav2 avec algorithmes A* et DWA pour la planification de trajectoire et l'évitement local. Les résultats mesurés en environnement réel donnent un taux de succès de 100 % en scène statique, 96 % en présence d'obstacles dynamiques peu denses, et 88 % en haute densité dynamique. La précision cartographique, validée par comparaison avec des distances de référence levées sur site, affiche une erreur métrique moyenne de 3,7 cm. Ces chiffres sont notables car ils portent sur un déploiement en bibliothèque opérationnelle et non en laboratoire contrôlé. Le choix d'une plateforme à pattes plutôt que d'un AMR (robot mobile autonome) à roues basses répond à un problème concret : les transitions de sol (tapis, seuils, câbles au sol) et les passages partiellement obstrués dégradent la fiabilité des plateformes roulantes à faible garde au sol. La descente à 88 % en scène haute densité reste un plancher raisonnable pour un contexte de service public, mais les auteurs ne précisent pas la durée des séquences de test ni la reproductibilité statistique, ce qui limite l'extrapolation directe à un cahier des charges industriel. Unitree Robotics, constructeur chinois connu pour ses quadrupèdes grand public Go1 et Go2, positionne la variante Edu comme plateforme de recherche abordable face à des solutions comme le Spot de Boston Dynamics ou l'ANYmal de ANYbotics. Cette étude s'inscrit dans une tendance plus large d'adaptation des robots à pattes aux environnements intérieurs de service, jusqu'ici dominés par les AMR à roues. Les prochaines étapes naturelles incluent l'intégration d'une couche d'interaction vocale ou gestuelle avec les usagers, ainsi que des tests de robustesse sur des durées plus longues avec variabilité de l'achalandage.

RecherchePaper
1 source