Aller au contenu principal
TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité
RecherchearXiv cs.RO 

TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TravExplorer, un framework de navigation autonome multi-étages publié en mai 2026 sur arXiv (arXiv:2605.19958). Le système s'attaque à la navigation zero-shot par objets (ZSON, Zero-Shot Object Navigation), soit la capacité à localiser une cible désignée en langage naturel dans un environnement inconnu, sans carte préalable. Validé sur 4 195 épisodes simulés dans les benchmarks HM3D (Habitat-Matterport 3D) et Matterport3D (MP3D), puis sur 50 essais réels avec un robot quadrupède Unitree Go2, TravExplorer opère sur escaliers, paliers et espaces à chevauchements verticaux. Le système maintient une carte volumétrique unifiée distinguant structures occupées et surfaces accessibles au robot, extrait des frontières traversables sur sols, escaliers et paliers, et s'appuie sur un planificateur hiérarchique couplant une recherche 3D guidée par points d'appui (foothold-guided) à une optimisation de trajectoire localement contrainte en vertical.

Presque tous les systèmes ZSON existants supposent un environnement mono-étage et une représentation plane, une hypothèse qui casse dans tout bâtiment réel comportant escaliers ou mezzanines. TravExplorer comble ce fossé avec deux apports concrets : un module sémantique allégé qui aligne une carte d'instances probabiliste (segmentation open-vocabulary en ligne) avec une carte de valeur spatiale via image-to-text rapide, réduisant la latence de raisonnement ; et une stratégie de perception active FOV-aware pour résoudre les zones partiellement observées lors des transitions d'étages. Les résultats sur HM3D et MP3D sont supérieurs aux baselines ObjectNav de référence, et les 50 essais sur Go2 sans carte ni intervention humaine constituent une validation sim-to-real concrète, même si elle reste limitée à une seule plateforme et à des intérieurs contraints.

Le champ du ZSON multi-étages émerge dans un contexte plus large d'ambition robotique pour les environnements non structurés. HM3D (Meta) et MP3D sont les benchmarks standards du domaine ; y surpasser les méthodes ObjectNav actuelles est un signal de maturité technique. Le Unitree Go2, quadrupède de recherche commercialisé autour de 8 700 euros, est devenu une plateforme de référence en navigation académique. Le code source sera mis à disposition sur GitHub. Les extensions logiques incluent des bâtiments plus complexes, des espaces semi-ouverts et l'intégration sur robots humanoïdes ou à roues. Aucun acteur européen n'est impliqué dans cette publication.

Dans nos dossiers

À lire aussi

TASG-Explore : exploration guidée par secteurs et sensible à la traversabilité pour robot terrestre sur terrain accidenté
1arXiv cs.RO 

TASG-Explore : exploration guidée par secteurs et sensible à la traversabilité pour robot terrestre sur terrain accidenté

Une équipe de recherche publie, dans une version révisée (v2) de son préprint arXiv 2609.08512, TASG-Explore, un cadre d'exploration autonome pour robots terrestres évoluant sur terrain accidenté. Le système combine deux niveaux de raisonnement. Une analyse hiérarchique de la traversabilité s'appuie sur un ajustement du sol par voxels de taille variable et sur un encodage adaptatif des obstacles sur 8 bits. La carte de coûts est ensuite découpée en secteurs, dont les regroupements sont mis à jour de façon incrémentale. Le système en extrait des points de vue frontière couplés au terrain et maintient une feuille de route topologique dynamique, qui intègre des hypothèses sur les zones inconnues. Un planificateur guidé par secteurs choisit des cibles régionales, puis y insère des points de vue locaux. Les tests portent sur des grottes, des forêts et des collines escarpées, face à six planificateurs de pointe. Les auteurs annoncent un traitement de la traversabilité 6,3 fois plus rapide à précision maintenue, un gain d'efficacité d'exploration de 51 % et une couverture multipliée par 2,95 au maximum sur la scène de collines. Des essais réels à grande échelle sont mentionnés, sans que le résumé en détaille l'ampleur ni le robot utilisé. L'enjeu est un compromis classique de l'exploration autonome. Un raisonnement fin sur le terrain fiabilise le comportement local mais ralentit l'exploration à grande échelle. Un guidage régional grossier progresse vite en espace ouvert mais rate les passages étroits et les bordures praticables irrégulières. TASG-Explore vise à obtenir les deux. Pour les intégrateurs de robots d'inspection, de sécurité, de mines, d'agriculture ou de secours, la question est de savoir si une exploration hors route peut cesser de dépendre d'un terrain plan ou structuré. Les chiffres restent à relativiser : il s'agit d'un banc d'essai académique, et le gain de 2,95 fois est un maximum obtenu sur une seule scène, pas une moyenne. Les conditions de comparaison (matériel, réglages des concurrents, répétitions) ne figurent pas dans le résumé. Il n'y a ni produit, ni déploiement commercial, ni partenaire industriel annoncé. Ce travail prolonge une lignée de planificateurs d'exploration à base de frontières et de feuilles de route topologiques, développés d'abord pour des robots aériens ou des environnements 2D et 2,5D, puis adaptés au sol. Les six méthodes comparées ne sont pas nommées dans le résumé. La difficulté propre aux robots terrestres tient à ce que la traversabilité dépend de la pente, de la rugosité et de la géométrie du véhicule, ce qui alourdit le calcul. La suite logique serait la publication du code, des comparaisons sur d'autres plateformes et des tests en conditions industrielles ou de secours. Aucun calendrier n'est communiqué. Ce type de méthode alimente à terme les briques de navigation des quadrupèdes et des robots à chenilles, mais le passage du laboratoire au terrain reste à démontrer.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
2arXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites. L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide. Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

RechercheOpinion
1 source
Exploration vision-langage guidée par plan d'étage pour la réponse à des questions incarnée
3arXiv cs.RO 

Exploration vision-langage guidée par plan d'étage pour la réponse à des questions incarnée

Des chercheurs présentent HFLEX-EQA, un nouveau framework pour l'Embodied Question Answering (EQA), publié sur arXiv (référence 2609.26360v1) en septembre 2026. L'EQA désigne la tâche où un robot doit explorer un environnement inconnu, collecter les informations pertinentes, puis répondre à des questions sur ce qu'il a observé. Le système combine quatre briques : une construction en ligne de graphe de scène hiérarchique, une planification pilotée par un modèle vision-langage (VLM), une exploration par frontières sémantiques, et des a priori de plan d'étage. À partir de flux RGB-D, HFLEX-EQA construit incrémentalement à la fois un graphe de scène hiérarchique et une carte d'occupation à vocabulaire ouvert, ce qui permet au VLM de raisonner conjointement sur la structure de la scène, les observations visuelles utiles à la tâche, l'historique d'exploration et un plan d'étage topologique estimé. Une stratégie de découverte de pièces exploite ce plan d'étage combiné à la sémantique des frontières non explorées pour orienter le robot vers les types de pièces les plus susceptibles de contenir la réponse. Le système a été évalué sur les benchmarks OpenEQA et ExploreEQA, et testé en conditions réelles sur un robot quadrupède en environnement intérieur. L'apport principal tient à l'ajout d'un a priori structurel global, le plan d'étage, là où la plupart des approches récentes couplant VLM et cartes ou graphes sémantiques ne s'appuient que sur les observations locales pour décider où explorer ensuite. Pour les équipes travaillant sur la navigation sémantique et la compréhension de scène en robotique de service, industrielle ou d'inspection, ce travail illustre une tendance de fond : le raisonnement spatial des VLM progresse quand on lui injecte une connaissance structurelle du bâtiment plutôt que de le laisser réagir image par image. Le déploiement réel sur quadrupède, au-delà de la simulation, va dans le sens d'une réduction de l'écart entre benchmarks académiques et comportement embarqué, sans pour autant constituer une preuve de robustesse à grande échelle : il s'agit d'une validation de recherche, pas d'un produit commercialisé. Le papier s'inscrit dans la lignée des approches EQA récentes combinant VLM et représentations sémantiques de l'environnement, dont il pointe la limite commune : l'absence d'exploitation des a priori structurels du bâtiment. Ses résultats sont comparés directement aux méthodes existantes sur OpenEQA et ExploreEQA, deux benchmarks de référence du domaine. Aucune date de mise en production, partenariat industriel ou déploiement à plus grande échelle n'est annoncé à ce stade ; il s'agit d'une contribution méthodologique destinée à la communauté de recherche en robotique embarquée et en IA multimodale.

RecherchePaper
1 source
Planification de placement sensible à la sémantique et à la densité pour préserver l'accessibilité multi-objets
4arXiv cs.RO 

Planification de placement sensible à la sémantique et à la densité pour préserver l'accessibilité multi-objets

Des chercheurs présentent, dans un article publié sur arXiv le 18 août 2026 (référence arXiv:2608.16741v1), une méthode baptisée SDPP (Semantic-Dense Placement Planning), conçue pour permettre à un robot de service domestique de ranger des objets sur une étagère partiellement occupée sans connaître à l'avance les futurs objets à placer. Le système classe les positions candidates à partir d'un score combinant similarité sémantique entre objets (par exemple regrouper les produits de même catégorie) et proximité spatiale, afin de densifier le rangement tout en gardant une organisation cohérente. Une seconde brique, l'Accessibility Map (AM), filtre en amont les poses de placement peu susceptibles d'être atteignables par le bras manipulateur avant même de lancer la planification de mouvement, et pénalise les choix qui réduiraient l'espace de travail accessible pour les placements suivants. Les auteurs rapportent, en simulation, une amélioration significative de la qualité de l'organisation sémantique par rapport aux méthodes de référence actuelles, ainsi que la densité moyenne d'étagère la plus élevée obtenue parmi les approches comparées ; l'AM réduit par ailleurs sensiblement le temps nécessaire pour identifier une pose de placement faisable. Une expérience qualitative en conditions réelles, sur un scénario domestique de stockage en étagère, complète ces résultats. L'enjeu dépasse le simple rangement de courses : la plupart des travaux existants sur la planification de placement traitent séparément l'organisation sémantique, la densité d'occupation de l'espace et l'accessibilité du bras robotique, alors que ces trois contraintes entrent souvent en conflit dans un contexte réel de remplissage séquentiel où les futurs objets sont inconnus. En traitant ces dimensions conjointement, SDPP s'adresse directement aux intégrateurs travaillant sur la logistique en entrepôt, le service à domicile ou le retail automatisé, où un robot doit continuer à opérer efficacement sur une étagère qui se remplit au fil du temps sans bloquer ses propres accès futurs. Le travail s'inscrit dans la littérature de planification de manipulation à long terme pour robots de service, un domaine où la validation reste majoritairement limitée à la simulation. Les auteurs précisent eux-mêmes que leur test en environnement réel n'a qu'une portée qualitative, ce qui distingue cette contribution d'un système prêt pour un déploiement commercial et la situe encore au stade de la recherche exploratoire, avant tout passage à une validation à plus grande échelle.

RecherchePaper
1 source