Aller au contenu principal
RecherchearXiv cs.RO 

SPAN-Nav : une conscience spatiale généralisée pour la navigation incarnée polyvalente

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SPAN-Nav est un modèle de fondation de bout en bout, décrit dans une version révisée (v2) de l'article arXiv 2603.09163, qui vise à doter la navigation incarnée d'une perception 3D universelle à partir de simples flux vidéo RGB. Les chercheurs entraînent le modèle sur une tâche de prédiction d'occupation, c'est-à-dire d'estimation des zones libres et occupées de l'espace, dans de nombreux environnements intérieurs et extérieurs. Pour limiter le coût de calcul, ils compressent ces connaissances spatiales en un unique token, qu'ils jugent suffisant pour porter les indices grossiers utiles à la navigation. Ce token est ensuite injecté explicitement dans le raisonnement sur les actions, selon une logique inspirée de la chaîne de pensée (Chain-of-Thought). L'équipe publie aussi un jeu de données de 4,2 millions d'annotations d'occupation couvrant l'intérieur et l'extérieur, ainsi que plusieurs types de tâches de navigation. Le modèle revendique l'état de l'art sur trois benchmarks et des essais en conditions réelles.

L'intérêt tient à un point faible bien identifié des approches de navigation fondées sur les modèles vision-langage (VLM). Ces modèles généralisent bien en navigation guidée par le langage (VLN), mais leur planification de trajectoire se dégrade dans les environnements complexes, faute de compréhension géométrique fiable. Montrer qu'un seul token spatial suffit à corriger une partie de ce défaut est un résultat utile pour les intégrateurs: cela suggère qu'on peut gagner en robustesse sans capteurs 3D dédiés ni surcoût de calcul prohibitif sur des plateformes embarquées, avec une simple caméra RGB. L'entraînement multitâche semble aussi transférer ces acquis à des tâches sans supervision spatiale explicite. Il faut toutefois rester prudent: l'article ne donne pas, dans ce résumé, de chiffres de gain, de noms de benchmarks ni de plateformes robotiques. Le fossé entre résultats académiques et déploiement reste donc à évaluer, et les tests réels décrits n'ont pas de protocole détaillé.

Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) et des VLM appliqués à la navigation, qui héritent de leur généralisation sémantique mais pas de leur sens de l'espace. Plusieurs équipes cherchent à y remédier en ajoutant des représentations 3D, des cartes d'occupation ou des modules de profondeur, souvent au prix d'architectures plus lourdes. SPAN-Nav se distingue par sa compacité et son intégration de bout en bout. La suite dépendra de la disponibilité du jeu de données et du code, de la reproduction des résultats par des tiers et de tests sur des robots mobiles, quadrupèdes ou humanoïdes en environnement industriel. Aucun pilote commercial ni calendrier n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
1arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
Inspection spatiale active pour une exploration incarnée efficace
2arXiv cs.RO 

Inspection spatiale active pour une exploration incarnée efficace

Un article publié sur arXiv sous la référence 2609.22385v1 présente ACE, pour « spatial-inspection-guided ACtive Exploration », un nouveau cadre pour l'exploration robotique incarnée. Les auteurs partent d'un constat : la plupart des systèmes actuels guident le comportement de l'agent via une évaluation spatiale grossière et indirecte des indices repérés dans l'environnement, ce qui les empêche de juger correctement si ces indices suffisent ou s'il faut poursuivre l'inspection. Résultat, l'agent arrête sa mission trop tôt ou continue à explorer inutilement, au détriment du taux de réussite et de l'efficacité. ACE combine deux mécanismes : une perception ancrée dans l'évidence (« évidence-grounded perception »), qui associe une localisation fine à une vérification ciblée pour transformer un indice suggestif en preuve visuelle décisive, et un déplacement informé par l'exposition (« exposure-informed movement »), qui priorise les directions prometteuses tout en écartant celles déjà couvertes. Sur une série d'expériences, ACE affiche un taux de réussite de navigation supérieur de 18,0 points de pourcentage et une efficacité d'exploration supérieure de 10,3 points sur des tâches de réponse à des questions incarnées, par rapport aux meilleures méthodes de référence existantes. Ce travail s'attaque à un compromis classique et jusqu'ici mal résolu de l'exploration robotique autonome : arrêter trop tôt une mission de navigation ou de recherche d'objet fait perdre en fiabilité, tandis que continuer par excès de prudence fait perdre en temps de calcul et en efficacité opérationnelle. En montrant qu'une résolution spatiale plus explicite des indices perçus permet de gagner simultanément sur ces deux axes, succès et efficacité, ACE remet en cause l'idée que ces objectifs seraient nécessairement antagonistes. Pour les concepteurs de systèmes de navigation autonome, d'AMR ou d'architectures vision-langage-action appliquées à l'exploration en environnement 3D, l'approche illustre une piste concrète pour réduire le nombre de pas ou de cycles de calcul nécessaires à l'accomplissement d'une tâche, un enjeu direct de coût et de latence pour tout déploiement à l'échelle. Elle s'inscrit dans la tendance plus large à mieux articuler perception fine et politique de mouvement, plutôt qu'à les traiter comme des modules indépendants. ACE se positionne dans le champ de la recherche académique en exploration incarnée, un sous-domaine de l'IA robotique centré sur des benchmarks de navigation et de réponse à des questions dans des environnements 3D simulés, où l'agent doit explorer une scène pour localiser un objet ou répondre à une requête. L'abstract ne précise ni les auteurs, ni leur affiliation, ni les jeux de données ou baselines nommément comparés, se limitant à mentionner des « baselines de l'état de l'art antérieur ». Publié comme nouvel article sous cet identifiant arXiv, ce travail s'ajoute à une littérature déjà dense sur les méthodes de navigation guidées par le langage et la vision, sans qu'aucune feuille de route de déploiement réel, de partenariat industriel ou de suite annoncée ne soit mentionnée à ce stade.

RecherchePaper
1 source
SAGE : un moteur génératif conscient du social pour la navigation multi-agents hétérogène
3arXiv cs.RO 

SAGE : un moteur génératif conscient du social pour la navigation multi-agents hétérogène

Une équipe de recherche propose SAGE (Socially-Aware Generative Engine), un nouveau système de navigation pour robots évoluant parmi des humains et d'autres agents hétérogènes, décrit dans un article publié sur arXiv (référence 2607.16619v1). Le modèle représente la scène, robots, piétons, autres véhicules, comme un graphe hétérogène orienté, traité par un Heterogeneous Graph Transformer (HGT) capable d'encoder des interactions asymétriques selon le type d'agent. Un module génératif basé sur la diffusion prédit conjointement les trajectoires futures des entités environnantes et le plan de trajectoire du robot. Au moment de l'inférence, un mécanisme de guidage baptisé "safety-social energy", sans entraînement supplémentaire, affine les trajectoires échantillonnées via des contraintes différentiables de collision, de cinématique, de progression de tâche et de conformité sociale selon le rôle de l'agent. Les tests ont été menés sur les jeux de données réels ETH/UCY et Stanford Drone Dataset (SDD), ainsi que sur des données synthétiques, avec une mise à l'échelle démontrée jusqu'à des équipes de 20 robots. Pour l'industrie robotique, ce travail s'attaque à un vrai point de friction: la plupart des méthodes de prédiction de trajectoire et de planification traitent les agents de façon homogène ou se limitent à des contraintes géométriques de collision, ce qui échoue à modéliser des situations réalistes où un robot logistique, un piéton et un véhicule autonome n'ont ni la même dynamique ni le même rôle social. En couplant prédiction et planification dans un seul module génératif, et en permettant un arbitrage explicite entre sécurité, précision et performance de tâche sans réentraîner le modèle, SAGE répond à un besoin concret pour les intégrateurs déployant des flottes de robots mobiles (AMR) en environnement partagé avec des humains, entrepôts, hôpitaux, espaces publics. Ce travail s'inscrit dans la lignée des recherches en navigation socialement consciente, un champ où les approches précédentes reposaient souvent sur des modèles de forces sociales ou de l'apprentissage par renforcement avec des hypothèses simplificatrices sur l'homogénéité des agents. L'article ne précise pas de calendrier de déploiement industriel ni de partenaire commercial: il s'agit à ce stade d'une contribution de recherche, dont la prochaine étape logique serait une validation sur robots physiques au-delà des simulations et jeux de données existants.

RecherchePaper
1 source
Au-delà de l'isolement : un benchmark unifié pour la navigation polyvalente
4arXiv cs.RO 

Au-delà de l'isolement : un benchmark unifié pour la navigation polyvalente

Une équipe de chercheurs vient de publier OmniNavBench (arXiv:2505.09441), un nouveau benchmark conçu pour évaluer la navigation des agents incarnés dans des conditions proches du réel. Contrairement aux protocoles existants qui testent une compétence à la fois sur un seul type de robot, OmniNavBench impose des instructions composites enchaînant six catégories de sous-tâches au sein d'un même épisode : navigation vers un point cible (PointNav), navigation guidée par le langage (VLN), recherche d'objets (ObjectNav), navigation sociale (SocialNav), suivi de personne (Human Following) et question-réponse incarnée (EQA). La plateforme de simulation propose 170 environnements combinant assets synthétiques et scans de lieux réels, et couvre trois morphologies robotiques : humanoïdes, quadrupèdes et robots à roues. Le dataset comprend 1 779 trajectoires expertes collectées par télé-opération humaine, capturant des nuances comportementales comme les regards exploratoires et les évitements anticipatoires, au lieu des classiques plus courts chemins algorithmiques. L'intérêt de ce travail est de révéler une faille systémique dans l'évaluation actuelle des agents navigants. Les méthodes publiées, même celles se réclamant d'une conception unifiée, peinent dès lors qu'on leur demande d'enchaîner des comportements hétérogènes dans un seul épisode continu. Ce résultat contredit implicitement les affirmations de généralité de plusieurs architectures récentes et met en évidence un écart réel entre les performances en benchmark isolé et les exigences d'un déploiement terrain. Pour un intégrateur ou un décideur industriel, cela signifie que les métriques publiées sur des benchmarks mono-tâche ne sont pas transposables à des scénarios opérationnels où un robot doit simultanément localiser un objet, éviter un humain et répondre à une consigne en langage naturel. OmniNavBench s'inscrit dans une dynamique plus large d'unification des évaluations en robotique incarnée, un domaine où les benchmarks fragmentés ont longtemps permis aux équipes de revendiquer des SOTA partiels sans comparabilité réelle. Les benchmarks dominants comme R2R (Vision-and-Language Navigation) ou HM3D (Habitat) restent mono-morphologie et mono-tâche. La plateforme est disponible en open access avec dataset, code et leaderboard, ce qui facilitera l'adoption par la communauté. Les suites logiques incluent l'intégration de modèles VLA récents comme pi0 ou GR00T N2 dans le leaderboard, et potentiellement des évaluations en simulation-to-real pour tester si les scores obtenus se transfèrent sur hardware réel.

RecherchePaper
1 source