Aller au contenu principal
RecherchearXiv cs.RO 

SuperNav : un système de navigation à base d'agents pour toute tâche dans n'importe quelle scène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SuperNav, un système de navigation décrit dans un preprint arXiv (2610.12126) par l'équipe zju3dv de l'université du Zhejiang, vise les robots de service généralistes qui doivent répondre à des demandes humaines variées dans des environnements inconnus. Son principe : un grand modèle de langage multimodal (MLLM) préentraîné est utilisé tel quel, sans fine-tuning spécifique à la navigation. Il est encadré par un « agent harness », c'est-à-dire une couche logicielle composée de compétences de navigation (Navigation Skills), d'outils orientés agent pour l'interaction physique, et d'un module de suivi de progression de la tâche et de gestion du contexte. Une interface unifiée à base de points visuels relie la décision au mouvement : le modèle désigne directement une destination dans l'image, puis révise son choix à partir du retour d'exécution. Les auteurs affirment que SuperNav dépasse quatre méthodes de référence sur des tâches au niveau de l'instance, multi-objets et pilotées par un besoin (« j'ai soif », par exemple). Une évaluation par catégorie sur le jeu HM3D et un déploiement sur un robot quadrupède réel complètent les résultats.

L'enjeu tient à l'architecture. Plusieurs approches récentes ajustent un MLLM pour qu'il prédise directement des actions de navigation, ce qui lie leur comportement à la couverture des données d'entraînement et limite la généralisation à des requêtes ou des lieux nouveaux. SuperNav prend le parti inverse : le modèle garde ses capacités générales de raisonnement et de compréhension de scène, et délègue l'exécution du mouvement à des outils classiques. Si cette séparation tient à grande échelle, elle réduit le coût de collecte de données de navigation et permet de profiter des progrès des modèles de fondation sans réentraînement. Pour un intégrateur, cela rapproche la navigation d'une brique modulaire, où l'on peut changer de modèle ou d'outil de locomotion sans tout reconstruire. Les réserves habituelles s'appliquent toutefois : le résumé ne fournit ni taux de réussite chiffrés, ni latence, ni coût d'inférence, ni nombre d'essais sur le quadrupède. L'écart entre benchmark simulé et terrain reste donc à mesurer, d'autant que l'appel répété à un grand modèle peut être pénalisant en temps réel.

Ce travail s'inscrit dans la tendance des systèmes agentiques en robotique, qui exploitent des MLLM généralistes avec des outils, face aux modèles vision-langage-action (VLA) entraînés de bout en bout. Il s'oppose aux méthodes de navigation fine-tunées sur des données dédiées, qui sont ses comparaisons directes, même si le résumé ne nomme pas les quatre références. Il s'agit d'un preprint académique : il n'y a ni produit, ni calendrier de commercialisation, ni partenaire industriel annoncé. Une page de projet est disponible, et la suite logique serait la publication du code, des tests sur d'autres plateformes mobiles et des évaluations en environnements réels plus longs et plus encombrés, seuls capables de dire si l'approche dépasse le stade de la démonstration de laboratoire.

À lire aussi

eMEM : un système de mémoire spatio-temporelle hybride pour agents à base d'IA incarnée
1arXiv cs.RO 

eMEM : un système de mémoire spatio-temporelle hybride pour agents à base d'IA incarnée

Une équipe de recherche a déposé sur arXiv (arXiv:2606.03374, juin 2026) un système de mémoire baptisé eMEM (Embodied Memory), conçu spécifiquement pour les agents incarnés opérant dans des environnements physiques. Contrairement aux architectures existantes comme Generative Agents, MemGPT ou A-MEM, qui stockent la mémoire sous forme de flux textuels ou de graphes de connaissances, eMEM propose une architecture multi-index combinant SQLite pour le stockage structuré, hnswlib pour la recherche sémantique par voisins les plus proches (ANN), et un R-tree pour les requêtes spatiales, le tout unifié derrière un modèle de graphe unique. Un pipeline de consolidation par niveaux transforme les observations perceptuelles brutes en résumés compressés, en s'inspirant explicitement de la consolidation hippocampo-néocorticale observée chez les mammifères. Dix outils de rappel, exposés en natif au LLM, couvrent des primitives comme la résolution concept-vers-localisation ou le rappel inter-couches. Le système tourne entièrement en mémoire vive, en co-processus avec l'agent. Sur eMEM-Bench v1, un benchmark construit sur les scènes ProcTHOR-10K autour de huit paradigmes de psychologie cognitive (leurres DRM, séparation de patterns, complétion de patterns, surveillance de source, récupération dépendante du contexte, interférence à long horizon, position sérielle, courbe de rétention augmentée par des distracteurs), eMEM atteint un score pondéré moyen de 80,8 sur 988 sondes, avec une courbe de rétention plate au plafond de 1 heure à 1 an de délai simulé sur des objets uniques par pièce. Ce résultat est significatif parce qu'il isole deux problèmes structurels des approches purement RAG : une baseline flat_rag perd 30 points sur la récupération dépendante du contexte et 29 points sur le rejet des leurres DRM, ce qui valide respectivement la contribution du stockage multi-couches et du pipeline de consolidation. Pour les intégrateurs qui déploient des agents dans des environnements industriels ou domestiques complexes, cela met en évidence un angle mort majeur : un robot ou un agent LLM utilisant une récupération sémantique plate ne peut pas distinguer "le tiroir où j'ai vu les pinces hier dans cette pièce" de "les pinces en général". L'indexation spatiale couplée à la consolidation temporelle est ce qui permet à eMEM de maintenir des performances constantes sur de longues fenêtres simulées, là où les systèmes actuels dégradent. Le choix de benchmarker sur des paradigmes issus de la psychologie cognitive humaine est méthodologiquement solide : il rend les résultats comparables à la littérature sur la mémoire biologique, ce que des benchmarks surfaciques comme LoCoMo ou OpenEQA ne permettent pas. eMEM s'inscrit dans une vague de travaux sur la mémoire à long terme pour agents LLM, portée notamment par Generative Agents (Park et al., 2023) et MemGPT (Packer et al., 2023), qui ont posé les bases mais restent aveugles à la dimension spatiale, critique pour les robots physiques. L'environnement ProcTHOR-10K offre des scènes intérieures procédurales variées, mais les performances en transfert vers des environnements réels restent entièrement à démontrer : le sim-to-real gap s'applique autant aux systèmes de mémoire qu'aux politiques motrices. Le code du système et du benchmark est rendu public, ouvrant la voie à des évaluations indépendantes. Aucun partenariat industriel ni déploiement terrain n'est mentionné : c'est une contribution académique, pas un produit. Les étapes suivantes naturelles seraient de valider eMEM sur des plateformes embarquées à mémoire contrainte et de tester sa robustesse dans des scènes dynamiques où les objets se déplacent entre deux requêtes.

RecherchePaper
1 source
ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche
2arXiv cs.RO 

ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche

Une équipe de recherche présente ARSTAG, un système agentic Real2Sim2Real qui transforme une image RGB et une instruction en langage naturel en données d'entraînement pour des politiques robotiques visuomotrices, sans construction manuelle de scène ni téléopération. Décrit dans un papier publié sur arXiv le 22 septembre 2026 (arXiv:2609.24563), le système s'appuie sur une hiérarchie d'agents linguistiques qui bâtissent une scène de simulation adaptée à la tâche, génèrent des démonstrations robot-réalisables puis élargissent la distribution d'entraînement par randomisation, sous la supervision d'un agent coordinateur gérant le retour d'information entre étapes. Sur sept tâches de manipulation (préhension, placement, empilement), le pipeline a permis un transfert simulation-vers-réel de trois architectures de politiques sur un robot bimanuel, la politique pi0.5 atteignant un taux de réussite moyen réel de 74,6 %. Les ablations montrent que la randomisation spécifique à la tâche améliore la robustesse, et que la performance croît avec la taille du jeu de données généré. Ce travail cible le goulot d'étranglement central de l'apprentissage robotique : la collecte de données spécifiques à chaque tâche. Les politiques vision-language-action, comme pi-0 ou GR00T N2, exigent des volumes massifs de démonstrations, généralement recueillies par téléopération humaine, méthode coûteuse et difficile à faire évoluer. En automatisant via des agents LLM la construction de scène, la génération de démonstrations et la randomisation du domaine, ARSTAG vise à réduire l'ingénierie manuelle nécessaire pour adapter un robot à une nouvelle tâche, un enjeu direct pour les intégrateurs voulant déployer bras et humanoïdes sur des tâches variées. Le taux de 74,6 % reste toutefois une démonstration de faisabilité sur sept tâches en laboratoire, pas un déploiement industriel. ARSTAG s'inscrit dans la lignée des recherches sur le Real2Sim2Real, qui partent d'observations réelles plutôt que de scènes construites à la main pour réduire l'écart simulation-réel, une piste également explorée par des systèmes comme RoboGen ou DexMimicGen. Tester le pipeline sur trois architectures différentes, dont pi0.5, successeur de pi-0 développé par Physical Intelligence, suggère une volonté de positionner ARSTAG comme une brique de génération de données agnostique au modèle plutôt que comme un concurrent des laboratoires qui développent ces politiques. Le papier reste une contribution académique, sans partenariat industriel ni calendrier de déploiement commercial annoncés ; l'étape suivante serait l'extension à davantage de tâches et de plateformes robotiques, notamment humanoïdes.

RecherchePaper
1 source
Politiques de scène à base d'agents
3arXiv cs.RO 

Politiques de scène à base d'agents

Des chercheurs du laboratoire Robotics and Embodied AI de Montréal (Mila, page projet montrealrobotics.ca) publient la deuxième version d'Agentic Scene Policies (ASP), un cadre de contrôle robotique qui vise la généralisation zéro-shot, c'est-à-dire l'exécution d'instructions en langage naturel sur des objets jamais vus, sans entraînement spécifique. ASP unifie, dans un seul espace d'actions « agentique », la localisation des objets et les compétences du robot, via une interface d'outils exposée à un agent. La représentation de la scène en 3D repose sur un modèle vision-langage (VLM), et les compétences s'appuient sur des affordances au niveau des parties d'objets, comme la poignée d'un tiroir ou la fiche d'un chargeur. Cela permet des interactions zéro-shot telles que débrancher un chargeur ou ouvrir un tiroir. Les auteurs affirment que ASP surpasse systématiquement les principaux modèles VLA (vision-langage-action) en zéro-shot lors d'expériences réelles, et présentent une version mobile du cadre pour répondre à des requêtes à l'échelle d'une pièce. Le résumé ne donne ni chiffres de taux de réussite, ni noms des VLA comparés, ni détails sur le robot utilisé. Ces éléments sont à chercher dans le papier complet. L'intérêt tient au débat entre deux architectures. Les VLA détournent un VLM pour produire des actions de bout en bout, mais leur généralisation à de nouvelles instructions et à de nouveaux objets reste fragile. Les politiques modulaires, qui combinent représentation de scène, planification de mouvement et VLM, sont plus interprétables et donnent de bons résultats zéro-shot. Elles souffrent toutefois de deux faiblesses : une recherche d'objets purement sémantique, sans raisonnement spatial explicite, et des compétences limitées à la saisie et à la navigation de base. ASP s'attaque aux deux. Si l'avantage sur les VLA se confirme sur des protocoles indépendants, cela plaide pour des architectures hybrides, où un agent de langage orchestre des primitives géométriques robustes plutôt que de tout apprendre de bout en bout. Pour les intégrateurs, l'attrait est concret : un système modulaire se diagnostique, se corrige et s'étend en ajoutant des outils, sans réentraîner un modèle de plusieurs milliards de paramètres. Il faut cependant rester prudent. Il s'agit d'un travail académique, non d'un produit, et la comparaison dépend du choix des VLA de référence, de leur réglage et des tâches retenues. Les cadences, la fiabilité sur de longues séries et les modes de défaillance ne sont pas documentés dans le résumé. Ce travail s'inscrit dans la lignée des approches qui font piloter des robots par des VLM et des LLM, avec des cartes sémantiques 3D et des outils de saisie issus de la vision. En face, les VLA généralistes tels que Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure ont gagné en visibilité, avec une promesse de généralisation encore peu vérifiée hors des environnements d'entraînement. La publication de cette version 2 (une révision d'un papier d'abord soumis en septembre 2025) suggère un travail affiné après relecture. Les prochaines étapes probables sont des tests sur davantage d'objets et de scènes, des comparaisons plus larges avec les VLA récents et une extension de la version mobile à des tâches de longue durée.

RecherchePaper
1 source
OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle
4arXiv cs.RO 

OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle

Des chercheurs publient OntoPlan, un cadre de planification de tâches robotiques fondé sur une représentation ontologique de la scène, accompagné d'un code ouvert sur GitHub (dépôt namhyeongwoo/OntoPlan). Le système cible un défaut connu de la planification par grands modèles de langage (LLM) : sur les tâches à long horizon dans de vastes environnements, la performance se dégrade. Quand la géométrie de la scène est transmise sous forme de texte, le modèle saisit mal le contexte spatial, et le coût en tokens croît avec la taille de l'environnement. OntoPlan aligne objets, espaces, relations et états dans un vocabulaire symbolique commun. Un cadre agentique interprète l'instruction, récupère de façon sélective les informations utiles, formalise buts et contraintes, puis produit un plan exécutable. Sur 150 tâches générales réparties dans cinq environnements intérieurs et trois échelles de scène, il atteint un taux de réussite moyen de 0,89, contre 0,27 pour la meilleure méthode de référence. Il consomme en moyenne 18,1 k tokens par tâche, soit environ 5,6 fois moins que la référence la plus économe. L'enjeu est double pour les intégrateurs et les équipes qui déploient des robots pilotés par LLM. D'abord, l'écart de 0,89 contre 0,27 suggère que le goulot d'étranglement tient moins à la capacité de raisonnement du modèle qu'à la manière de lui présenter le monde : un LLM qui génère directement des séquences d'actions peine à respecter l'état courant et les préconditions, alors qu'une formalisation symbolique les rend vérifiables. Ensuite, le coût en tokens, rarement discuté dans les démonstrations, détermine la viabilité économique et la latence en exploitation. Les auteurs indiquent que l'avantage persiste quand l'échelle de la scène augmente, alors que les méthodes concurrentes perdent davantage en réussite et restent beaucoup plus coûteuses. Le système demande aussi des précisions face à une instruction ambiguë, ou signale un manque d'information face à une instruction infaisable, au lieu de s'engager dans un plan invalide. C'est un comportement de sécurité utile pour tout déploiement industriel. Plusieurs réserves s'imposent. Il s'agit d'un préprint arXiv (v1), non évalué par les pairs. Les résultats viennent d'un banc d'essai de 150 tâches, sans précision dans le résumé sur la nature des environnements (simulés ou réels) ni sur les méthodes de référence. Les chiffres ne disent donc rien de la robustesse en conditions réelles, où perception bruitée et échecs d'exécution compliquent la construction de l'ontologie. Ce travail s'inscrit dans le courant de la planification neuro-symbolique, qui combine LLM et planificateurs formels (type PDDL) pour pallier les limites des approches où le modèle génère directement les actions. Il se distingue des modèles vision-langage-action de bout en bout, qui traitent le bas niveau. La publication du code permettra une reproduction indépendante, étape décisive pour juger si l'écart de performance tient hors du banc d'essai des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source