Aller au contenu principal
RecherchearXiv cs.RO 

Mémoire rétrospective à vocabulaire ouvert pour la recherche d'objets sur le long terme

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2610.00330) ECROM, une méthode de mémoire à vocabulaire ouvert pour la recherche d'objets sur de longues durées par un robot mobile. Le système estime la prévalence à long terme d'un concept, spécifié uniquement au moment de la requête, et convertit cette croyance directement en prior de recherche active. Les auteurs ont aussi construit un benchmark contrôlé de dix habitats HM3D, où le placement des objets et les opportunités d'observation varient indépendamment au fil de passages répétés. Sur des requêtes jamais vues, ECROM gagne 4,5 points d'average precision (AP) au niveau du support et 4,2 points de SPL (Success weighted by Path Length, métrique de recherche d'objet) par rapport à la meilleure mémoire concurrente, mesurée séparément pour chaque métrique. Benchmark, jeu de données et code seront publiés en open source. Il s'agit d'un préprint, sans déploiement sur robot réel annoncé.

L'idée centrale est de traiter les observations comme des données censurées. Une détection ou une non-détection ne pèse sur la croyance qu'en proportion de l'opportunité qu'avait le robot d'observer l'endroit concerné. Un objet « absent » d'une pièce que le robot n'a fait que traverser ne dit presque rien, alors qu'une pièce inspectée de près à de nombreuses reprises est une preuve solide. Beaucoup de mémoires sémantiques existantes accumulent détections et absences sans pondérer cette exposition, ce qui biaise l'apprentissage vers les zones les plus visitées. Pour un intégrateur ou un exploitant de robots de service, d'entrepôt ou d'assistance à domicile, c'est un problème concret, car les trajectoires réelles sont inégales par construction. Les gains restent modestes et mesurés en simulation, sur dix scènes.

Ces travaux s'inscrivent dans la lignée des cartes sémantiques à vocabulaire ouvert, construites sur des modèles vision-langage, et de la navigation par objectif (ObjectNav), qui a longtemps supposé des environnements statiques ou une mémoire d'un seul épisode. La mémoire à long terme dans des environnements changeants reste moins évaluée, faute de benchmarks qui séparent l'effet du placement de celui de l'observation. C'est cette lacune que le jeu de données veut combler. Les auteurs ne comparent leur méthode qu'à d'autres mémoires, sans validation en conditions réelles. Les suites probables sont la publication du code et un test sur plateforme physique, étape qui dira si le gain tient face au bruit de perception et au changement réel des environnements.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

AECNav : consolidation active de preuves pour la navigation vers un objet à vocabulaire ouvert en zero-shot
1arXiv cs.RO 

AECNav : consolidation active de preuves pour la navigation vers un objet à vocabulaire ouvert en zero-shot

Un article publié sur arXiv sous la référence 2608.10817v1 présente AECNav, un pipeline sans entraînement pour la navigation "zero-shot" vers un objet en vocabulaire ouvert, où un robot doit localiser un objet désigné arbitrairement dans un environnement inconnu. Le système combine une perception à encodage partagé qui élimine les calculs redondants, une consolidation des preuves en croyances de type log-odds par cluster d'objets pour distinguer une vraie cible d'un distracteur visuellement proche, et une exploration active qui privilégie les frontières au meilleur gain d'information pour le moindre coût de déplacement. Sur les benchmarks HM3D-v2, HM3D-OVON et MP3D, il atteint des taux de réussite de 84,7%, 57,3% et 51,3%, et affiche 95% de succès sur 40 essais menés sur un robot quadrupède physique, à environ 5 Hz. Ces résultats répondent à deux limites connues des pipelines zero-shot en vocabulaire ouvert : la latence élevée et le manque de preuves fiables pour confirmer une cible, deux facteurs qui freinent le passage de la démonstration simulée au déploiement réel. En traitant l'absence de détection comme une preuve négative, AECNav réduit les faux positifs causés par des objets visuellement proches de la cible, un problème classique des robots mobiles autonomes. Pour les intégrateurs évaluant des architectures de navigation sémantique ou vision-language-action, la validation sur un robot quadrupède physique, plutôt qu'une simple vidéo sélectionnée, suggère que le zero-shot en vocabulaire ouvert approche de taux de réussite exploitables hors simulation, même si l'échantillon de 40 essais reste limité pour conclure à une robustesse à grande échelle. Le texte est une prépublication arXiv en attente de relecture ; les auteurs précisent que le code ne sera publié qu'après acceptation, ce qui situe ces travaux côté recherche plutôt que produit commercial. AECNav s'inscrit dans la lignée des méthodes de navigation zero-shot déjà explorées par la communauté robotique, dont beaucoup souffrent de pipelines de perception redondants, un défaut que son encodage partagé vise à corriger. Aucun laboratoire, entreprise ou plateforme robotique commerciale n'est nommé dans le résumé ; les essais ont porté sur un robot quadrupède non identifié. La suite logique, si l'article est accepté, passera par la publication du code et des tests à plus grande échelle.

RecherchePaper
1 source
Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert
2arXiv cs.RO 

Mémoire à long terme pour agents VLA dans l'exécution de tâches en environnement ouvert

Une équipe de chercheurs a publié le 22 avril 2026 sur arXiv (ref. 2504.15671) les résultats de ChemBot, un système robotique conçu pour automatiser des protocoles d'expérimentation chimique complexes en laboratoire. ChemBot repose sur une architecture à deux couches couplant un agent IA planificateur à un modèle Vision-Language-Action (VLA) baptisé Skill-VLA, capable de décomposer hiérarchiquement des tâches longues, typiquement des protocoles multi-étapes, puis de les exécuter sur des robots collaboratifs. Le système intègre une mémoire persistante à double niveau qui archive les trajectoires réussies sous forme d'assets réutilisables, et s'appuie sur un serveur Model Context Protocol (MCP) pour orchestrer les sous-agents et les outils. Un mécanisme d'inférence asynchrone basé sur la prédiction d'états futurs est également implémenté pour réduire les discontinuités de trajectoire, un défaut récurrent des VLA standards. Les expériences rapportées montrent des taux de succès et une précision opérationnelle supérieurs aux baselines VLA existantes sur des scénarios longs et multi-étapes. Ce travail adresse une limite structurelle bien documentée des modèles VLA : leur incapacité à capitaliser sur les expériences passées, ce qui force le système à recommencer par tâtonnements à chaque nouvelle session. En intégrant une mémoire persistante récupérable, ChemBot réduit concrètement le "trial-and-error gap" dans des environnements à longue horizon de planification, un problème critique pour l'automatisation de laboratoire où une erreur en milieu de protocole peut invalider toute une expérience. C'est également une démonstration applicative du sim-to-real dans un domaine non industriel, le laboratoire chimique, traditionnellement peu couvert par les benchmarks robotiques. Pour les intégrateurs B2B dans le pharma ou la recherche chimique, cela constitue un signal concret vers des robots de laboratoire autonomes capables de gérer des workflows non déterministes. Les modèles VLA ont connu une montée en puissance rapide depuis 2023 avec des travaux comme RT-2 (Google DeepMind), OpenVLA et Pi-0 (Physical Intelligence), mais la majorité des déploiements restent limités à des tâches courtes et répétitives. ChemBot se positionne dans le segment émergent des "long-horizon VLA", aux côtés de travaux comme SayCan ou des architectures hiérarchiques de Carnegie Mellon. Aucun déploiement industriel n'est annoncé à ce stade, il s'agit d'une publication académique avec validation sur robots collaboratifs en environnement contrôlé. Les prochaines étapes logiques incluent des tests sur des plateformes comme les robots Universal Robots ou Franka, et une intégration potentielle avec des systèmes LIMS existants dans les laboratoires pharmaceutiques.

RechercheOpinion
1 source
SAP-Nav : représentation sémantique spatiale et perception active pour la navigation hiérarchique à vocabulaire ouvert
3arXiv cs.RO 

SAP-Nav : représentation sémantique spatiale et perception active pour la navigation hiérarchique à vocabulaire ouvert

Des chercheurs ont publié sur arXiv (2608.12707v1) SAP-Nav, un framework de navigation robotique zero-shot conçu pour suivre des instructions en langage libre désignant une cible à l'échelle de la scène, de la pièce, de la région ou de l'instance, dans des environnements inconnus (navigation hiérarchique vers des objets à vocabulaire ouvert, ou OVON). Sans entraînement dédié à la tâche ni carte préconstruite, le système bâtit en continu une représentation spatiale sémantique interrogeable à partir des vues de pièces acquises activement par l'agent, et s'appuie sur un module de vérification active du point de vue : si l'observation courante ne fournit pas assez d'indices, l'agent se repositionne vers un emplacement plus informatif avant de confronter les candidats aux contraintes de catégorie et d'attributs. Évalué sur les benchmarks LangMap et HM3D-OVON, SAP-Nav obtient les meilleurs scores globaux, avec un gain de 12,2 points de taux de réussite sur la navigation au niveau région par rapport aux méthodes entraînées spécifiquement. Des tests sur robot réel confirment la faisabilité pratique de l'approche ; le code source ne sera publié qu'après acceptation de l'article. Ce travail répond à une tension classique de la navigation robotique sous observation partielle : l'ancrage spatial exige une mémoire persistante de l'environnement, tandis que la vérification de la cible exige des vues nettes et discriminantes, deux besoins difficiles à concilier simultanément. En misant sur la perception active plutôt que sur un entraînement lourd ou des cartes précalculées, SAP-Nav généralise directement à de nouveaux lieux, un atout pour les robots de service ou les AMR devant exécuter des instructions en langage naturel sans reconfiguration site par site. Le gain annoncé reste toutefois mesuré sur des benchmarks simulés, et la démonstration sur robot réel atteste avant tout une faisabilité technique, pas un déploiement en conditions industrielles. SAP-Nav prolonge LangMap, un travail antérieur qui a formalisé ce cadre hiérarchique en distinguant indices de scène, de pièce, de région et d'instance. Il se positionne comme alternative zero-shot aux méthodes dites "training-based", qui nécessitent un apprentissage spécifique ou des cartes de scène précalculées, tout en restant compatible avec la navigation classique par catégorie. Aucune entreprise ni laboratoire n'est cité dans le résumé, ce qui indique une contribution académique sans partenariat industriel annoncé à ce stade. Les auteurs précisent que le code source sera rendu public uniquement après acceptation de l'article, signe que la publication est encore en cours d'évaluation par les pairs et que la reproduction complète des résultats n'est pas encore possible.

RecherchePaper
1 source
Raisonnement sémantique relationnel sur des graphes de scènes 3D pour la recherche interactive d'objets en monde ouvert
4arXiv cs.RO 

Raisonnement sémantique relationnel sur des graphes de scènes 3D pour la recherche interactive d'objets en monde ouvert

Des chercheurs présentent SCOUT (Scene Graph-Based Exploration with Learned Utility), un système permettant à un robot domestique de retrouver un objet inconnu dans un environnement ouvert, sans carte préalable ni liste d'objets fixe. Publié sur arXiv (2603.05642v2), le travail propose de représenter l'environnement sous forme de graphes de scène 3D, où chaque pièce, chaque frontière inexplor ée et chaque objet reçoit un score d'utilité calculé à partir d'heuristiques relationnelles : la probabilité qu'un objet cible se trouve dans telle pièce (containment), ou qu'il soit co-localisé avec d'autres objets connus (co-occurrence). Le robot explore ainsi en priorité les zones les plus prometteuses, sans interroger un LLM à chaque étape. Pour conserver la généralisation en vocabulaire ouvert, les auteurs introduisent un cadre de distillation procédurale hors ligne : les connaissances relationnelles sont extraites d'un grand modèle de langage une fois, puis compressées dans des modèles légers exécutables directement sur le robot. Un benchmark symbolique baptisé SymSearch est également proposé pour évaluer le raisonnement sémantique dans ce type de tâches. L'enjeu central est l'équilibre entre pertinence sémantique et faisabilité temps réel, un point de friction majeur pour les intégrateurs en robotique de service. Les méthodes fondées sur la similarité d'embeddings vision-langage (type CLIP) sont rapides mais échouent sur les relations contextuelles : un robot cherchant un médicament ne déduit pas spontanément "salle de bain" depuis un embedding. Les LLMs résolvent cela mais sont trop lents et trop coûteux pour un déploiement embarqué. SCOUT, selon les évaluations menées en simulation et dans des environnements physiques réels, égale les performances des LLMs tout en restant computationnellement léger, ce qui ouvre la voie à une navigation sémantique réactive sur du matériel standard. La démonstration en environnement réel, avec des contraintes de capteurs et de navigation authentiques, atténue en partie le reproche habituel de sim-to-real gap, même si aucune métrique quantitative de transfert n'est détaillée dans le résumé. Ce travail s'inscrit dans un champ actif depuis les approches de navigation sémantique par graphes de scène (ScanQA, SceneGraph-Fusion, 3DSG), face auxquelles SCOUT se distingue par la distillation offline plutôt que par l'appel LLM en ligne. Les concurrents directs incluent les méthodes basées sur ESC, CoNaV ou L3MVN, qui exploitent des embeddings ou des LLMs pour guider l'exploration. Aucune intégration industrielle ni partenariat commercial n'est annoncé à ce stade : il s'agit d'une contribution académique avec benchmark et expériences réelles, dont la prochaine étape naturelle serait une évaluation sur des plateformes robotiques standards comme Spot ou Hello Robot Stretch.

RecherchePaper
1 source