Mémoire rétrospective à vocabulaire ouvert pour la recherche d'objets sur le long terme
Une équipe de chercheurs publie sur arXiv (2610.00330) ECROM, une méthode de mémoire à vocabulaire ouvert pour la recherche d'objets sur de longues durées par un robot mobile. Le système estime la prévalence à long terme d'un concept, spécifié uniquement au moment de la requête, et convertit cette croyance directement en prior de recherche active. Les auteurs ont aussi construit un benchmark contrôlé de dix habitats HM3D, où le placement des objets et les opportunités d'observation varient indépendamment au fil de passages répétés. Sur des requêtes jamais vues, ECROM gagne 4,5 points d'average precision (AP) au niveau du support et 4,2 points de SPL (Success weighted by Path Length, métrique de recherche d'objet) par rapport à la meilleure mémoire concurrente, mesurée séparément pour chaque métrique. Benchmark, jeu de données et code seront publiés en open source. Il s'agit d'un préprint, sans déploiement sur robot réel annoncé.
L'idée centrale est de traiter les observations comme des données censurées. Une détection ou une non-détection ne pèse sur la croyance qu'en proportion de l'opportunité qu'avait le robot d'observer l'endroit concerné. Un objet « absent » d'une pièce que le robot n'a fait que traverser ne dit presque rien, alors qu'une pièce inspectée de près à de nombreuses reprises est une preuve solide. Beaucoup de mémoires sémantiques existantes accumulent détections et absences sans pondérer cette exposition, ce qui biaise l'apprentissage vers les zones les plus visitées. Pour un intégrateur ou un exploitant de robots de service, d'entrepôt ou d'assistance à domicile, c'est un problème concret, car les trajectoires réelles sont inégales par construction. Les gains restent modestes et mesurés en simulation, sur dix scènes.
Ces travaux s'inscrivent dans la lignée des cartes sémantiques à vocabulaire ouvert, construites sur des modèles vision-langage, et de la navigation par objectif (ObjectNav), qui a longtemps supposé des environnements statiques ou une mémoire d'un seul épisode. La mémoire à long terme dans des environnements changeants reste moins évaluée, faute de benchmarks qui séparent l'effet du placement de celui de l'observation. C'est cette lacune que le jeu de données veut combler. Les auteurs ne comparent leur méthode qu'à d'autres mémoires, sans validation en conditions réelles. Les suites probables sont la publication du code et un test sur plateforme physique, étape qui dira si le gain tient face au bruit de perception et au changement réel des environnements.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




