
Mimir : un système de mémoire neuro-symbolique à ancrage dynamique pour agents incarnés en environnements interactifs
Des chercheurs publient sur arXiv (4 août 2026) Mimir, un système de mémoire neuro-symbolique pour agents incarnés évoluant sous observabilité partielle. L'architecture sépare une mémoire du monde (emplacements et états des objets, preuves perceptuelles) d'une mémoire de tâche (agenda d'objectifs, progression, état de la main de l'agent, échecs, contraintes), qu'un module d'ancrage relie dynamiquement avant chaque planification. Testé sur plusieurs backbones via les benchmarks EB-ALFRED et EB-Habitat, Mimir obtient des gains allant jusqu'à 42,5% (moyenne de 23,0%) et améliore de 8,5% le taux de réussite moyen face aux meilleurs systèmes antérieurs évalués sur le même backbone. Sur le sous-ensemble de tâches longues d'EB-Habitat, il atteint 86,0% de réussite, devant les modèles propriétaires actuels.
Le problème ciblé est connu : un historique plat ou un état de politique implicite ne dit pas explicitement quels faits du monde soutiennent l'objectif en cours, ce qui fragilise la planification sur des tâches longues. En séparant "ce que l'agent sait du monde" de "où il en est dans sa tâche", et en ancrant l'un dans l'autre à chaque étape, Mimir cible la dérive entre perception et progression qui limite les agents domestiques ou robotiques sur des séquences multi-étapes. Dépasser des modèles fermés sur le sous-ensemble long-horizon d'EB-Habitat, benchmark utilisé comme proxy vers la robotique physique, suggère qu'une mémoire explicite et modulaire peut surpasser des politiques bout-en-bout plus opaques.
EB-ALFRED et EB-Habitat dérivent respectivement d'ALFRED (tâches ménagères instruites en langage naturel) et d'Habitat, le simulateur d'intérieurs de Meta AI, tous deux utilisés pour évaluer des agents en observabilité partielle. Mimir s'inscrit dans une lignée récente de travaux sur la mémoire augmentée pour agents LLM, où plusieurs équipes académiques et industrielles combinent raisonnement symbolique et perception neuronale pour étendre l'horizon de planification. Les auteurs comparent leurs résultats aux "meilleurs systèmes d'agents et de mémoire antérieurs" sans les nommer précisément, ce qui limite l'évaluation de l'avance réellement revendiquée. Le code, annoncé "prochainement", n'est pas encore disponible, et aucun test sur robot physique n'est mentionné : tous les résultats proviennent de simulation.
Dans nos dossiers




