Aller au contenu principal
TypeGo : un runtime système pour agents incarnés
RecherchearXiv cs.RO 

TypeGo : un runtime système pour agents incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

TypeGo est un nouveau runtime de type "système d'exploitation" pour agents incarnés, présenté dans un article arXiv (2607.05482v1) publié le 8 juillet 2026. Le prototype a été testé sur Kalos, un quadrupède Unitree Go2, et structure la planification par LLM en boucles asynchrones à plusieurs échelles de temps qui se chevauchent avec l'exécution physique du robot. Son composant central, le Skill Kernel, arbitre des sous-systèmes physiques typés entre plusieurs processus concurrents par tâche, tandis qu'un ordonnanceur peut préempter, reprendre ou remplacer ces processus selon leur source. Le système utilise aussi un mécanisme de "streaming" spéculatif de compétences qui masque la latence du LLM derrière le mouvement en cours, plus un chemin rapide pour la première action garantissant un retour visible en moins d'une seconde. Résultat mesuré sur la suite de tâches des chercheurs: le délai par étape chute de 50% par rapport à une planification pas-à-pas classique, et le délai avant première action baisse de 73% par rapport à une planification monolithique, avec une faible surcharge d'ordonnancement même en cas de tâches concurrentes.

L'enjeu dépasse la simple optimisation de latence: TypeGo attaque un problème structurel largement ignoré par les démonstrations actuelles de robots pilotés par LLM, à savoir que traiter un modèle de langage comme un oracle requête/réponse sur le chemin critique de contrôle est incompatible avec le temps réel et la gestion de tâches concurrentes. En empruntant les principes d'un OS classique (gestion de ressources matérielles, préemption, ordonnancement) pour orchestrer un corps robotique, les auteurs proposent une réponse concrète à l'écart persistant entre les capacités de planification des VLA en démonstration et leur fiabilité en exécution réelle, sujet central pour tout intégrateur ou décideur évaluant le déploiement de robots pilotés par IA générative.

Ce travail s'inscrit dans la lignée des architectures combinant LLM et contrôle robotique bas niveau, où la latence des modèles de langage reste un goulot d'étranglement majeur face aux exigences de réactivité physique. Il s'agit à ce stade d'un prototype de recherche académique, validé sur une suite de tâches restreinte avec un seul robot quadrupède, et non d'un produit commercialisé ou déployé en flotte. Les auteurs ne précisent pas de calendrier de transfert vers l'industrie, mais posent les bases conceptuelles d'un runtime générique que d'autres plateformes robotiques pourraient reprendre.

Dans nos dossiers

À lire aussi

Vers un cadre pour les agents incarnés
1arXiv cs.RO 

Vers un cadre pour les agents incarnés

Un article de recherche mis en ligne le 13 aout 2026 sur arXiv (2608.11246) présente Thea, un "harness", c'est a dire une architecture d'orchestration logicielle, destine aux agents robotiques et conçu selon le principe des agents de codage: la performance dépend moins du modèle que de l'infrastructure qui l'entoure. Thea fait tourner une boucle agentique qui invoque les capacités du robot, chacune encapsulée comme un outil appelable. Les auteurs pointent deux fonctions que le monde physique refuse, contrairement au monde logiciel: lire l'état du monde et juger le résultat d'une action. Pour y remédier, le système introduit le Scene Graph as Context, une représentation symbolique persistante de l'environnement servant de contexte au modèle, et l'Evaluation as Exit Codes, un module qui détecte la fin d'une action, évalué sa réussite et diagnostique la cause d'un échec. Cette approche cible directement l'écart, souvent dénonce dans le secteur, entre démonstrations impressionnantes en environnement contrôle et exécution fiable de taches longues en conditions réelles. En fermant la boucle entre perception, action et évaluation, Thea cherche a faire émerger des comportements complexes par simple composition d'outils, sans reentrainement du modèle pour chaque nouvelle tache. L'article ne fournit toutefois aucune métrique chiffrée, ni taux de réussite ni benchmark, dans son résume: il s'agit a ce stade d'une contribution architecturale, pas d'une validation empirique a grande échelle ni d'un produit déployé. Pour les intégrateurs, l'intérêt tient a la proposition méthodologique: traiter l'agent robotique comme un agent logiciel dote d'un accès symbolique au monde plutôt que comme un modèle entraine de bout en bout. Thea prolonge directement la lignée des harnais d'agents de codage, dont le succès récent a impose ce paradigme d'infrastructure au delà du monde logiciel, et rejoint les recherches en cours sur les modèles vision-langage-action cherchant a leur adjoindre une mémoire structurée du monde plutôt qu'une politique entraînée par imitation. Le document ne précise ni l'affiliation institutionnelle des auteurs ni de calendrier de déploiement pilote. Il se presente comme une contribution académique destinée a être discutée et reproduite par la communauté, la prochaine étape logique étant une évaluation quantitative sur des taches longues en environnement réel.

RecherchePaper
1 source
eMEM : un système de mémoire spatio-temporelle hybride pour agents à base d'IA incarnée
2arXiv cs.RO 

eMEM : un système de mémoire spatio-temporelle hybride pour agents à base d'IA incarnée

Une équipe de recherche a déposé sur arXiv (arXiv:2606.03374, juin 2026) un système de mémoire baptisé eMEM (Embodied Memory), conçu spécifiquement pour les agents incarnés opérant dans des environnements physiques. Contrairement aux architectures existantes comme Generative Agents, MemGPT ou A-MEM, qui stockent la mémoire sous forme de flux textuels ou de graphes de connaissances, eMEM propose une architecture multi-index combinant SQLite pour le stockage structuré, hnswlib pour la recherche sémantique par voisins les plus proches (ANN), et un R-tree pour les requêtes spatiales, le tout unifié derrière un modèle de graphe unique. Un pipeline de consolidation par niveaux transforme les observations perceptuelles brutes en résumés compressés, en s'inspirant explicitement de la consolidation hippocampo-néocorticale observée chez les mammifères. Dix outils de rappel, exposés en natif au LLM, couvrent des primitives comme la résolution concept-vers-localisation ou le rappel inter-couches. Le système tourne entièrement en mémoire vive, en co-processus avec l'agent. Sur eMEM-Bench v1, un benchmark construit sur les scènes ProcTHOR-10K autour de huit paradigmes de psychologie cognitive (leurres DRM, séparation de patterns, complétion de patterns, surveillance de source, récupération dépendante du contexte, interférence à long horizon, position sérielle, courbe de rétention augmentée par des distracteurs), eMEM atteint un score pondéré moyen de 80,8 sur 988 sondes, avec une courbe de rétention plate au plafond de 1 heure à 1 an de délai simulé sur des objets uniques par pièce. Ce résultat est significatif parce qu'il isole deux problèmes structurels des approches purement RAG : une baseline flat_rag perd 30 points sur la récupération dépendante du contexte et 29 points sur le rejet des leurres DRM, ce qui valide respectivement la contribution du stockage multi-couches et du pipeline de consolidation. Pour les intégrateurs qui déploient des agents dans des environnements industriels ou domestiques complexes, cela met en évidence un angle mort majeur : un robot ou un agent LLM utilisant une récupération sémantique plate ne peut pas distinguer "le tiroir où j'ai vu les pinces hier dans cette pièce" de "les pinces en général". L'indexation spatiale couplée à la consolidation temporelle est ce qui permet à eMEM de maintenir des performances constantes sur de longues fenêtres simulées, là où les systèmes actuels dégradent. Le choix de benchmarker sur des paradigmes issus de la psychologie cognitive humaine est méthodologiquement solide : il rend les résultats comparables à la littérature sur la mémoire biologique, ce que des benchmarks surfaciques comme LoCoMo ou OpenEQA ne permettent pas. eMEM s'inscrit dans une vague de travaux sur la mémoire à long terme pour agents LLM, portée notamment par Generative Agents (Park et al., 2023) et MemGPT (Packer et al., 2023), qui ont posé les bases mais restent aveugles à la dimension spatiale, critique pour les robots physiques. L'environnement ProcTHOR-10K offre des scènes intérieures procédurales variées, mais les performances en transfert vers des environnements réels restent entièrement à démontrer : le sim-to-real gap s'applique autant aux systèmes de mémoire qu'aux politiques motrices. Le code du système et du benchmark est rendu public, ouvrant la voie à des évaluations indépendantes. Aucun partenariat industriel ni déploiement terrain n'est mentionné : c'est une contribution académique, pas un produit. Les étapes suivantes naturelles seraient de valider eMEM sur des plateformes embarquées à mémoire contrainte et de tester sa robustesse dans des scènes dynamiques où les objets se déplacent entre deux requêtes.

RecherchePaper
1 source
P³ : vers des agents incarnés polyvalents
3arXiv cs.RO 

P³ : vers des agents incarnés polyvalents

Des chercheurs ont publié la seconde version d'un article arXiv (2508.07033v2) présentant P³, un framework unifié pour agents incarnés (embodied agents) polyvalents. Le code et les données sont disponibles sur GitHub (fz-zsl/P3). Le framework s'attaque à trois limitations identifiées dans les approches existantes: la perception dynamique de l'environnement, l'usage flexible d'outils, et la planification multi-tâches complexe. Contrairement aux méthodes précédentes qui dépendent uniquement du retour d'agents-outils pour détecter les changements d'environnement et le statut des tâches, ce qui limite l'adaptabilité en temps réel et provoque une accumulation d'erreurs, P³ permet à l'agent de percevoir activement les informations pertinentes directement depuis l'environnement. Il autorise aussi l'utilisation d'outils sans nécessiter de retour systématique, et priorise dynamiquement les tâches urgentes en ajustant leur ordre d'exécution selon leurs dépendances. Les auteurs rapportent des expérimentations en conditions réelles, sans toutefois préciser dans le résumé les métriques chiffrées, le nombre de tâches testées ou les plateformes robotiques utilisées, ce qui invite à la prudence sur la portée exacte des gains démontrés. Cette contribution touche un point sensible du secteur des agents incarnés: l'écart persistant entre les benchmarks académiques et le déploiement pratique. La plupart des architectures actuelles pour robots ou agents autonomes traitent la perception, l'usage d'outils et la planification comme des modules largement indépendants, ce qui les rend fragiles dès que l'environnement change ou que plusieurs tâches concurrentes doivent être arbitrées en temps réel. En proposant un mécanisme de planification dynamique capable de réordonner les priorités selon les dépendances, P³ répond à un problème très concret pour les intégrateurs qui cherchent à déployer des agents capables de gérer plusieurs objectifs simultanément sans supervision humaine constante, un prérequis pour toute application industrielle ou domestique à grande échelle. Le travail s'inscrit dans la lignée des recherches sur les architectures agentiques pour l'IA incarnée, qui combinent perception, raisonnement et action physique ou logicielle, un domaine où rivalisent notamment les approches fondées sur de grands modèles multimodaux couplés à des outils externes. La publication d'une seconde version de l'article, après un premier dépôt, suggère une itération liée à des retours de relecture, signe habituel d'une maturation vers une publication en conférence. La mise à disposition du code sur GitHub permettra à la communauté de reproduire et d'étendre les résultats, étape nécessaire avant toute adoption au-delà du cadre académique.

RecherchePaper
1 source
Mimir : un système de mémoire neuro-symbolique à ancrage dynamique pour agents incarnés en environnements interactifs
4arXiv cs.RO 

Mimir : un système de mémoire neuro-symbolique à ancrage dynamique pour agents incarnés en environnements interactifs

Des chercheurs publient sur arXiv (4 août 2026) Mimir, un système de mémoire neuro-symbolique pour agents incarnés évoluant sous observabilité partielle. L'architecture sépare une mémoire du monde (emplacements et états des objets, preuves perceptuelles) d'une mémoire de tâche (agenda d'objectifs, progression, état de la main de l'agent, échecs, contraintes), qu'un module d'ancrage relie dynamiquement avant chaque planification. Testé sur plusieurs backbones via les benchmarks EB-ALFRED et EB-Habitat, Mimir obtient des gains allant jusqu'à 42,5% (moyenne de 23,0%) et améliore de 8,5% le taux de réussite moyen face aux meilleurs systèmes antérieurs évalués sur le même backbone. Sur le sous-ensemble de tâches longues d'EB-Habitat, il atteint 86,0% de réussite, devant les modèles propriétaires actuels. Le problème ciblé est connu : un historique plat ou un état de politique implicite ne dit pas explicitement quels faits du monde soutiennent l'objectif en cours, ce qui fragilise la planification sur des tâches longues. En séparant "ce que l'agent sait du monde" de "où il en est dans sa tâche", et en ancrant l'un dans l'autre à chaque étape, Mimir cible la dérive entre perception et progression qui limite les agents domestiques ou robotiques sur des séquences multi-étapes. Dépasser des modèles fermés sur le sous-ensemble long-horizon d'EB-Habitat, benchmark utilisé comme proxy vers la robotique physique, suggère qu'une mémoire explicite et modulaire peut surpasser des politiques bout-en-bout plus opaques. EB-ALFRED et EB-Habitat dérivent respectivement d'ALFRED (tâches ménagères instruites en langage naturel) et d'Habitat, le simulateur d'intérieurs de Meta AI, tous deux utilisés pour évaluer des agents en observabilité partielle. Mimir s'inscrit dans une lignée récente de travaux sur la mémoire augmentée pour agents LLM, où plusieurs équipes académiques et industrielles combinent raisonnement symbolique et perception neuronale pour étendre l'horizon de planification. Les auteurs comparent leurs résultats aux "meilleurs systèmes d'agents et de mémoire antérieurs" sans les nommer précisément, ce qui limite l'évaluation de l'avance réellement revendiquée. Le code, annoncé "prochainement", n'est pas encore disponible, et aucun test sur robot physique n'est mentionné : tous les résultats proviennent de simulation.

RecherchePaper
1 source