Aller au contenu principal
RecherchearXiv cs.RO 

Agents neurosymboliques incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un agent neurosymbolique décrit dans un article publié sur arXiv sous la référence 2608.16794 vise à rendre exécutables les plans que les modèles de vision-langage (VLM) génèrent pour des tâches domestiques, alors que ces plans violent souvent la physique de l'environnement ou ciblent des objets mal identifiés. Le système fonctionne en deux phases : une exploration visuelle dirigée par la tâche construit d'abord, à partir d'observations égocentriques et d'interactions ancrées, un état symbolique initial fiable ; puis un modèle de transition PDDL restreint le décodage aux seules actions réalisables, complété par une recherche arborescente Monte Carlo (MCTS) guidée par une heuristique de planification indépendante du domaine. Testé sur les environnements simulés VirtualHome et ALFWorld, le système dépasse 90% de réussite avec des modèles ouverts de 4 à 27 milliards de paramètres, et sa version la plus légère surpasse nettement une politique visuelle directe à 27 milliards de paramètres. Sur ALFWorld, contraintes seules ou recherche seule ne résolvent chacune qu'un tiers des tâches, contre plus de 95% une fois combinées.

Cette démonstration cible un problème central de l'IA embodied : la fiabilité à l'exécution des plans produits par de grands modèles de langage, souvent convaincants en démonstration mais fragiles une fois confrontés à un environnement réel. En garantissant l'exécutabilité par construction plutôt que par apprentissage, la méthode déplace le goulot d'étranglement vers la perception : les échecs résiduels proviennent presque exclusivement d'erreurs d'ancrage visuel lors de l'acquisition de l'état, pas de la planification, ce qui réoriente l'effort de recherche vers la perception plutôt que vers des modèles toujours plus gros. L'approche consomme aussi nettement moins de tokens générés qu'un raisonnement étendu classique et bien moins d'images vues par le modèle qu'une interaction directe, un argument concret pour les intégrateurs cherchant à réduire les coûts de calcul embarqué, sans entraînement spécialisé additionnel.

Le travail s'inscrit dans la filiation de la planification symbolique classique (PDDL), réactivée par l'essor des modèles vision-langage-action qui dominent aujourd'hui la robotique humanoïde et domestique. Il s'oppose implicitement aux approches tout-apprentissage bout en bout, qui misent sur des politiques visuelles directes sans structure symbolique explicite, en montrant qu'un modèle nettement plus petit mais correctement contraint peut surpasser un modèle plus gros laissé libre. La validation reste toutefois cantonnée à des environnements simulés : le transfert vers un robot physique dépendra, selon les auteurs eux-mêmes, de la qualité de l'ancrage visuel en conditions réelles, une étape que le papier n'a pas encore testée sur matériel.

À lire aussi

P³ : vers des agents incarnés polyvalents
1arXiv cs.RO 

P³ : vers des agents incarnés polyvalents

Des chercheurs ont publié la seconde version d'un article arXiv (2508.07033v2) présentant P³, un framework unifié pour agents incarnés (embodied agents) polyvalents. Le code et les données sont disponibles sur GitHub (fz-zsl/P3). Le framework s'attaque à trois limitations identifiées dans les approches existantes: la perception dynamique de l'environnement, l'usage flexible d'outils, et la planification multi-tâches complexe. Contrairement aux méthodes précédentes qui dépendent uniquement du retour d'agents-outils pour détecter les changements d'environnement et le statut des tâches, ce qui limite l'adaptabilité en temps réel et provoque une accumulation d'erreurs, P³ permet à l'agent de percevoir activement les informations pertinentes directement depuis l'environnement. Il autorise aussi l'utilisation d'outils sans nécessiter de retour systématique, et priorise dynamiquement les tâches urgentes en ajustant leur ordre d'exécution selon leurs dépendances. Les auteurs rapportent des expérimentations en conditions réelles, sans toutefois préciser dans le résumé les métriques chiffrées, le nombre de tâches testées ou les plateformes robotiques utilisées, ce qui invite à la prudence sur la portée exacte des gains démontrés. Cette contribution touche un point sensible du secteur des agents incarnés: l'écart persistant entre les benchmarks académiques et le déploiement pratique. La plupart des architectures actuelles pour robots ou agents autonomes traitent la perception, l'usage d'outils et la planification comme des modules largement indépendants, ce qui les rend fragiles dès que l'environnement change ou que plusieurs tâches concurrentes doivent être arbitrées en temps réel. En proposant un mécanisme de planification dynamique capable de réordonner les priorités selon les dépendances, P³ répond à un problème très concret pour les intégrateurs qui cherchent à déployer des agents capables de gérer plusieurs objectifs simultanément sans supervision humaine constante, un prérequis pour toute application industrielle ou domestique à grande échelle. Le travail s'inscrit dans la lignée des recherches sur les architectures agentiques pour l'IA incarnée, qui combinent perception, raisonnement et action physique ou logicielle, un domaine où rivalisent notamment les approches fondées sur de grands modèles multimodaux couplés à des outils externes. La publication d'une seconde version de l'article, après un premier dépôt, suggère une itération liée à des retours de relecture, signe habituel d'une maturation vers une publication en conférence. La mise à disposition du code sur GitHub permettra à la communauté de reproduire et d'étendre les résultats, étape nécessaire avant toute adoption au-delà du cadre académique.

RecherchePaper
1 source
Vers un cadre pour les agents incarnés
2arXiv cs.RO 

Vers un cadre pour les agents incarnés

Un article de recherche mis en ligne le 13 aout 2026 sur arXiv (2608.11246) présente Thea, un "harness", c'est a dire une architecture d'orchestration logicielle, destine aux agents robotiques et conçu selon le principe des agents de codage: la performance dépend moins du modèle que de l'infrastructure qui l'entoure. Thea fait tourner une boucle agentique qui invoque les capacités du robot, chacune encapsulée comme un outil appelable. Les auteurs pointent deux fonctions que le monde physique refuse, contrairement au monde logiciel: lire l'état du monde et juger le résultat d'une action. Pour y remédier, le système introduit le Scene Graph as Context, une représentation symbolique persistante de l'environnement servant de contexte au modèle, et l'Evaluation as Exit Codes, un module qui détecte la fin d'une action, évalué sa réussite et diagnostique la cause d'un échec. Cette approche cible directement l'écart, souvent dénonce dans le secteur, entre démonstrations impressionnantes en environnement contrôle et exécution fiable de taches longues en conditions réelles. En fermant la boucle entre perception, action et évaluation, Thea cherche a faire émerger des comportements complexes par simple composition d'outils, sans reentrainement du modèle pour chaque nouvelle tache. L'article ne fournit toutefois aucune métrique chiffrée, ni taux de réussite ni benchmark, dans son résume: il s'agit a ce stade d'une contribution architecturale, pas d'une validation empirique a grande échelle ni d'un produit déployé. Pour les intégrateurs, l'intérêt tient a la proposition méthodologique: traiter l'agent robotique comme un agent logiciel dote d'un accès symbolique au monde plutôt que comme un modèle entraine de bout en bout. Thea prolonge directement la lignée des harnais d'agents de codage, dont le succès récent a impose ce paradigme d'infrastructure au delà du monde logiciel, et rejoint les recherches en cours sur les modèles vision-langage-action cherchant a leur adjoindre une mémoire structurée du monde plutôt qu'une politique entraînée par imitation. Le document ne précise ni l'affiliation institutionnelle des auteurs ni de calendrier de déploiement pilote. Il se presente comme une contribution académique destinée a être discutée et reproduite par la communauté, la prochaine étape logique étant une évaluation quantitative sur des taches longues en environnement réel.

RecherchePaper
1 source
Mimir : un système de mémoire neuro-symbolique à ancrage dynamique pour agents incarnés en environnements interactifs
3arXiv cs.RO 

Mimir : un système de mémoire neuro-symbolique à ancrage dynamique pour agents incarnés en environnements interactifs

Des chercheurs publient sur arXiv (4 août 2026) Mimir, un système de mémoire neuro-symbolique pour agents incarnés évoluant sous observabilité partielle. L'architecture sépare une mémoire du monde (emplacements et états des objets, preuves perceptuelles) d'une mémoire de tâche (agenda d'objectifs, progression, état de la main de l'agent, échecs, contraintes), qu'un module d'ancrage relie dynamiquement avant chaque planification. Testé sur plusieurs backbones via les benchmarks EB-ALFRED et EB-Habitat, Mimir obtient des gains allant jusqu'à 42,5% (moyenne de 23,0%) et améliore de 8,5% le taux de réussite moyen face aux meilleurs systèmes antérieurs évalués sur le même backbone. Sur le sous-ensemble de tâches longues d'EB-Habitat, il atteint 86,0% de réussite, devant les modèles propriétaires actuels. Le problème ciblé est connu : un historique plat ou un état de politique implicite ne dit pas explicitement quels faits du monde soutiennent l'objectif en cours, ce qui fragilise la planification sur des tâches longues. En séparant "ce que l'agent sait du monde" de "où il en est dans sa tâche", et en ancrant l'un dans l'autre à chaque étape, Mimir cible la dérive entre perception et progression qui limite les agents domestiques ou robotiques sur des séquences multi-étapes. Dépasser des modèles fermés sur le sous-ensemble long-horizon d'EB-Habitat, benchmark utilisé comme proxy vers la robotique physique, suggère qu'une mémoire explicite et modulaire peut surpasser des politiques bout-en-bout plus opaques. EB-ALFRED et EB-Habitat dérivent respectivement d'ALFRED (tâches ménagères instruites en langage naturel) et d'Habitat, le simulateur d'intérieurs de Meta AI, tous deux utilisés pour évaluer des agents en observabilité partielle. Mimir s'inscrit dans une lignée récente de travaux sur la mémoire augmentée pour agents LLM, où plusieurs équipes académiques et industrielles combinent raisonnement symbolique et perception neuronale pour étendre l'horizon de planification. Les auteurs comparent leurs résultats aux "meilleurs systèmes d'agents et de mémoire antérieurs" sans les nommer précisément, ce qui limite l'évaluation de l'avance réellement revendiquée. Le code, annoncé "prochainement", n'est pas encore disponible, et aucun test sur robot physique n'est mentionné : tous les résultats proviennent de simulation.

RecherchePaper
1 source
TypeGo : un runtime système pour agents incarnés
4arXiv cs.RO 

TypeGo : un runtime système pour agents incarnés

TypeGo est un nouveau runtime de type "système d'exploitation" pour agents incarnés, présenté dans un article arXiv (2607.05482v1) publié le 8 juillet 2026. Le prototype a été testé sur Kalos, un quadrupède Unitree Go2, et structure la planification par LLM en boucles asynchrones à plusieurs échelles de temps qui se chevauchent avec l'exécution physique du robot. Son composant central, le Skill Kernel, arbitre des sous-systèmes physiques typés entre plusieurs processus concurrents par tâche, tandis qu'un ordonnanceur peut préempter, reprendre ou remplacer ces processus selon leur source. Le système utilise aussi un mécanisme de "streaming" spéculatif de compétences qui masque la latence du LLM derrière le mouvement en cours, plus un chemin rapide pour la première action garantissant un retour visible en moins d'une seconde. Résultat mesuré sur la suite de tâches des chercheurs: le délai par étape chute de 50% par rapport à une planification pas-à-pas classique, et le délai avant première action baisse de 73% par rapport à une planification monolithique, avec une faible surcharge d'ordonnancement même en cas de tâches concurrentes. L'enjeu dépasse la simple optimisation de latence: TypeGo attaque un problème structurel largement ignoré par les démonstrations actuelles de robots pilotés par LLM, à savoir que traiter un modèle de langage comme un oracle requête/réponse sur le chemin critique de contrôle est incompatible avec le temps réel et la gestion de tâches concurrentes. En empruntant les principes d'un OS classique (gestion de ressources matérielles, préemption, ordonnancement) pour orchestrer un corps robotique, les auteurs proposent une réponse concrète à l'écart persistant entre les capacités de planification des VLA en démonstration et leur fiabilité en exécution réelle, sujet central pour tout intégrateur ou décideur évaluant le déploiement de robots pilotés par IA générative. Ce travail s'inscrit dans la lignée des architectures combinant LLM et contrôle robotique bas niveau, où la latence des modèles de langage reste un goulot d'étranglement majeur face aux exigences de réactivité physique. Il s'agit à ce stade d'un prototype de recherche académique, validé sur une suite de tâches restreinte avec un seul robot quadrupède, et non d'un produit commercialisé ou déployé en flotte. Les auteurs ne précisent pas de calendrier de transfert vers l'industrie, mais posent les bases conceptuelles d'un runtime générique que d'autres plateformes robotiques pourraient reprendre.

RecherchePaper
1 source