Aller au contenu principal
Compiler et évaluer les horizons d'états de tâche pour les agents incarnés
RecherchearXiv cs.RO 

Compiler et évaluer les horizons d'états de tâche pour les agents incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'agence de recherche IA vient de publier un article arXiv (2608.08036, non révisé par les pairs) qui identifie une faille dans la façon dont l'industrie évalue les agents robotiques capables de planification longue durée. L'équipe introduit la notion de "task-state horizon" (TSH), c'est-à-dire l'étendue des transitions d'état pertinentes pour la tâche qu'un agent doit suivre au fil du temps, y compris celles causées par ses propres explorations, la dynamique de l'environnement, des échecs inattendus ou des interventions externes. Pour mesurer ce facteur, jusqu'ici ignoré par les benchmarks existants qui se contentent de mesurer la longueur des séquences d'actions ou la complexité des sous-tâches, les chercheurs ont développé RoboGraph, un compilateur de tâches robotiques qui traduit les dépendances de transition d'état en graphes symboliques exécutables. Ils publient également un benchmark associé de 588 épisodes répartis sur 84 scènes, avec des niveaux de TSH variables. Testés sur cet ensemble, en environnement fermé sémantique et visuel, 15 modèles agentiques de pointe ont été évalués, sans que les noms précis de ces modèles ne soient détaillés dans le résumé disponible.

Ce travail est important car il déplace la question centrale de l'évaluation robotique : la difficulté d'une tâche ne se réduit pas à sa longueur ou à son nombre d'étapes, mais dépend de la capacité de l'agent à maintenir, explorer et mettre à jour une représentation cohérente de l'état du monde sur la durée. Pour les intégrateurs et décideurs qui évaluent des piles de planification haut niveau associées à des modèles vision-langage-action (VLA), ce résultat suggère que des benchmarks de "longue durée" bien notés peuvent masquer des faiblesses réelles sur des tâches où l'état évolue de façon imprévisible, un cas fréquent en environnement industriel réel. L'étude confirme empiriquement que la majorité des modèles agentiques testés peinent dès que le TSH devient exigeant, ce qui nuance les annonces de robustesse "long-horizon" faites par certains fournisseurs de modèles de fondation robotique.

Ce travail s'inscrit dans la vague récente de benchmarks cherchant à dépasser les métriques simplistes (taux de succès, nombre d'étapes) pour capturer des dimensions cognitives plus fines de l'autonomie robotique, à l'image d'efforts antérieurs sur la mémoire ou le raisonnement causal des agents. Les auteurs ne précisent pas, dans le résumé, l'identité des laboratoires ou entreprises ayant développé les 15 modèles testés ni un calendrier de suites prévues ; RoboGraph et le benchmark associé sont présentés comme des outils ouverts destinés à orienter les prochaines générations d'agents planificateurs vers une meilleure gestion des états de tâche, plutôt que comme un produit ou déploiement commercial.

À lire aussi

Au-delà de la description : évaluer cognitivement l'action fine pour les agents incarnés
1arXiv cs.RO 

Au-delà de la description : évaluer cognitivement l'action fine pour les agents incarnés

Des chercheurs ont publié CFG-Bench, un nouveau benchmark destiné à évaluer la capacité des grands modèles multimodaux (MLLM) à raisonner sur l'action fine dans des environnements physiques, plutôt que sur la simple planification de haut niveau ou le raisonnement spatial déjà couverts par les benchmarks existants. L'article, disponible sur arXiv (2511.18685), détaille un corpus de 1 368 vidéos annotées, associées à 19 562 paires question-réponse. Ces données couvrent trois paradigmes d'évaluation et quatre capacités cognitives distinctes : l'interaction physique, la relation temporelle-causale, la compréhension intentionnelle et le jugement évaluatif. L'objectif est de mesurer si un modèle sait traduire une observation visuelle en connaissance actionnable, au-delà de la simple reconnaissance d'objets ou de scènes. Les résultats sont significatifs pour l'écosystème des agents incarnés (embodied agents) qui s'appuient de plus en plus sur des architectures vision-langage-action (VLA) pour piloter robots et humanoïdes. Les auteurs montrent que même les MLLM les plus performants du marché peinent à produire des instructions détaillées pour des interactions physiques concrètes, et présentent des lacunes marquées dès qu'il s'agit de raisonnement d'ordre supérieur, comme inférer une intention ou juger la qualité d'une action. C'est un signal notable pour les intégrateurs et équipes de recherche qui misent sur ces modèles comme moteurs de décision : la compréhension de haut niveau ne garantit pas une exécution fine et fiable, un des points de friction identifiés dans l'écart persistant entre démonstration et déploiement réel en robotique. Point plus encourageant pour le secteur : les auteurs démontrent qu'un fine-tuning supervisé (SFT) sur les données de CFG-Bench, en apprenant explicitement au modèle à articuler des actions fines, se traduit par des gains de performance mesurables sur des benchmarks incarnés déjà établis. Cela suggère une piste d'amélioration directe et reproductible pour les futurs modèles VLA, plutôt qu'une simple mise en évidence de leurs limites. Le projet s'inscrit dans la vague de benchmarks spécialisés qui cherchent à combler les angles morts des évaluations génériques de MLLM. La page du projet et le jeu de données sont accessibles publiquement via cfg-bench.github.io, ouvrant la voie à des comparaisons futures entre laboratoires et fournisseurs de modèles.

RecherchePaper
1 source
ETA : un nouveau paradigme à base d'agents pour les tâches incarnées
2arXiv cs.RO 

ETA : un nouveau paradigme à base d'agents pour les tâches incarnées

Un nouveau papier de recherche publié sur arXiv (référence 2608.03924, version 1) présente ETA, pour Embodied Task Agent, un paradigme conçu pour étendre les agents numériques au monde physique. Les auteurs publient en parallèle OpenETA, une implémentation open source du système. L'architecture repose sur une boucle à trois éléments : un Planner qui sélectionne un appel d'outil à la fois, une Interface qui pilote l'exécution de cet appel, et un World qui renvoie le résultat de l'action ainsi qu'une observation fraîche de l'environnement. Cette boucle permet à l'agent de vérifier ce qu'il a réellement accompli, de corriger son plan en conséquence, et de conserver les interactions réussies comme les échecs sous forme d'expérience réutilisable. OpenETA propose des Planners interchangeables, des Tools et Skills composables, une mémoire consultable a posteriori, des trajectoires rejouables, ainsi que des interfaces communes pour la simulation et pour des robots réels. Le papier mentionne aussi une intégration légère avec Codex, où OpenETA tourne comme un plugin limité à trois fonctions : observe, markpoint et moveto. L'enjeu que pose l'équipe est celui du moment "ChatGPT" de la robotique : un robot généraliste capable de gérer des tâches et des environnements inconnus, tout en restant contrôlable sur des interactions longues. Les auteurs pointent une limite des systèmes actuels, majoritairement bâtis en bout en bout de l'observation vers l'action : leur généralisation dépend fortement de la couverture des données d'entraînement, et l'exécution de tâches longues reste difficile à superviser et à inspecter. En important le schéma agentique du monde des LLM (choix d'outil, vérification, mémoire auditable) plutôt qu'une politique monolithique, ETA vise justement l'inspectabilité et la traçabilité, deux propriétés recherchées par les intégrateurs et décideurs industriels pour le débogage, la sécurité et l'éventuelle certification, là où les modèles vision-langage-action de bout en bout restent largement des boîtes noires. Il s'agit à ce stade d'un article de recherche accompagné d'un code source ouvert, sans déploiement industriel ni partenariat annoncé : le texte ne cite aucune entreprise ni site de production. La démarche se distingue des modèles VLA propriétaires à grande échelle qui dominent la course humanoïde actuelle, en empruntant plutôt aux architectures d'agents logiciels à base d'outils déjà répandues côté LLM. La suite logique passera par l'adoption du code OpenETA par la communauté, avec des évaluations en simulation puis sur robots réels pour confirmer si cette approche modulaire tient la comparaison face aux politiques end-to-end sur des tâches longues et non familières.

RecherchePaper
1 source
REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?
3arXiv cs.RO 

REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?

Des chercheurs ont publié REI-Bench (arXiv:2505.10872), le premier benchmark dédié à évaluer comment les planificateurs de tâches robotiques basés sur des grands modèles de langage (LLM) gèrent les instructions humaines vagues. L'étude porte spécifiquement sur les expressions référentielles (ER), formulations dont le sens dépend du contexte dialogique et de l'environnement immédiat, comme "prends ça" ou "mets-le là-bas". Les expériences montrent que cette ambiguïté fait chuter le taux de succès des planificateurs jusqu'à 36,9 points de pourcentage. L'analyse des cas d'échec révèle que la majorité provient d'objets manquants dans les plans générés : le modèle ne résout pas correctement la référence et omet l'objet cible de la séquence d'actions. Ce résultat est significatif pour les intégrateurs et les équipes qui déploient des robots en environnement non contrôlé. La quasi-totalité des benchmarks existants, et donc des pipelines de planification actuels, supposent des instructions claires et structurées, ce qui correspond à un utilisateur expert. Or, les populations prioritaires pour la robotique de service (personnes âgées, enfants, opérateurs non formés) sont précisément celles qui formulent des instructions les plus ambiguës. La dégradation mesurée n'est pas marginale : un écart de 37 points sur le taux de succès représente un planificateur fonctionnel en labo qui devient inutilisable en conditions réelles. Le papier souligne également que les approches classiques d'atténuation, prompts enrichis, chaînes de pensée (chain-of-thought), apprentissage en contexte (in-context learning), ne suffisent pas à combler cet écart. Pour y répondre, les auteurs proposent une méthode appelée "task-oriented context cognition" : avant de générer le plan d'action, le système produit explicitement une instruction reformulée et désambiguïsée à partir du contexte environnemental et dialogique. Cette approche atteint l'état de l'art sur REI-Bench en surpassant les baselines précitées. Le benchmark s'inscrit dans un effort plus large de la communauté pour combler le fossé entre performances en simulation et déploiement réel, un problème central pour des acteurs comme Boston Dynamics, Agility Robotics ou les startups européennes telles qu'Enchanted Tools, dont les robots humanoïdes devront interagir avec des utilisateurs non techniques. Les prochaines étapes naturelles seraient d'intégrer REI-Bench dans les pipelines d'évaluation de modèles VLA (vision-language-action) comme pi0 ou OpenVLA, où la résolution de références visuelles et linguistiques est un point de friction connu.

UEL'approche de désambiguïsation proposée (task-oriented context cognition) est directement applicable aux équipes européennes développant des robots de service pour utilisateurs non techniques, notamment les startups comme Enchanted Tools dont les humanoïdes devront gérer des instructions vagues d'opérateurs non formés.

RecherchePaper
1 source
Modélisation monde-ego pour l'évolution à long horizon dans les tâches hybrides incarnées
4arXiv cs.RO 

Modélisation monde-ego pour l'évolution à long horizon dans les tâches hybrides incarnées

Des chercheurs ont publié sur arXiv en mai 2026 (arXiv:2605.19957) un nouveau paradigme appelé World-Ego Modeling, accompagné d'une implémentation concrète, le World-Ego Model (WEM). Le problème ciblé : les world models actuels prédisent l'évolution de la scène et du robot dans un flux unique, confondant deux dynamiques de nature différente, les régularités persistantes de l'environnement d'un côté et la dynamique propre à l'agent conditionnée par ses instructions de l'autre. Ce couplage dégrade les performances sur les tâches hybrides longue horizon, où navigation autonome et manipulation d'objets s'entrelacent. WEM sépare explicitement ces deux composantes via un planificateur implicite dual, couplé à un générateur de diffusion CP-MoE (cascade-parallel mixture-of-experts). Les auteurs publient également HTEWorld, présenté comme le premier benchmark dédié à ce type de tâches, avec 125 000 clips vidéo totalisant plus de 4,5 millions de frames et 300 trajectoires multi-tours représentant plus de 2 000 instructions. WEM atteint l'état de l'art sur HTEWorld et reste compétitif sur les benchmarks de manipulation seule. L'enjeu touche directement les systèmes de manipulation mobile : robots logistiques à bras, humanoïdes polyvalents, AMR avec capacités de saisie. La majorité des world models sont entraînés soit sur de la navigation pure, soit sur de la manipulation fixe, rarement sur des séquences hybrides longues où l'agent doit enchaîner déplacement, identification et manipulation sans intervention humaine. WEM formalise la désambiguation monde-ego et propose trois stratégies de désenchevêtrement (post-, pré- et complet), ouvrant un cadre de comparaison structuré pour les futures architectures VLA ; la création d'HTEWorld comble simultanément un manque concret, l'absence de référence commune pour les tâches hybrides rendant jusqu'ici les comparaisons entre approches difficiles à établir. Ce travail s'inscrit dans l'effervescence autour des world models incarnés, aux côtés de projets comme UniSim (Google DeepMind) ou Genie, et en parallèle des efforts des constructeurs d'humanoïdes comme Figure AI, Agility Robotics et NVIDIA (GR00T N2) sur la planification longue horizon. WEM reste un résultat académique : la validation sur robot réel n'est pas documentée dans l'article, et le code ainsi que les données HTEWorld n'étaient pas encore disponibles à la date de dépôt. Les suites naturelles sont l'évaluation sim-to-real et l'intégration avec des VLA à grande échelle comme pi-0 (Physical Intelligence) ou GR00T N2.

RechercheOpinion
1 source