Aller au contenu principal
REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?
RecherchearXiv cs.RO 

REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié REI-Bench (arXiv:2505.10872), le premier benchmark dédié à évaluer comment les planificateurs de tâches robotiques basés sur des grands modèles de langage (LLM) gèrent les instructions humaines vagues. L'étude porte spécifiquement sur les expressions référentielles (ER), formulations dont le sens dépend du contexte dialogique et de l'environnement immédiat, comme "prends ça" ou "mets-le là-bas". Les expériences montrent que cette ambiguïté fait chuter le taux de succès des planificateurs jusqu'à 36,9 points de pourcentage. L'analyse des cas d'échec révèle que la majorité provient d'objets manquants dans les plans générés : le modèle ne résout pas correctement la référence et omet l'objet cible de la séquence d'actions.

Ce résultat est significatif pour les intégrateurs et les équipes qui déploient des robots en environnement non contrôlé. La quasi-totalité des benchmarks existants, et donc des pipelines de planification actuels, supposent des instructions claires et structurées, ce qui correspond à un utilisateur expert. Or, les populations prioritaires pour la robotique de service (personnes âgées, enfants, opérateurs non formés) sont précisément celles qui formulent des instructions les plus ambiguës. La dégradation mesurée n'est pas marginale : un écart de 37 points sur le taux de succès représente un planificateur fonctionnel en labo qui devient inutilisable en conditions réelles. Le papier souligne également que les approches classiques d'atténuation, prompts enrichis, chaînes de pensée (chain-of-thought), apprentissage en contexte (in-context learning), ne suffisent pas à combler cet écart.

Pour y répondre, les auteurs proposent une méthode appelée "task-oriented context cognition" : avant de générer le plan d'action, le système produit explicitement une instruction reformulée et désambiguïsée à partir du contexte environnemental et dialogique. Cette approche atteint l'état de l'art sur REI-Bench en surpassant les baselines précitées. Le benchmark s'inscrit dans un effort plus large de la communauté pour combler le fossé entre performances en simulation et déploiement réel, un problème central pour des acteurs comme Boston Dynamics, Agility Robotics ou les startups européennes telles qu'Enchanted Tools, dont les robots humanoïdes devront interagir avec des utilisateurs non techniques. Les prochaines étapes naturelles seraient d'intégrer REI-Bench dans les pipelines d'évaluation de modèles VLA (vision-language-action) comme pi0 ou OpenVLA, où la résolution de références visuelles et linguistiques est un point de friction connu.

Impact France/UE

L'approche de désambiguïsation proposée (task-oriented context cognition) est directement applicable aux équipes européennes développant des robots de service pour utilisateurs non techniques, notamment les startups comme Enchanted Tools dont les humanoïdes devront gérer des instructions vagues d'opérateurs non formés.

À lire aussi

CoCoBench : un benchmark de coordination coopérative pour la planification de tâches multi-agents incarnés
1arXiv cs.RO 

CoCoBench : un benchmark de coordination coopérative pour la planification de tâches multi-agents incarnés

Des chercheurs ont présenté CoCoBench, un benchmark conçu pour évaluer la coordination entre agents dans des tâches domestiques exécutables pilotées par des modèles de langage multimodaux (MLLM). L'ensemble comprend 897 instances validées par un oracle, organisées autour de quatre constructions récurrentes de coordination : l'allocation des tâches, l'ordonnancement séquentiel, l'exclusion mutuelle et la coordination des transferts (handoff) entre agents. Au-delà du taux de réussite global des tâches, CoCoBench introduit des scores par construction, qui mesurent précisément si les agents coordonnent effectivement leurs actions plutôt que de simplement atteindre l'objectif final. Les auteurs ont évalué 11 MLLM de premier plan selon différents modes de coordination, types d'observations et nombres d'agents engagés. Le papier a été publié sur arXiv fin août 2026 et s'inscrit dans le champ des agents incarnés multi-robots pour l'environnement domestique. L'apport principal de ce travail est de démontrer que les benchmarks existants, qui résument la performance multi-agent à un simple taux de réussite global, masquent des défaillances de coordination bien réelles : travail dupliqué entre agents, violations des contraintes d'ordre, conflits d'accès aux ressources partagées et désynchronisation lors des transferts de tâches. Les résultats montrent que la capacité de coordination est fortement spécifique à chaque construction : un modèle affichant un bon score global peut échouer nettement sur un type précis de coordination, comme l'exclusion mutuelle, tout en excellant sur un autre. Ce constat contredit l'hypothèse implicite de nombreux acteurs du secteur selon laquelle un haut taux de succès agrégé traduit une compétence de coordination équilibrée. Pour les intégrateurs et décideurs qui envisagent des flottes de robots collaboratifs pilotés par des architectures VLA ou MLLM, ce diagnostic granulaire signale que les métriques usuelles ne suffisent pas à qualifier la fiabilité opérationnelle en environnement partagé. Ce travail s'inscrit dans la progression rapide des systèmes d'agents fondés sur les MLLM ces dernières années, un domaine où l'évaluation a longtemps privilégié soit l'accomplissement de tâches par un agent unique, soit des métriques agrégées peu diagnostiques pour les scénarios multi-agents. CoCoBench cherche à combler ce vide en proposant une évaluation au niveau des mécanismes de coordination eux-mêmes plutôt que du seul résultat final. Les auteurs positionnent leurs conclusions comme une piste concrète pour orienter la conception de futures architectures de modèles et améliorer spécifiquement les capacités de coordination multi-agent, plutôt que d'optimiser uniquement le taux de réussite agrégé. Aucun calendrier de déploiement industriel ni partenariat commercial n'est mentionné : il s'agit à ce stade d'une contribution de recherche et d'un outil de benchmark, destiné à la communauté académique et aux équipes développant des systèmes multi-robots embodied.

RecherchePaper
1 source
Compiler et évaluer les horizons d'états de tâche pour les agents incarnés
2arXiv cs.RO 

Compiler et évaluer les horizons d'états de tâche pour les agents incarnés

L'agence de recherche IA vient de publier un article arXiv (2608.08036, non révisé par les pairs) qui identifie une faille dans la façon dont l'industrie évalue les agents robotiques capables de planification longue durée. L'équipe introduit la notion de "task-state horizon" (TSH), c'est-à-dire l'étendue des transitions d'état pertinentes pour la tâche qu'un agent doit suivre au fil du temps, y compris celles causées par ses propres explorations, la dynamique de l'environnement, des échecs inattendus ou des interventions externes. Pour mesurer ce facteur, jusqu'ici ignoré par les benchmarks existants qui se contentent de mesurer la longueur des séquences d'actions ou la complexité des sous-tâches, les chercheurs ont développé RoboGraph, un compilateur de tâches robotiques qui traduit les dépendances de transition d'état en graphes symboliques exécutables. Ils publient également un benchmark associé de 588 épisodes répartis sur 84 scènes, avec des niveaux de TSH variables. Testés sur cet ensemble, en environnement fermé sémantique et visuel, 15 modèles agentiques de pointe ont été évalués, sans que les noms précis de ces modèles ne soient détaillés dans le résumé disponible. Ce travail est important car il déplace la question centrale de l'évaluation robotique : la difficulté d'une tâche ne se réduit pas à sa longueur ou à son nombre d'étapes, mais dépend de la capacité de l'agent à maintenir, explorer et mettre à jour une représentation cohérente de l'état du monde sur la durée. Pour les intégrateurs et décideurs qui évaluent des piles de planification haut niveau associées à des modèles vision-langage-action (VLA), ce résultat suggère que des benchmarks de "longue durée" bien notés peuvent masquer des faiblesses réelles sur des tâches où l'état évolue de façon imprévisible, un cas fréquent en environnement industriel réel. L'étude confirme empiriquement que la majorité des modèles agentiques testés peinent dès que le TSH devient exigeant, ce qui nuance les annonces de robustesse "long-horizon" faites par certains fournisseurs de modèles de fondation robotique. Ce travail s'inscrit dans la vague récente de benchmarks cherchant à dépasser les métriques simplistes (taux de succès, nombre d'étapes) pour capturer des dimensions cognitives plus fines de l'autonomie robotique, à l'image d'efforts antérieurs sur la mémoire ou le raisonnement causal des agents. Les auteurs ne précisent pas, dans le résumé, l'identité des laboratoires ou entreprises ayant développé les 15 modèles testés ni un calendrier de suites prévues ; RoboGraph et le benchmark associé sont présentés comme des outils ouverts destinés à orienter les prochaines générations d'agents planificateurs vers une meilleure gestion des états de tâche, plutôt que comme un produit ou déploiement commercial.

RecherchePaper
1 source
RoboFollow : le mirage du suivi d'instructions chez les agents incarnés
3arXiv cs.RO 

RoboFollow : le mirage du suivi d'instructions chez les agents incarnés

Une équipe de chercheurs du AutoLab de la Shanghai Jiao Tong University publie RoboFollow, un benchmark diagnostique détaillé dans un article déposé sur arXiv sous la référence 2609.25636v1 et intitulé "Unveiling the Instruction Following Mirage in Embodied Agents". Les auteurs identifient un biais structurel qu'ils nomment "low scene entropy": lorsqu'une scène visuelle n'admet qu'une seule tâche valide, le langage devient redondant et une politique peut afficher un score de réussite élevé sans réellement exploiter l'instruction donnée. RoboFollow repose sur trois principes: des scènes à entropie élevée, où plusieurs branches de tâches cinématiquement distinctes coexistent pour forcer la dépendance au langage; un protocole diagnostique hiérarchique en quatre niveaux, L0 à L3, qui perturbe progressivement la disposition visuelle et la sémantique des instructions afin de tester la cohérence du comportement face aux relations spatiales, attributs, contraintes de trajectoire et logique; et un contrôle des facteurs confondants, avec objets d'interaction simplifiés, actions restreintes au répertoire entraîné, et des scores séparés d'Intention et d'Exécution. Neuf politiques VLA (vision-language-action) et WAM ont été évaluées: toutes réussissent bien au niveau L0, mais ces performances ne se transfèrent pas de façon fiable aux niveaux L1 à L3 dans le protocole de fine-tuning testé. Code et jeu de données sont publiés sur GitHub et Hugging Face. Ce résultat rejoint des soupçons déjà présents dans la communauté robotique: les taux de réussite affichés par les modèles VLA sur les benchmarks classiques masquent souvent un raccourci visuel plutôt qu'une réelle compréhension du langage, un problème analogue au "shortcut learning" documenté en vision par ordinateur. Pour les intégrateurs et décideurs B2B qui évaluent des politiques génératives pour des lignes de production ou de la manipulation flexible, l'étude suggère que des scores impressionnants en environnement contrôlé ne garantissent pas une capacité à suivre des consignes variées dans des scènes ambiguës ou multi-objets. Plus préoccupant, les remèdes habituellement invoqués pour renforcer l'ancrage langagier, à savoir des backbones VLM plus puissants, le co-entraînement par questions-réponses, la technique LangForce et le Classifier-Free Guidance, échouent tous à combler l'écart entre L0 et les niveaux supérieurs, ce qui indique que le problème est structurel plutôt que réglable par un simple changement d'échelle ou d'architecture. Ce travail s'inscrit dans une vague récente de benchmarks cherchant à sonder la robustesse des agents incarnés au-delà des métriques agrégées de succès de tâche, à mesure que les politiques VLA se multiplient dans la recherche académique et chez les fournisseurs de robots généralistes. En isolant la compréhension de l'exécution motrice via des scores distincts, RoboFollow propose un outil reproductible pour comparer objectivement des politiques avant tout déploiement industriel. La publication ouverte du code et des données sur GitHub et Hugging Face vise à permettre à la communauté d'auditer d'autres modèles avec le même protocole L0-L3, et pourrait devenir une référence pour qualifier les futures générations de politiques avant leur mise en production sur des tâches nécessitant un véritable suivi d'instructions en langage naturel.

RecherchePaper
1 source
Découpler planification et contrôle pour des agents instructibles
4arXiv cs.RO 

Découpler planification et contrôle pour des agents instructibles

Une équipe de recherche publie sur arXiv (2608.26788v1) l'article « Decoupling Planning and Control for Instructable Agents », qui présente le système Instruct-to-Act. L'architecture associe un modèle vision-langage (VLM) pré-entraîné, chargé de traduire instructions et observations en plans de haut niveau peu fréquents, à un contrôleur de type « world model » entraîné pour agir en autonomie à haute fréquence à partir de ces instructions. Pour le rendre instructable, les chercheurs relabellisent des trajectoires du contrôleur avec des instructions synthétiques et optimisent conjointement clonage de comportement, récompense et modélisation du monde. Le système est testé sur sept environnements simulés, dont trois multi-agents où des planificateurs VLM coordonnent par le langage pendant que les contrôleurs entraînés agissent comme actionneurs. Ce travail répond à une limite bien identifiée dans le secteur : les VLM planifient bien à partir d'instructions et d'observations, mais peinent à transformer ces plans en actions fiables et rapides en environnement inconnu, tandis que les contrôleurs « world model » contrôlent vite mais manquent de guidage sur la tâche à accomplir. À espaces d'observation et d'action équivalents, l'approche découplée surpasse de façon constante les variantes contrôleur seul et génération d'action directe par le VLM, tout en gardant un contrôle rapide et en permettant de changer de planificateur VLM sans réentraîner le contrôleur, un atout pour des intégrateurs voulant faire évoluer le « cerveau » sans retoucher les « réflexes » du robot. Elle reste toutefois seulement compétitive, et non systématiquement supérieure, face à des références vision-langage-action (VLA) et RL multi-agent solides, sur six tâches sur sept. Il s'agit d'un article de recherche, non d'une annonce produit : le résumé ne cite aucune entreprise ni robot commercial, et les sept environnements testés sont simulés, sans déploiement sur matériel réel évoqué. La démarche rejoint une tendance de l'apprentissage robotique consistant à séparer un raisonnement lent de haut niveau d'un contrôle réactif rapide, déjà explorée par des systèmes industriels comme Helix chez Figure ou GR00T N2 chez Nvidia. Aucun pilote ni calendrier vers des robots physiques n'est mentionné : la contribution porte sur la méthodologie et sa capacité à généraliser entre plusieurs bancs d'essai simulés.

RechercheActu
1 source