Aller au contenu principal
RoboFollow : le mirage du suivi d'instructions chez les agents incarnés
RecherchearXiv cs.RO 

RoboFollow : le mirage du suivi d'instructions chez les agents incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs du AutoLab de la Shanghai Jiao Tong University publie RoboFollow, un benchmark diagnostique détaillé dans un article déposé sur arXiv sous la référence 2609.25636v1 et intitulé "Unveiling the Instruction Following Mirage in Embodied Agents". Les auteurs identifient un biais structurel qu'ils nomment "low scene entropy": lorsqu'une scène visuelle n'admet qu'une seule tâche valide, le langage devient redondant et une politique peut afficher un score de réussite élevé sans réellement exploiter l'instruction donnée. RoboFollow repose sur trois principes: des scènes à entropie élevée, où plusieurs branches de tâches cinématiquement distinctes coexistent pour forcer la dépendance au langage; un protocole diagnostique hiérarchique en quatre niveaux, L0 à L3, qui perturbe progressivement la disposition visuelle et la sémantique des instructions afin de tester la cohérence du comportement face aux relations spatiales, attributs, contraintes de trajectoire et logique; et un contrôle des facteurs confondants, avec objets d'interaction simplifiés, actions restreintes au répertoire entraîné, et des scores séparés d'Intention et d'Exécution. Neuf politiques VLA (vision-language-action) et WAM ont été évaluées: toutes réussissent bien au niveau L0, mais ces performances ne se transfèrent pas de façon fiable aux niveaux L1 à L3 dans le protocole de fine-tuning testé. Code et jeu de données sont publiés sur GitHub et Hugging Face.

Ce résultat rejoint des soupçons déjà présents dans la communauté robotique: les taux de réussite affichés par les modèles VLA sur les benchmarks classiques masquent souvent un raccourci visuel plutôt qu'une réelle compréhension du langage, un problème analogue au "shortcut learning" documenté en vision par ordinateur. Pour les intégrateurs et décideurs B2B qui évaluent des politiques génératives pour des lignes de production ou de la manipulation flexible, l'étude suggère que des scores impressionnants en environnement contrôlé ne garantissent pas une capacité à suivre des consignes variées dans des scènes ambiguës ou multi-objets. Plus préoccupant, les remèdes habituellement invoqués pour renforcer l'ancrage langagier, à savoir des backbones VLM plus puissants, le co-entraînement par questions-réponses, la technique LangForce et le Classifier-Free Guidance, échouent tous à combler l'écart entre L0 et les niveaux supérieurs, ce qui indique que le problème est structurel plutôt que réglable par un simple changement d'échelle ou d'architecture.

Ce travail s'inscrit dans une vague récente de benchmarks cherchant à sonder la robustesse des agents incarnés au-delà des métriques agrégées de succès de tâche, à mesure que les politiques VLA se multiplient dans la recherche académique et chez les fournisseurs de robots généralistes. En isolant la compréhension de l'exécution motrice via des scores distincts, RoboFollow propose un outil reproductible pour comparer objectivement des politiques avant tout déploiement industriel. La publication ouverte du code et des données sur GitHub et Hugging Face vise à permettre à la communauté d'auditer d'autres modèles avec le même protocole L0-L3, et pourrait devenir une référence pour qualifier les futures générations de politiques avant leur mise en production sur des tâches nécessitant un véritable suivi d'instructions en langage naturel.

Dans nos dossiers

À lire aussi

Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés
1arXiv cs.RO 

Le syndrome du béni-oui-oui : évaluer l'abstention dans les agents robotiques incarnés

Une équipe du laboratoire PursecLab a publié en mai 2026 un article documentant ce qu'ils nomment le "syndrome du yes-man" dans les VLM (vision-language models) utilisés comme planificateurs pour robots incarnés : ces modèles exécutent des instructions même lorsqu'elles sont physiquement infaisables, ambiguës ou fondées sur de fausses prémisses. Pour mesurer cette faille, les chercheurs ont développé RoboAbstention, un benchmark de 6 069 instructions générées à partir d'images issues de cinq jeux de données robotiques, via un pipeline en trois phases : ancrage visuel structuré, dérivation déterministe de contraintes physiques, et génération contrôlée par gabarits par catégorie. Les résultats sont sévères : Gemini 2.5 Flash, meilleur modèle général testé, n'abstient que dans 39,0 % des cas où il devrait refuser. Gemini Robotics ER 1.6 Preview, planificateur dédié à la robotique incarnée, tombe à 16,5 %. L'application de techniques de "defensive prompting" et d'in-context learning remonte ces taux à 93,6 % pour Gemini Robotics ER et 88,6 % pour GPT-5.4 Mini, sans résoudre entièrement le problème. Ce comportement représente un risque opérationnel concret : un robot qui ne détecte pas les limites d'une instruction peut endommager des équipements, violer des consignes de sécurité, ou échouer silencieusement sans signal d'erreur exploitable. La taxonomie proposée distingue quatre cas légitimes d'abstention - instruction ambiguë, contrainte physique violée, prémisse factuelle fausse, contexte sensoriel insuffisant. Le fait que des modèles dotés de raisonnement avancé échouent massivement démontre que la capacité à "savoir refuser" n'émerge pas naturellement avec la montée en puissance des VLM, y compris ceux dédiés à la robotique. Les benchmarks d'abstention existants portaient exclusivement sur des LLM en contexte textuel, ignorant les contraintes perceptuelles propres aux environnements physiques - c'est le vide que comble RoboAbstention. À mesure que les architectures VLA (Vision-Language-Action) se rapprochent des déploiements industriels réels, la validation comportementale avant mise en service devient un critère incontournable pour intégrateurs et décideurs industriels. Le benchmark est open-source sur purseclab.github.io/RoboAbstention, directement utilisable comme outil d'audit pré-déploiement. Aucun acteur européen n'est impliqué dans cette étude. Les prochaines étapes logiques pointent vers le fine-tuning ciblé sur l'abstention, les correctifs au niveau du prompt ayant montré leurs limites structurelles.

UELes intégrateurs européens déployant des systèmes VLA en environnement industriel devront probablement intégrer des outils d'audit comportemental comme RoboAbstention pour répondre aux exigences de sécurité de l'AI Act applicables aux systèmes robotiques autonomes.

RechercheOpinion
1 source
RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
2arXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites. L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide. Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

RechercheOpinion
1 source
RoboPhys-3D : évaluation complète des modèles du monde incarnés par reconstruction 3D
3arXiv cs.RO 

RoboPhys-3D : évaluation complète des modèles du monde incarnés par reconstruction 3D

Une équipe de recherche présente RoboPhys-3D, un benchmark d'évaluation pour les world models vidéo embarqués (embodied world models, EWM), construit sur RoboTwin 2.0. Il couvre 50 tâches de manipulation réparties en quatre régimes, avec 5 000 épisodes et 25 000 vidéos multi-vues de référence. Particularité du protocole : les vidéos générées et les vidéos de référence passent par le même pipeline de reconstruction 3D, ce qui permet de distinguer l'erreur due à la reconstruction de celle due à la génération elle-même. Le benchmark organise 50 métriques en 18 sous-dimensions réparties sur quatre niveaux : fidélité au pixel, cohérence géométrique 3D, compréhension de l'état de la scène et complétude de la tâche. Deux scores composites en découlent : l'Average Full Score, qui moyenne les 50 métriques, et le RoboPhyscore, centré sur les métriques les plus corrélées au succès réel de la tâche. Sur quatre world models vidéo testés, Cosmos 3 obtient le meilleur RoboPhyscore (0,6330, soit 92,7% du score de référence), et ce score affiche une forte corrélation avec l'évaluation humaine (Pearson r = 0,9761, Spearman rho = 0,8962). Ce travail comble un angle mort de l'évaluation des world models pour la robotique : la plupart des benchmarks existants jugent la qualité visuelle ou sémantique des vidéos générées via des juges perceptuels ou des modèles vision-langage, sans vérifier si la scène 3D reste physiquement exploitable pour piloter un robot. Or les métriques ancrées dans l'état de la scène et dans l'exécutabilité des actions révèlent des échecs substantiels que ces jugements perceptuels ou VLM ne détectent pas, un écart classique entre qualité d'image perçue et utilité réelle pour la planification. Pour les équipes qui exploitent des world models comme moteurs de données synthétiques, planificateurs d'actions ou simulateurs, cela signale qu'un bon score de fidélité visuelle ne garantit pas un rollout exploitable en aval. La forte corrélation du RoboPhyscore avec le jugement humain suggère en revanche qu'une métrique compacte et ancrée dans l'exécution pourrait remplacer une évaluation humaine coûteuse à grande échelle. Ce besoin découle de l'absence, jusqu'ici, d'un standard 3D unifié pour vérifier si un rollout généré préserve l'état réel de la scène, les benchmarks EWM existants restant majoritairement 2D ou basés sur des scores subjectifs. RoboPhys-3D positionne Cosmos 3, la gamme de world models vidéo de NVIDIA, comme la plus performante parmi les quatre testées, sans détailler ici les trois autres modèles comparés ni de calendrier de déploiement industriel : il s'agit d'un travail de recherche en évaluation (preprint arXiv 2608.28718v1), pas d'une annonce produit. Il s'inscrit dans une dynamique plus large où les world models vidéo sont de plus en plus proposés comme substituts à la simulation physique classique pour entraîner des politiques de manipulation robotique, et la publication de ce protocole ouvre la voie à des comparaisons plus rigoureuses à mesure que de nouvelles versions de ces modèles sortiront.

RecherchePaper
1 source
REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?
4arXiv cs.RO 

REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?

Des chercheurs ont publié REI-Bench (arXiv:2505.10872), le premier benchmark dédié à évaluer comment les planificateurs de tâches robotiques basés sur des grands modèles de langage (LLM) gèrent les instructions humaines vagues. L'étude porte spécifiquement sur les expressions référentielles (ER), formulations dont le sens dépend du contexte dialogique et de l'environnement immédiat, comme "prends ça" ou "mets-le là-bas". Les expériences montrent que cette ambiguïté fait chuter le taux de succès des planificateurs jusqu'à 36,9 points de pourcentage. L'analyse des cas d'échec révèle que la majorité provient d'objets manquants dans les plans générés : le modèle ne résout pas correctement la référence et omet l'objet cible de la séquence d'actions. Ce résultat est significatif pour les intégrateurs et les équipes qui déploient des robots en environnement non contrôlé. La quasi-totalité des benchmarks existants, et donc des pipelines de planification actuels, supposent des instructions claires et structurées, ce qui correspond à un utilisateur expert. Or, les populations prioritaires pour la robotique de service (personnes âgées, enfants, opérateurs non formés) sont précisément celles qui formulent des instructions les plus ambiguës. La dégradation mesurée n'est pas marginale : un écart de 37 points sur le taux de succès représente un planificateur fonctionnel en labo qui devient inutilisable en conditions réelles. Le papier souligne également que les approches classiques d'atténuation, prompts enrichis, chaînes de pensée (chain-of-thought), apprentissage en contexte (in-context learning), ne suffisent pas à combler cet écart. Pour y répondre, les auteurs proposent une méthode appelée "task-oriented context cognition" : avant de générer le plan d'action, le système produit explicitement une instruction reformulée et désambiguïsée à partir du contexte environnemental et dialogique. Cette approche atteint l'état de l'art sur REI-Bench en surpassant les baselines précitées. Le benchmark s'inscrit dans un effort plus large de la communauté pour combler le fossé entre performances en simulation et déploiement réel, un problème central pour des acteurs comme Boston Dynamics, Agility Robotics ou les startups européennes telles qu'Enchanted Tools, dont les robots humanoïdes devront interagir avec des utilisateurs non techniques. Les prochaines étapes naturelles seraient d'intégrer REI-Bench dans les pipelines d'évaluation de modèles VLA (vision-language-action) comme pi0 ou OpenVLA, où la résolution de références visuelles et linguistiques est un point de friction connu.

UEL'approche de désambiguïsation proposée (task-oriented context cognition) est directement applicable aux équipes européennes développant des robots de service pour utilisateurs non techniques, notamment les startups comme Enchanted Tools dont les humanoïdes devront gérer des instructions vagues d'opérateurs non formés.

RecherchePaper
1 source