
RoboFollow : le mirage du suivi d'instructions chez les agents incarnés
Une équipe de chercheurs du AutoLab de la Shanghai Jiao Tong University publie RoboFollow, un benchmark diagnostique détaillé dans un article déposé sur arXiv sous la référence 2609.25636v1 et intitulé "Unveiling the Instruction Following Mirage in Embodied Agents". Les auteurs identifient un biais structurel qu'ils nomment "low scene entropy": lorsqu'une scène visuelle n'admet qu'une seule tâche valide, le langage devient redondant et une politique peut afficher un score de réussite élevé sans réellement exploiter l'instruction donnée. RoboFollow repose sur trois principes: des scènes à entropie élevée, où plusieurs branches de tâches cinématiquement distinctes coexistent pour forcer la dépendance au langage; un protocole diagnostique hiérarchique en quatre niveaux, L0 à L3, qui perturbe progressivement la disposition visuelle et la sémantique des instructions afin de tester la cohérence du comportement face aux relations spatiales, attributs, contraintes de trajectoire et logique; et un contrôle des facteurs confondants, avec objets d'interaction simplifiés, actions restreintes au répertoire entraîné, et des scores séparés d'Intention et d'Exécution. Neuf politiques VLA (vision-language-action) et WAM ont été évaluées: toutes réussissent bien au niveau L0, mais ces performances ne se transfèrent pas de façon fiable aux niveaux L1 à L3 dans le protocole de fine-tuning testé. Code et jeu de données sont publiés sur GitHub et Hugging Face.
Ce résultat rejoint des soupçons déjà présents dans la communauté robotique: les taux de réussite affichés par les modèles VLA sur les benchmarks classiques masquent souvent un raccourci visuel plutôt qu'une réelle compréhension du langage, un problème analogue au "shortcut learning" documenté en vision par ordinateur. Pour les intégrateurs et décideurs B2B qui évaluent des politiques génératives pour des lignes de production ou de la manipulation flexible, l'étude suggère que des scores impressionnants en environnement contrôlé ne garantissent pas une capacité à suivre des consignes variées dans des scènes ambiguës ou multi-objets. Plus préoccupant, les remèdes habituellement invoqués pour renforcer l'ancrage langagier, à savoir des backbones VLM plus puissants, le co-entraînement par questions-réponses, la technique LangForce et le Classifier-Free Guidance, échouent tous à combler l'écart entre L0 et les niveaux supérieurs, ce qui indique que le problème est structurel plutôt que réglable par un simple changement d'échelle ou d'architecture.
Ce travail s'inscrit dans une vague récente de benchmarks cherchant à sonder la robustesse des agents incarnés au-delà des métriques agrégées de succès de tâche, à mesure que les politiques VLA se multiplient dans la recherche académique et chez les fournisseurs de robots généralistes. En isolant la compréhension de l'exécution motrice via des scores distincts, RoboFollow propose un outil reproductible pour comparer objectivement des politiques avant tout déploiement industriel. La publication ouverte du code et des données sur GitHub et Hugging Face vise à permettre à la communauté d'auditer d'autres modèles avec le même protocole L0-L3, et pourrait devenir une référence pour qualifier les futures générations de politiques avant leur mise en production sur des tâches nécessitant un véritable suivi d'instructions en langage naturel.
Dans nos dossiers




