
InstructMove : un référentiel où le texte est indispensable pour le suivi d'instructions en manipulation
Horizon Robotics publie InstructMove, un nouveau benchmark destine a évaluer si les modèles vision-langage-action (VLA) suivent réellement des instructions textuelles lors de taches de manipulation robotique. Presente dans un papier arXiv (2608.22990), le benchmark se concentre sur des scènes de pick-and-place comportant des distracteurs sémantiques, et décompose la compréhension d'instruction en quatre volets: identification de catégorie, discrimination d'attributs, raisonnement spatial et pick-and-place compositionnel. InstructMove fournit un protocole entrainement-évaluation complet, avec des données d'entrainement dédiées et des taches d'évaluation tenues a l'écart, accompagne d'outils de diagnostic pour mesurer la dépendance réelle au langage. Le code est disponible sur GitHub, sous le dépôt HorizonRobotics/RoboOrchardSim.
L'enjeu dépasse le simple ajout d'un jeu de tests: la plupart des benchmarks de manipulation existants souffrent d'un biais structurel ou l'objet ou la destination vises sont visuellement évidents ou physiquement uniques, ce qui permet a une politique de réussir la tache sans jamais avoir traite l'instruction textuelle. En exigeant que plusieurs actions soient plausibles visuellement et physiquement mais qu'une seule corresponde a la consigne, InstructMove force les modèles a démontrer un véritable ancrage langagier plutôt qu'un raccourci visuel. Pour les intégrateurs et décideurs qui évaluent des systèmes VLA comme Pi-0, GR00T N2 ou Helix, ce travail rappelle que des performances élevées sur des benchmarks classiques ne garantissent pas une compréhension linguistique fiable, un écart critique des lors que ces robots doivent exécuter des instructions variées en environnement réel. Les auteurs montrent aussi que des données de simulation générées via InstructMove améliorent les performances d'instruction-following sur des taches réelles, un signal encourageant pour le transfert sim-to-real.
Ce travail s'inscrit dans la montée en puissance de Horizon Robotics, acteur chinois connu pour ses puces d'aide a la conduite autonome et désormais actif dans l'IA incarnée, face a des laboratoires occidentaux comme Physical Intelligence ou Nvidia sur le terrain des modèles VLA généralistes. En publiant a la fois le benchmark et le code source, l'équipe positionne InstructMove comme un outil de diagnostic ouvert pour la communauté robotique, plutôt qu'un produit commercial.
Les intégrateurs européens évaluant des systèmes VLA (Pi-0, GR00T, Helix) disposent d'un nouvel outil de diagnostic open-source, sans impact direct sur un acteur français ou européen.




