RoboRecover : évaluer la récupération des politiques robotiques après des écarts d'exécution
Des chercheurs en robotique ont mis en ligne le 25 septembre 2026 sur arXiv (2609.28952) un nouveau benchmark baptisé RoboRecover, destiné à mesurer la capacité des politiques robotiques, notamment les modèles vision-langage-action (VLA), à se rétablir après une déviation survenue en cours d'exécution. Les benchmarks existants testent des trajectoires complètes depuis un état initial fixe et jugent surtout le résultat final, en négligeant ce qui se passe pendant l'interaction dynamique. RoboRecover cible au contraire les états intermédiaires anormaux, ceux où des contacts ou des actions ont modifié les relations entre objets et la progression de la tâche, obligeant la politique à comprendre ce qui a changé, corriger la situation, puis reprendre l'objectif initial. La méthode sélectionne des états de déviation issus de trajectoires réelles, les reconstruit en rejouant des préfixes d'actions, puis évalue les politiques sur la tâche d'origine à partir de ce point de reprise. Le benchmark compile 2 000 scénarios répartis sur deux plateformes de simulation, RoboTwin et LIBERO, à raison de 1 000 chacune, avec un découpage fixe de 800 scénarios d'entraînement pour 200 de test sur chaque plateforme.
Le résultat central est que la performance sur l'état initial ne prédit pas la performance en récupération : une politique compétente sur une tâche propre peut échouer à s'en sortir une fois perturbée, et les forces de récupération varient fortement d'un scénario à l'autre. C'est une nuance importante pour les intégrateurs et décideurs B2B qui évaluent des modèles génériques (type Pi-0, GR00T N2 ou Helix) sur la seule base de démonstrations en conditions nominales : ces vitrines ne renseignent en rien sur la robustesse réelle face aux glissements, collisions ou interventions humaines qui surviennent en déploiement industriel. RoboRecover formalise ainsi un écart entre démonstration et fiabilité opérationnelle que le secteur avait jusqu'ici peu isolé comme axe de mesure à part entière.
Ce travail s'inscrit dans la montée en puissance de benchmarks de politiques génériques comme RoboTwin et LIBERO, devenus des bancs d'essai standards pour comparer les architectures VLA. En exploitant son découpage d'entraînement, RoboRecover permet aussi d'étudier des interventions ciblées pour améliorer la récupération, ouvrant la voie à des travaux futurs sur l'entraînement spécifique à la robustesse post-perturbation, potentiellement étendus à d'autres plateformes ou au matériel réel.
Dans nos dossiers




