Aller au contenu principal
RecherchearXiv cs.RO 

RoboRecover : évaluer la récupération des politiques robotiques après des écarts d'exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs en robotique ont mis en ligne le 25 septembre 2026 sur arXiv (2609.28952) un nouveau benchmark baptisé RoboRecover, destiné à mesurer la capacité des politiques robotiques, notamment les modèles vision-langage-action (VLA), à se rétablir après une déviation survenue en cours d'exécution. Les benchmarks existants testent des trajectoires complètes depuis un état initial fixe et jugent surtout le résultat final, en négligeant ce qui se passe pendant l'interaction dynamique. RoboRecover cible au contraire les états intermédiaires anormaux, ceux où des contacts ou des actions ont modifié les relations entre objets et la progression de la tâche, obligeant la politique à comprendre ce qui a changé, corriger la situation, puis reprendre l'objectif initial. La méthode sélectionne des états de déviation issus de trajectoires réelles, les reconstruit en rejouant des préfixes d'actions, puis évalue les politiques sur la tâche d'origine à partir de ce point de reprise. Le benchmark compile 2 000 scénarios répartis sur deux plateformes de simulation, RoboTwin et LIBERO, à raison de 1 000 chacune, avec un découpage fixe de 800 scénarios d'entraînement pour 200 de test sur chaque plateforme.

Le résultat central est que la performance sur l'état initial ne prédit pas la performance en récupération : une politique compétente sur une tâche propre peut échouer à s'en sortir une fois perturbée, et les forces de récupération varient fortement d'un scénario à l'autre. C'est une nuance importante pour les intégrateurs et décideurs B2B qui évaluent des modèles génériques (type Pi-0, GR00T N2 ou Helix) sur la seule base de démonstrations en conditions nominales : ces vitrines ne renseignent en rien sur la robustesse réelle face aux glissements, collisions ou interventions humaines qui surviennent en déploiement industriel. RoboRecover formalise ainsi un écart entre démonstration et fiabilité opérationnelle que le secteur avait jusqu'ici peu isolé comme axe de mesure à part entière.

Ce travail s'inscrit dans la montée en puissance de benchmarks de politiques génériques comme RoboTwin et LIBERO, devenus des bancs d'essai standards pour comparer les architectures VLA. En exploitant son découpage d'entraînement, RoboRecover permet aussi d'étudier des interventions ciblées pour améliorer la récupération, ouvrant la voie à des travaux futurs sur l'entraînement spécifique à la robustesse post-perturbation, potentiellement étendus à d'autres plateformes ou au matériel réel.

À lire aussi

LIBERO-RECOVER : au-delà de la réussite des tâches, la récupération après échec dans les modèles de manipulation robotique
1arXiv cs.RO 

LIBERO-RECOVER : au-delà de la réussite des tâches, la récupération après échec dans les modèles de manipulation robotique

Des chercheurs ont publié le 5 septembre 2026 sur arXiv (2609.05178) LIBERO-Recover, un benchmark consacré à la récupération après échec des modèles de manipulation robotique Vision-Language-Action (VLA) ou World Action (WAM). Construit à partir de LIBERO, référence de l'apprentissage robotique en simulation, il rassemble plus de 1 000 scénarios d'échecs réels issus de modèles état de l'art, répartis en quatre niveaux : réessai d'action, adaptation d'action, récupération de l'état de l'objet et récupération environnementale. Il évalue quatre compétences : compréhension spatiale, raisonnement sur la structure des objets, compréhension des interactions et raisonnement topologique. Le projet est disponible sur liulin815.github.io/LIBERO-Recovery. L'enjeu est réel pour les intégrateurs et décideurs du secteur robotique : les modèles les plus avancés affichent des taux de succès proches de 100% sur LIBERO, souvent présentés comme preuve de maturité pour un déploiement réel. Les auteurs contestent cette lecture, car ces scores mesurent l'exécution de tâches depuis des états initiaux idéaux, sans jamais tester la réaction à une prise ratée, une collision ou un déplacement involontaire d'objet, situations pourtant inévitables hors laboratoire. LIBERO-Recover déplace ainsi la question de la réussite d'une tâche vers la capacité à s'en remettre après un échec, nuançant l'idée que le sim-to-real et l'apprentissage par imitation à grande échelle seraient déjà résolus. Pour les industriels évaluant des piles VLA, ce travail rappelle que les scores de benchmark actuels ne garantissent pas la robustesse opérationnelle. Ce travail s'inscrit dans une critique méthodologique croissante des benchmarks de manipulation robotique : LIBERO, désormais jugé saturé, ne mesurait que la réussite finale d'une tâche, jamais la résilience face à l'imprévu. Il s'agit d'une contribution académique en preprint, sans lien annoncé avec un produit commercial : aucun robot physique, partenariat industriel ni calendrier de commercialisation n'est mentionné. Les auteurs présentent LIBERO-Recover comme le premier benchmark à grande échelle consacré à la récupération après échec en robotique incarnée, un manque notable face à la multiplication des modèles fondation pour la manipulation. La suite attendue est l'adoption de ce protocole par la communauté pour évaluer les futurs modèles VLA sur cet axe de robustesse, plutôt que sur le seul taux de succès brut.

RecherchePaper
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
2arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
EgoRecovery : acquérir la capacité de récupération après échec grâce à des démonstrations humaines de récupération
3arXiv cs.RO 

EgoRecovery : acquérir la capacité de récupération après échec grâce à des démonstrations humaines de récupération

Un groupe de recherche présente EgoRecovery, un article publié sur arXiv (référence 2607.19745v1), qui s'attaque à un problème central de la robotique embarquée: la capacité d'un robot à récupérer d'un échec en cours de tâche plutôt que de rester bloqué. Le constat de départ est simple, collecter des données de récupération par téléopération robotique est très coûteux en temps, car il faut provoquer artificiellement des états d'échec variés, exécuter les gestes correctifs, puis réinitialiser l'environnement avant chaque nouvel essai. Les auteurs proposent à la place d'utiliser des démonstrations humaines à la première personne, filmées avec une caméra egocentrique, pour capturer les gestes de récupération. Selon leur protocole, un opérateur humain permet de générer plus de dix fois plus de données de récupération exploitables par heure qu'un opérateur en téléopération robotique classique. Pour combler l'écart entre le corps humain et le corps du robot, l'équipe introduit un espace d'intention corrective compact et partagé, qui encode le moment et l'amplitude de la correction plutôt que les mouvements bruts, et ne nécessite qu'un petit nombre de démonstrations robotiques réelles pour relier cette intention à des actions exécutables. Cette approche s'attaque directement à un goulot d'étranglement connu du secteur, à savoir que les modèles vision-langage-action (VLA) actuels progressent surtout sur les démonstrations de succès mais restent fragiles face aux échecs, faute de données de récupération suffisamment diverses. Si la méthode tient à plus grande échelle, elle offrirait un moyen bien moins coûteux d'entraîner des robots à se corriger seuls en environnement réel bruité, un enjeu clé pour toute déploiement industriel ou domestique fiable au-delà des démonstrations scénarisées. C'est aussi un signal supplémentaire que l'apprentissage par imitation à partir de vidéos humaines, déjà exploré par plusieurs laboratoires, gagne du terrain comme complément moins onéreux à la téléopération pure. Le système embarque également un mécanisme appelé recovery gate, qui observe en continu le robot au moment du déploiement et déclenche l'intention corrective uniquement lorsqu'un état d'échec est détecté, évitant d'interférer avec l'exécution normale de la tâche. Les auteurs rapportent, sur des tâches réelles de récupération, des gains de succès par rapport à un entraînement uniquement sur données robotiques, à un co-entraînement direct avec les données humaines, et à des méthodes de transfert d'intention plus simples, sans toutefois préciser à ce stade de partenaire industriel ni de calendrier de déploiement au-delà du cadre expérimental.

RecherchePaper
1 source
Prédiction d'horizon d'exécution dynamique pour les politiques robotiques par segments
4arXiv cs.RO 

Prédiction d'horizon d'exécution dynamique pour les politiques robotiques par segments

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.11408) une méthode baptisée DEHP, Dynamic Execution Horizon Prediction, conçue pour résoudre un goulot d'étranglement structurel des politiques robotiques modernes : l'horizon d'exécution fixe. Dans les architectures à "action chunking" aujourd'hui omniprésentes, politiques de diffusion, politiques de flux, modèles vision-langage-action (VLA) comme pi-0 ou OpenVLA, le robot prédit un bloc de N actions et les exécute en boucle ouverte, sans percevoir l'environnement à chaque pas. Cet horizon N est actuellement choisi par tuning empirique, tâche par tâche. DEHP entraîne une branche légère de prédiction d'horizon via du reinforcement learning en ligne, tout en gardant la politique chunk sous-jacente entièrement gelée, ce qui la rend compatible avec n'importe quelle politique existante traitée comme boîte noire. Sur des tâches de manipulation haute précision et longue durée, les auteurs rapportent une amélioration "significative" du taux de succès, sans chiffres absolus précis dans l'abstract, un point à vérifier dans les résultats complets. L'enjeu est concret pour quiconque déploie des bras manipulateurs en production : la boucle ouverte est efficace sur les mouvements de transit (déplacements dans l'espace libre), mais devient un frein sur les phases fines, insertion, saisie d'objet délicat, assemblage à tolérance serrée. DEHP adapte dynamiquement l'horizon : court pendant les phases critiques (comportement proche d'un contrôle pas-à-pas), long pendant les phases de déplacement libre. Cela revient à réconcilier l'efficacité computationnelle du chunking avec la réactivité du contrôle fermé, sans réentraîner le modèle de base. Pour les intégrateurs industriels, cela signifie potentiellement récupérer de la robustesse sur des cellules existantes sans toucher au pipeline d'entraînement. L'action chunking a été popularisée par ACT (Action Chunked Transformer, Stanford 2023), puis repris dans les diffusion policies de Chi et al. et intégré dans des VLA comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La tension entre horizon long (efficacité) et horizon court (réactivité) est un problème ouvert bien identifié dans la communauté. Plusieurs travaux concurrents explorent le receding horizon ou le replanning conditionnel, mais DEHP se distingue par sa compatibilité boîte noire et son entraînement RL en ligne. La page projet est accessible sur dehp-chunking.github.io ; aucune timeline de déploiement industriel n'est annoncée à ce stade.

RecherchePaper
1 source