PRM-as-a-Judge 1.5 : une boîte à outils pour l'évaluation des processus robotiques
Des chercheurs ont publie le 17 aout 2026 sur arXiv (référence 2608.14284v1) PRM-as-a-Judge 1.5, un outil d'évaluation fine des robots manipulateurs qui convertit les vidéos d'essais en courbes de progression denses plutôt qu'en simples taux de réussite binaires. Par rapport a la version 1.0, la mise a jour ajoute trois métriques: la progression atteinte avant un échec, la capacité de récupération après une chute de performance, et la qualité d'exécution des essais réussis. Les auteurs appliquent cette grille a des vidéos de rollouts issues de benchmarks existants pour comparer plusieurs modèles embodied, et introduisent RoboPulse++, un benchmark dédié a tester la fiabilité des modèles de récompense de processus (PRM). L'ensemble, code et outils de visualisation inclus, est publie en accès libre.
Le constat de départ cible un point faible connu des benchmarks robotiques actuels: un taux de réussite binaire ne dit rien sur le fait qu'un modèle échoue de justesse ou totalement, se corrige après une erreur, ou réussit une tache proprement plutôt qu'au prix de mouvements inefficaces. Pour les équipes qui comparent des politiques VLA (vision-language-action) généralistes, ce niveau de détail permet de distinguer un modèle robuste d'un modèle qui ne réussit que sur des démonstrations soigneusement sélectionnées. En créant RoboPulse++ pour auditer la fiabilité des juges automatiques eux-mêmes, les auteurs visent un biais fréquent: l'outil de mesure devenant source d'erreur non vérifiée. La démarche rejoint un mouvement plus large visant a dépasser les vidéos de démonstration au profit de protocoles transparents et reproductibles.
PRM-as-a-Judge 1.5 prolonge la version 1.0 du même outil, dont il reprend l'architecture de courbes de progression en y ajoutant des métriques ciblant les cas d'échec et la robustesse post-erreur, des angles morts des scores binaires qui dominent encore les benchmarks de manipulation. Le papier ne revendique aucun déploiement commercial ni partenariat industriel: il s'agit d'une contribution méthodologique destinee aux laboratoires qui évaluent des modèles embodied sur des benchmarks existants. En publiant le code, le benchmark RoboPulse++ et les outils de visualisation, les auteurs invitent la communauté a reproduire ces mesures plutôt qu'a se fier a des rapports internes non vérifiables, un appel qui rejoint les débats en cours sur l'écart entre démonstrations marketing et fiabilité réelle des systèmes robotiques en production.
Dans nos dossiers




