Du déploiement à la réinitialisation : un système d'évaluation par graphe pour la manipulation autonome à long horizon
Publié sur arXiv (2609.19413v1) le 18 septembre 2026, l'article présente HALTER, un système qui automatise l'évaluation de politiques de manipulation robotique sur des tâches longues, en particulier la remise à zéro de la scène entre essais, jusqu'ici confiée à un opérateur humain. Testé sur un bras Franka pour quatre tâches longues, HALTER restaure correctement la scène dans 76% des épisodes, contre 52% pour AutoEval et 65% pour un reset par planification de mouvement classique. Il estime juste la fraction de compétences accomplies dans 90% des cas, contre 76% pour AutoEval, et son verdict de vérification du reset est correct dans 91% des épisodes contre 78%. Le système réduit aussi de 72% le temps d'opérateur d'une campagne d'évaluation par rapport à un reset manuel, et sur trois tâches inédites testant la généralisation compositionnelle, il réussit le reset dans 74,7% des épisodes contre seulement 1,3% pour une politique de reset entraînée tâche par tâche.
Cette avancée cible un vrai goulot d'étranglement de la recherche en robotique: l'évaluation sur robot réel reste la référence des progrès en manipulation, mais reset la scène à la main coûte du temps et laisse la distribution des états initiaux mal définie, ce qui nuit à la reproductibilité des résultats. En automatisant reset et notation pour des tâches multi-étapes sans images de succès annotées, HALTER change l'économie des campagnes de test: le coût de démonstration croît avec la taille d'une bibliothèque de compétences de reset réutilisables, et non plus avec le nombre combinatoire d'états terminaux possibles. Pour les équipes qui entraînent des modèles vision-langage-action à grande échelle, cela ouvre la voie à des benchmarks continus moins gourmands en supervision humaine, dans un secteur qui cherche justement à distinguer démonstrations triées et performance réellement mesurée.
HALTER prolonge AutoEval, système antérieur capable d'automatiser reset et notation mais seulement pour des tâches à une étape, un essai long pouvant se terminer dans un nombre combinatoirement grand de configurations qu'aucune politique de reset apprise ne couvre seule. La solution construit en ligne un graphe de scène à partir de nuages de points et de modèles de vision, qu'un grand modèle de langage utilise pour noter la tâche, planifier le reset via une bibliothèque de compétences atomiques, et vérifier sa réussite. Les auteurs ont aussi testé différentes représentations de la scène et fréquences de mise à jour du graphe, sans annoncer de calendrier de déploiement au-delà de ce cadre expérimental sur bras Franka.
Dans nos dossiers




