RoboMonitor : surveillance efficace en étiquettes de l'exécution des tâches robotiques par apprentissage prédictif de représentations
Un article publié le 28 septembre 2026 sur arXiv présente RoboMonitor, un moniteur d'exécution vision-langage pour robots manipulateurs, pré-entraîné sur 25 heures de trajectoires multi-caméras couvrant 12 tâches et deux embodiments, par prédiction de caractéristiques futures conditionnée par l'action, dynamique inverse et prédiction du présent masqué. Ses encodeurs sont transférés vers un moniteur causal affiné par la méthode Temporal SFT, combinant supervision continue et cohérence entre fenêtres d'observation chevauchantes ; déployé, le système ne requiert que l'instruction de tâche et le flux caméra. Avec seulement 52 épisodes annotés, il atteint 93,1% de précision moyenne de phase et 85,9% de rappel macro sur quatre tâches, devançant Qwen3-VL et Robometer même entraînés avec 100 épisodes, et réduit les changements de phase erronés de 15,23% à 4,95%. En boucle fermée, il réussit 39 essais sur 40 en tri d'outils simulé et 35 sur 40 en conditionnement de bobines réel, sans fausse alerte.
Les politiques robotiques de type VLA produisent des actions mais ne disent rien sur la progression réelle d'une tâche ni sur un échec en cours, et annoter précisément phases, échecs et fins de tâche reste rare dans les jeux de données déjà collectés. En montrant qu'un pré-entraînement auto-supervisé sur ces mêmes données permet de diviser par deux le nombre d'épisodes annotés tout en dépassant des modèles mieux supervisés, RoboMonitor s'attaque au goulot d'étranglement de l'annotation qui freine le déploiement de couches de sécurité sur des flottes pilotées par des modèles fondation. Pour les intégrateurs industriels, cela suggère que la détection de défaillance redevient un problème d'ingénierie tractable, même si l'écart entre 97,5% de réussite en simulation et 87,5% en conditions réelles montre une marge de progression.
RoboMonitor se compare à Qwen3-VL, modèle vision-langage généraliste, et à Robometer, moniteur d'exécution existant, qu'il dépasse à supervision égale ou renforcée. Il s'inscrit dans la vague des politiques génériques vision-langage-action cherchant à généraliser au-delà d'une tâche unique, où fiabilité et détection d'échec deviennent centrales à mesure que ces modèles sortent du stade de la démonstration. Il s'agit pour l'instant d'un préprint de recherche, validé en simulation et sur des essais réels limités, sans robot commercial, partenaire industriel nommé ni calendrier de déploiement annoncés.
Dans nos dossiers




