StageGuard : apprentissage des transitions d'étapes pour tâches robotiques longues par distillation à base d'agents
Une équipe de recherche a publié le 18 septembre 2026 sur arXiv (référence 2609.20791v1) StageGuard, un framework baptisé "distillation agentique" destiné à résoudre un problème précis des architectures robotiques hiérarchiques : déterminer à quel moment une compétence de contrôle doit s'arrêter pour laisser place à la suivante dans une tâche longue composée de plusieurs sous-étapes. La méthode combine le raisonnement d'un grand modèle vision-langage "enseignant", nourri de trajectoires de démonstration, pour produire des explications structurées sur la complétion d'une sous-tâche et le déclenchement du changement de politique. Ces explications servent ensuite à entraîner par apprentissage supervisé un modèle vision-langage "élève" beaucoup plus léger, capable de générer ses propres explications compactes pour décider en temps réel du passage d'une étape à l'autre. Les auteurs évaluent la prédiction de transition sur des trajectoires issues de deux benchmarks, testent le comportement en boucle fermée en intégrant StageGuard dans un système de contrôle hiérarchique sur BEHAVIOR-1K, et complètent la validation par des essais sur robots physiques.
L'enjeu dépasse le détail technique : dans les architectures VLA (vision-language-action) hiérarchiques qui empilent plusieurs politiques de contrôle spécialisées, à la manière des approches derrière Pi-0, GR00T N2 ou Helix, la fiabilité de l'enchaînement des compétences conditionne directement la capacité à transformer une démonstration isolée en système autonome exploitable. Les solutions existantes s'appuient soit sur des vérificateurs de complétion codés à la main, difficiles à généraliser hors laboratoire, soit sur de gros modèles vision-langage déportés dans le cloud, dont la latence de raisonnement interdit un monitoring en temps réel et dont les critères de décision ne correspondent pas toujours à la vraie fin d'une sous-tâche. En démontrant qu'un modèle allégé, entraîné par distillation, peut approcher la qualité de décision d'un modèle massif tout en tournant localement, StageGuard s'attaque à un verrou concret pour les intégrateurs qui cherchent à déployer des piles de contrôle hiérarchiques sans dépendre d'une inférence cloud coûteuse et lente.
Le papier s'inscrit dans la lignée des travaux sur les architectures hiérarchiques combinant plusieurs politiques de contrôle robotique, un axe de recherche actif depuis l'essor des modèles VLA génériques. Aucun partenaire industriel ni acteur français ou européen n'est cité dans l'abstract, et il s'agit à ce stade d'une contribution de recherche évaluée en simulation et en tests robots réels limités, non d'un produit commercialisé ni d'un déploiement à grande échelle.
Dans nos dossiers




