SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action
Une équipe de recherche présente SafeStage, un benchmark structuré en trois étapes pour évaluer la sécurité des politiques de manipulation robotique conditionnées par le langage et la vision (VLA), publié sur arXiv (arXiv:2609.21223v1) en septembre 2026. L'outil comprend 97 scénarios de risque conçus spécifiquement pour tester trois phases du cycle de manipulation : les « dangers d'état initial » (relations spatiales ou physiques à résoudre avant de toucher à l'objet cible), la « sécurité pendant l'exécution » (contacts non intentionnels, trajectoires dangereuses, entrées dans des zones interdites, interactions non voulues avec d'autres objets) et les « dangers d'état final » (conditions instables ou dangereuses subsistant après l'achèvement nominal de la tâche). Le benchmark combine des vérifications basées sur les événements et sur l'état du système, et rapporte le taux de succès de la tâche indépendamment des résultats de sécurité propres à chaque étape. Les chercheurs ont testé des politiques VLA à action directe représentatives ainsi que des politiques s'appuyant sur des modèles du monde, dans un protocole commun en boucle fermée.
Le résultat central est qu'une tâche accomplie avec succès coexiste fréquemment avec des violations de sécurité, et que les différentes politiques testées présentent des profils d'échec distincts selon l'étape du cycle concernée. Ce découplage entre succès de tâche et sécurité vient contredire une hypothèse implicite répandue dans le secteur, celle qu'un robot qui termine sa tâche l'a nécessairement fait de manière sûre. Pour les intégrateurs et décideurs industriels évaluant des politiques VLA généralistes en vue d'usages en ligne de production ou en environnement partagé avec des humains, SafeStage offre un outil de diagnostic permettant de localiser précisément quand et comment une politique échoue en matière de sécurité, plutôt que de se fier à un simple taux de réussite de tâche ou à des tests isolés de refus sémantique. Ce constat arrive alors que la course aux politiques VLA généralistes, portée par des familles de modèles comme Pi-0, GR00T ou Helix dans l'écosystème plus large de la manipulation robotique, s'accélère sur la base de démonstrations souvent impressionnantes mais rarement soumises à une évaluation systématique de sécurité en boucle fermée.
Ce travail répond à une lacune des benchmarks existants, généralement centrés soit sur le succès de tâche, soit sur des contraintes physiques isolées, soit sur le refus sémantique de commandes dangereuses, soit sur des dommages physiques déjà constatés après coup, sans permettre de localiser à quel moment précis du cycle de manipulation survient une violation. En proposant un banc d'essai unifié et diagnostique, les auteurs visent un outil réutilisable pour comparer et améliorer les politiques VLA à mesure qu'elles se rapprochent d'un déploiement industriel réel. Le papier ne mentionne ni partenariat commercial ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche académique destinée à la communauté robotique, sans acteur ni déploiement réel annoncé, ce qui la distingue nettement des communiqués marketing habituels du secteur des robots humanoïdes.
Ce benchmark académique n'implique aucun acteur français ou européen mais offre un outil générique que des intégrateurs robotiques européens pourraient utiliser pour évaluer la sécurité de politiques VLA avant déploiement industriel.
Dans nos dossiers




