CSF : filtrage de sécurité contextuel pour les générateurs de mouvements
Des chercheurs proposent le Contextual Safety Filtering (CSF), un filtre de sécurité sans entraînement destiné aux générateurs de mouvement pilotés par texte, ceux qui produisent des mouvements corps entier exécutables par un robot. Le principe consiste à ancrer des règles de sécurité formulées en langage naturel dans des trajectoires de référence, l'une sûre et l'autre dangereuse, produites par le générateur lui-même. Pour chaque règle active, ces deux trajectoires définissent une valeur de sécurité affine, appliquée par un CBF-QP (programme quadratique à fonction barrière de contrôle) qui suit la référence sûre. Les auteurs testent le dispositif sur quatre générateurs préentraînés d'architectures différentes. Selon eux, CSF active la règle visée dans tous les cas dangereux, qu'ils soient explicites ou déclenchés par la scène, et réduit jusqu'à 90 % le taux d'événements dangereux. Il conserve entre 88 % et 100 % des mouvements bénins. Le système complet est démontré sur un Unitree G1 réel, qui évite des mouvements dangereux lors d'interactions avec des humains et des objets. Il s'agit d'un preprint arXiv (2610.12467v1), sans produit commercialisé ni déploiement industriel.
Le problème visé est concret. Un générateur de mouvement conditionné par texte ignore le contexte : la même action, comme saisir ou pousser, n'a pas la même portée selon qu'elle cible un objet ou une personne. Les garde-fous actuels se limitent à filtrer le prompt, à exiger des données de mouvement annotées, ou à imposer des contraintes purement géométriques. Aucun ne tient compte de la façon dont la scène change le sens du geste. Pour un intégrateur ou un responsable sécurité qui envisage des humanoïdes à proximité d'opérateurs, l'intérêt est qu'il n'y a ni réentraînement ni jeu de données étiqueté à constituer, et que l'approche s'applique à plusieurs architectures. Les règles restent lisibles et modifiables en langage naturel, ce qui facilite l'audit. Le recours à un CBF-QP apporte une garantie formelle d'application de la contrainte, ce qui contraste avec les filtres purement statistiques. Il faut toutefois relativiser. Une réduction « jusqu'à 90 % » est un maximum, pas une moyenne. Les benchmarks sont académiques, et le taux restant d'événements dangereux comme le comportement hors distribution ne sont pas précisés. La perte pouvant atteindre 12 % de mouvements bénins se traduirait en production par des refus ou des blocages à gérer. Une démonstration sur un seul robot ne vaut pas validation sécuritaire, et rien n'indique une conformité aux normes ISO ou à l'évaluation de risques en environnement partagé.
Ces travaux s'inscrivent dans la montée des générateurs de mouvement humanoïdes pilotés par texte, associés à des contrôleurs de suivi de corps entier, souvent testés sur le Unitree G1, devenu plateforme de recherche de référence grâce à son prix relativement bas. La sécurité y reste un angle mort, car les travaux dominants portent sur la qualité et la diversité du mouvement, pas sur sa pertinence en situation. La suite logique serait de tester CSF sur des tâches plus longues, avec perception en boucle fermée et une détection de scène plus robuste, puis sur d'autres plateformes. Les acteurs industriels qui poussent les modèles généralistes (VLA, modèles de fondation pour humanoïdes) devront traiter ce même problème de sécurité contextuelle avant de déployer au contact de personnes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




