FAITH : apprentissage par renforcement filtré pour la sécurité, tenant compte de la faisabilité, pour les systèmes de grande dimension
Des chercheurs présentent FAITH (Feasibility-Aware Safety-Filtered RL), un cadre d'apprentissage par renforcement sans modèle qui sépare la sécurité de la performance de la tâche, publié sur arXiv (2610.12432v1). Le système approxime la valeur de sécurité optimale état-action, puis « amortit » dans un réseau feedforward un filtre à intervention minimale, c'est-à-dire un filtre qui modifie le moins possible l'action proposée par la politique. La politique de tâche optimise son retour à travers la dynamique filtrée, sans terme de sécurité concurrent dans sa mise à jour. Si aucune action ne satisfait la condition de sécurité apprise, le filtre choisit l'action au pic de dommage prédit le plus faible. Les tests portent sur un double intégrateur, un environnement Safety Gym et un humanoïde à 29 DOF en simulation. Sur la tâche Walking-Avoid, l'humanoïde atteint 99,95 % de taux de sécurité et conserve 97 % du retour de la politique non filtrée. Sur Push-Avoid, il obtient le taux de sécurité mesuré le plus élevé en apprenant à sacrifier son équilibre et à tomber en s'éloignant de la zone protégée. Les mêmes politiques sont démontrées sur un Unitree G1 réel.
Le point notable est la séparation structurelle des objectifs. En RL sécurisé classique, la sécurité et la performance partagent un même objectif de politique, ce qui produit des mises à jour contradictoires et des compromis difficiles à régler. Les filtres de sécurité traditionnels, eux, exigent une fonction de sécurité analytique et un modèle de dynamique, ce qui est peu réaliste pour un humanoïde à haute dimension. Ils sont aussi myopes, car ils ne minimisent que l'écart instantané à l'action demandée, sans tenir compte du retour à long terme. Les projections dures deviennent en outre indéfinies quand aucune action sûre n'existe. FAITH traite ces trois limites. Le comportement « tomber pour éviter » est parlant : un filtre qui raisonne sur la faisabilité peut préférer une chute contrôlée à une collision. Pour un intégrateur, cela illustre la différence entre une sécurité de façade et un arbitrage explicite des situations sans issue. Les réserves sont claires : les résultats viennent d'un preprint sans relecture par les pairs, le taux de sécurité dépend de la définition de la zone protégée, et la démonstration sur G1 est qualitative, sans statistiques publiées dans le résumé.
Ce travail s'inscrit dans la lignée des méthodes de sécurité par fonctions de valeur, issues de l'analyse d'accessibilité de Hamilton-Jacobi et des fonctions barrières de contrôle. Celles-ci passent mal à l'échelle des humanoïdes, d'où l'intérêt des approximations apprises. Le Unitree G1, plateforme de recherche abordable, est devenu le banc d'essai courant de ces approches, ce qui facilite leur comparaison et leur reproduction. La suite logique est une validation sur des tâches de manipulation et de locomotion plus variées, avec des humains réellement présents dans l'espace de travail, et une évaluation de la robustesse face à l'écart simulation-réel. Tant que ces éléments manquent, FAITH reste une preuve de concept prometteuse plutôt qu'une brique prête pour la certification en environnement industriel.
Dans nos dossiers




