
CALOS : couche de sécurité Lyapunov control-affine sur variété pour l'apprentissage par renforcement profond sûr des quadrirotors
CALOS, pour Control-Affine Lyapunov On-manifold Safety, est une couche de sécurité présentée dans une prépublication arXiv (2609.17758v1) destinée à sécuriser les politiques d'apprentissage par renforcement profond appliquées au contrôle de quadrirotors. Le système impose quatre inégalités sur l'angle d'inclinaison et une condition de décroissance de Lyapunov, formulées comme un unique programme quadratique dont la solution est la correction de norme minimale à appliquer au couple nominal produit par la politique. Ce programme quadratique est résolu de façon exacte par énumération d'ensembles actifs dans l'espace de couple à trois dimensions, avec un coût de calcul suffisamment faible pour fonctionner en temps réel sur plusieurs milliers d'environnements de simulation exécutés en parallèle, comme l'exigent les pipelines d'entraînement massivement parallèles utilisés aujourd'hui. Testé sur des tâches de suivi de trajectoire dans NVIDIA Isaac Lab, CALOS réduit l'erreur de suivi latérale de 55 à 60% par rapport à une politique PPO (Proximal Policy Optimization) non contrainte, tout en atteignant zéro violation des contraintes d'attitude sur la trajectoire d'entraînement.
L'intérêt pour l'industrie robotique tient au fait que cette couche de sécurité s'ajoute au-dessus de l'algorithme d'apprentissage sans le modifier, ce qui la rend compatible avec des pipelines d'entraînement existants. Elle répond à une limite connue des politiques de RL pour drones: rien ne garantit qu'elles respectent des contraintes physiques pendant l'entraînement ou le déploiement. Autre point notable, en restreignant l'exploration aux régions sûres de l'espace d'état, la contrainte accélère la convergence de l'entraînement au lieu de le pénaliser, ce qui contredit l'hypothèse répandue selon laquelle sécurité et performance s'opposent nécessairement en apprentissage par renforcement.
Ce travail s'inscrit dans un courant de recherche plus large sur les couches de sécurité par fonctions de Lyapunov et barrières de contrôle pour le RL robotique. Sa spécificité revendiquée est la résolution exacte, et non approchée, du programme quadratique, à un coût compatible avec la simulation massivement parallèle. Il s'agit à ce stade d'une validation uniquement en simulation, dans Isaac Lab, sans expérimentation sur drone réel ni acteur industriel associé.
Dans nos dossiers




