
Interprétation des variables latentes de contrôle pour l'identification de systèmes via Conditional Flow Matching
Des chercheurs publient sur arXiv (référence 2608.23887v1) une méthode qui rend interprétables les représentations latentes utilisées par les politiques de contrôle adaptatif de drones quadrirotors. Ces politiques, entraînées pour s'ajuster automatiquement à des dynamiques changeantes comme l'usure des actionneurs ou une charge variable, encodent en interne un vecteur latent qui capture l'état du système, mais ce latent reste une boîte noire propre à la politique, sans lien explicite avec les paramètres physiques réels du robot. L'équipe décode chaque latent opérationnel en une distribution de modèles physiques de quadrirotor grâce au conditional flow matching, une technique générative qui produit un ensemble de modèles plausibles plutôt qu'un jeu unique de paramètres, car plusieurs configurations physiques différentes peuvent produire un comportement en boucle fermée similaire. Cette distribution sert ensuite à deux usages sans modifier la politique de bas niveau déjà entraînée: le réglage prédictif en ligne d'un contrôleur de haut niveau, et l'analyse de robustesse face à des perturbations spécifiées. Sous des dynamiques d'actionneurs perturbées, le réglage prédictif basé sur les modèles décodés réduit l'erreur RMSE de suivi de position de 23% et l'erreur RMSE de cap de 45% par rapport à des gains fixes. Sous des perturbations de force gaussiennes, les ensembles de modèles décodés prédisent fidèlement l'évolution de l'erreur de suivi latérale.
Ce travail cible un problème récurrent du contrôle robotique appris: les politiques adaptatives entraînées par renforcement, notamment via la randomisation de domaine, s'ajustent bien en pratique mais restent opaques pour les ingénieurs qui doivent diagnostiquer un échec, régler un contrôleur en aval ou garantir une marge de robustesse avant déploiement. En transformant un vecteur latent abstrait en un ensemble de modèles physiques interprétables, la méthode permet un diagnostic et un réglage post-hoc de politiques figées, sans réentraînement ni accès au code source de la politique, un besoin direct pour les équipes d'intégration devant certifier des systèmes de contrôle appris avant un déploiement industriel.
La publication s'inscrit dans la lignée des travaux sur le contrôle conditionné par latent, une approche courante pour l'adaptation rapide de robots à des dynamiques inconnues, d'abord en simulation puis en transfert vers le réel. Les auteurs positionnent leur contribution comme un pont entre les politiques de bout en bout, difficiles à auditer, et les méthodes de contrôle classique fondées sur des modèles physiques identifiés. Les expériences restent pour l'instant limitées à des quadrirotors simulés soumis à des perturbations d'actionneurs et à des forces gaussiennes; aucune validation sur matériel réel ni extension à d'autres plateformes n'est annoncée à ce stade.
Dans nos dossiers




