
Entraînement d'un critique privilégié : adaptation à une panne de propulseur sans capteur en RL de bout en bout
Des chercheurs publient sur arXiv (arXiv:2608.22976v1, 25 août 2026) un système baptisé RAFT, pour Recurrent Asymmetric Fault Tolerant, destiné à la navigation tolérante aux pannes de robots actionnés par propulseurs. Le système s'appuie sur un algorithme d'apprentissage par renforcement PPO combiné a une mémoire récurrente et un entrainement par "critique privilégié" : pendant l'entrainement, la fonction de valeur a accès a l'état réel de dégradation des propulseurs, tandis que l'acteur, lui, ne reçoit que les observations standard disponibles au déploiement, sans capteur de panne dédié. Teste sur une plateforme robotique flottante équipée de 8 propulseurs et d'une roue de réaction, soumise a jusqu'a quatre pannes simultanées de propulseurs, RAFT atteint un taux de réussite de 70,2% avec quatre pannes concurrentes. Cela comble 84% de l'écart séparant une politique naïve face aux pannes (4,8% de réussite) d'une politique oracle qui, elle, observe l'état complet de dégradation au moment du déploiement (82,4%). L'ensemble du code, des checkpoints et des données est publie en open-source.
L'intérêt pour l'industrie robotique tient au fait que la détection de pannes classique exige des capteurs dédiés souvent absents sur le terrain, tandis que les contrôleurs oracles capables d'observer l'état réel de dégradation restent irréalistes en déploiement. RAFT montre qu'une politique peut apprendre a compenser des dégradations continues, des pannes franches ou des blocages en position ouverte sans aucune instrumentation de détection additionnelle, uniquement grâce a une asymétrie d'information entre acteur et critique pendant l'entrainement. Pour les intégrateurs de robots a propulseurs (véhicules sous-marins, plateformes en vol libre), cela suggère une voie pour renforcer la robustesse opérationnelle sans surcout matériel, même si l'écart de 16 points avec la politique oracle rappelle que la marge de progression reste réelle.
Cette approche s'inscrit dans la lignée des techniques d'apprentissage acteur-critique asymétrique déjà exploitées en robotique legged et manipulation dextérité, ou des informations privilégiées en simulation guident l'apprentissage de politiques déployables sans ces mêmes informations. Les auteurs positionnent RAFT comme une alternative aux pipelines de détection de pannes classiques, avec publication complète du code et des données pour permettre reproduction et extension par la communauté, sans toutefois annoncer de calendrier de validation sur matériel réel au-delà des tests en simulation décrits.
Dans nos dossiers




