Aller au contenu principal
Entraînement d'un critique privilégié : adaptation à une panne de propulseur sans capteur en RL de bout en bout
RecherchearXiv cs.RO 

Entraînement d'un critique privilégié : adaptation à une panne de propulseur sans capteur en RL de bout en bout

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2608.22976v1, 25 août 2026) un système baptisé RAFT, pour Recurrent Asymmetric Fault Tolerant, destiné à la navigation tolérante aux pannes de robots actionnés par propulseurs. Le système s'appuie sur un algorithme d'apprentissage par renforcement PPO combiné a une mémoire récurrente et un entrainement par "critique privilégié" : pendant l'entrainement, la fonction de valeur a accès a l'état réel de dégradation des propulseurs, tandis que l'acteur, lui, ne reçoit que les observations standard disponibles au déploiement, sans capteur de panne dédié. Teste sur une plateforme robotique flottante équipée de 8 propulseurs et d'une roue de réaction, soumise a jusqu'a quatre pannes simultanées de propulseurs, RAFT atteint un taux de réussite de 70,2% avec quatre pannes concurrentes. Cela comble 84% de l'écart séparant une politique naïve face aux pannes (4,8% de réussite) d'une politique oracle qui, elle, observe l'état complet de dégradation au moment du déploiement (82,4%). L'ensemble du code, des checkpoints et des données est publie en open-source.

L'intérêt pour l'industrie robotique tient au fait que la détection de pannes classique exige des capteurs dédiés souvent absents sur le terrain, tandis que les contrôleurs oracles capables d'observer l'état réel de dégradation restent irréalistes en déploiement. RAFT montre qu'une politique peut apprendre a compenser des dégradations continues, des pannes franches ou des blocages en position ouverte sans aucune instrumentation de détection additionnelle, uniquement grâce a une asymétrie d'information entre acteur et critique pendant l'entrainement. Pour les intégrateurs de robots a propulseurs (véhicules sous-marins, plateformes en vol libre), cela suggère une voie pour renforcer la robustesse opérationnelle sans surcout matériel, même si l'écart de 16 points avec la politique oracle rappelle que la marge de progression reste réelle.

Cette approche s'inscrit dans la lignée des techniques d'apprentissage acteur-critique asymétrique déjà exploitées en robotique legged et manipulation dextérité, ou des informations privilégiées en simulation guident l'apprentissage de politiques déployables sans ces mêmes informations. Les auteurs positionnent RAFT comme une alternative aux pipelines de détection de pannes classiques, avec publication complète du code et des données pour permettre reproduction et extension par la communauté, sans toutefois annoncer de calendrier de validation sur matériel réel au-delà des tests en simulation décrits.

Dans nos dossiers

À lire aussi

PAC-ACT : post-entraînement acteur-critique pour transformeurs à segmentation d'actions
1arXiv cs.RO 

PAC-ACT : post-entraînement acteur-critique pour transformeurs à segmentation d'actions

Des chercheurs proposent PAC-ACT, un cadre d'apprentissage par renforcement pour affiner après coup les politiques ACT (Action Chunking Transformer) déjà entraînées, publié le 13 juillet 2026 sur arXiv (2607.09590). Ces politiques, courantes en manipulation industrielle de précision au contact, sont habituellement entraînées par clonage comportemental (behavior cloning) puis souffrent d'un décalage de distribution dès que la tâche implique des contacts physiques répétés, sous des contraintes de force et de perturbations de pose. PAC-ACT reformule l'optimisation au niveau du "chunk" (bloc d'actions), construit une architecture acteur-critique dérivée d'ACT, et introduit une contrainte hybride de préservation du comportement pré-entraîné pendant le fine-tuning en ligne. Sur un benchmark industriel de contact de précision baptisé Contour, la méthode réduit fortement la force de contact maximale et divise par 46 la proportion de mesures de force dépassant 60 newtons, tout en conservant une latence d'inférence et une consommation de mémoire GPU faibles. L'enjeu dépasse la simple performance académique: les modèles vision-langage-action (VLA) généralisent bien mais restent trop lourds et lents pour du contrôle industriel temps réel, alors que les politiques de type ACT sont rapides mais fragiles dès que le contact physique entre en jeu, un défaut connu qui limite leur usage en usine sur des tâches d'assemblage ou d'insertion nécessitant une gestion fine de la force. En démontrant qu'un post-entraînement par renforcement peut corriger ce défaut sans sacrifier la vitesse d'exécution, PAC-ACT apporte une réponse concrète à un point de friction connu entre robotique de recherche et déploiement industriel réel, là où beaucoup d'annonces se limitent à des démonstrations en environnement contrôlé. Le travail s'inscrit dans la lignée des politiques ACT, popularisées pour leur efficacité dans l'apprentissage par imitation sur tâches manipulatoires fines, et cherche à combler leur principal talon d'Achille face aux approches VLA plus généralistes mais coûteuses en ressources. L'ablation en récompense éparse montre par ailleurs que la contrainte de préservation comportementale favorise une exploration efficace même avec des poses initiales aléatoires, ouvrant la voie à une validation plus large sur d'autres tâches de contact industriel avant un éventuel déploiement en conditions réelles.

RecherchePaper
1 source
SUNSET : un exemple de segmentation sémantique par fusion de capteurs pour l'auto-adaptation basée sur ROS
2arXiv cs.RO 

SUNSET : un exemple de segmentation sémantique par fusion de capteurs pour l'auto-adaptation basée sur ROS

Des chercheurs ont publié SUNSET, un exemplar open source basé sur ROS2 destiné à évaluer de façon rigoureuse et reproductible les approches d'auto-adaptation logicielle en robotique. Le système implémente un pipeline de segmentation sémantique par fusion de capteurs, piloté par un modèle de machine learning entraîné dont le prétraitement des entrées peut être perturbé pour provoquer des dégradations de performance réalistes. L'exemplar expose cinq défaillances observables, chacune pouvant résulter de causes racines différentes, et permet de simuler des pannes concurrentes touchant à la fois l'auto-guérison (self-healing) et l'auto-optimisation (self-optimisation) du système. Le package publié comprend le pipeline de segmentation complet, le modèle ML entraîné, des scripts d'injection de fautes, un contrôleur de référence pour comparaisons, ainsi qu'une documentation détaillée d'intégration et d'évaluation. Le code est disponible sur GitHub, sous le dépôt XITASO/sunset. L'intérêt pour la communauté robotique dépasse le simple cas d'usage technique. Les systèmes logiciels embarqués dans les robots gagnent en complexité à mesure que les déploiements se multiplient en environnements dynamiques, où les symptômes de panne sont souvent visibles mais les causes racines restent ambiguës, voire multiples et simultanées. Faute de bancs d'essai standardisés, la recherche en auto-adaptation architecturale peine à comparer objectivement différentes approches de détection et de correction de défaillances. En fournissant un exemplar ouvert, reproductible et doté d'un contrôleur de référence, SUNSET vise à combler ce manque méthodologique et à faciliter des études comparatives rigoureuses entre équipes de recherche. Le projet est porté par XITASO, société allemande spécialisée en ingénierie logicielle, dans la lignée d'une tradition d'exemplars dédiés à la recherche en systèmes auto-adaptatifs, un domaine qui manque historiquement de bancs d'essai partagés et réalistes. La publication, classée comme une version révisée (replace) sur arXiv, s'adresse aux équipes académiques et industrielles travaillant sur la robustesse logicielle des robots déployés en conditions réelles, avec pour prochaine étape l'adoption de l'outil par d'autres laboratoires pour des études comparatives.

UELe projet est porte par XITASO, entreprise allemande, ce qui renforce la contribution europeenne a la recherche en robotique logicielle auto-adaptative, sans impact direct sur la France ou une legislation europeenne.

RecherchePaper
1 source
AquaCap : un agent incarné sous-marin sans entraînement, piloté par du code comme politique
3arXiv cs.RO 

AquaCap : un agent incarné sous-marin sans entraînement, piloté par du code comme politique

AquaCap est un agent robotique sous-marin capable de naviguer et de manipuler des objets de façon autonome sans aucun entraînement préalable ni mise à jour de paramètres, selon le principe dit "Code-as-Policy" décrit dans un article mis en ligne sur arXiv en septembre 2026 (référence 2609.23133). Le système repose sur une architecture à deux niveaux qui traduit les instructions de tâche et les observations de l'environnement en plans adaptés aux conditions rencontrées et en programmes de contrôle directement exécutables. Une couche de perception structurée lui fournit des informations sémantiques, géométriques et évaluées en fiabilité malgré la dégradation typique des images sous l'eau, tandis qu'une mémoire sensible aux échecs diagnostique les actions ratées et déclenche une replanification en boucle fermée avec révision du code généré. En simulation, AquaCap atteint un taux de réussite de 66,43%. Des essais réels avec un véhicule télé-opéré (ROV) ont démontré des saisies et transports d'objets autonomes, y compris la récupération de cibles déplacées par des courants hydrodynamiques. Cette approche cible un verrou spécifique du secteur : contrairement à la robotique terrestre, qui alimente ses modèles vision-langage-action avec des volumes massifs de données de téléopération, la robotique sous-marine ne peut pas répliquer cette stratégie, chaque campagne de collecte en mer ou en bassin restant coûteuse et rare. En s'appuyant sur la génération de code plutôt que sur l'apprentissage de bout en bout, AquaCap s'adapte en ligne sans réentraînement, ce qui intéresse directement les intégrateurs d'AUV et de ROV pour l'inspection offshore, l'aquaculture ou la maintenance sous-marine. Le taux de succès de 66,43% en simulation, nettement en dessous des standards affichés par les meilleurs systèmes VLA terrestres, rappelle toutefois que l'écart entre démonstration et fiabilité opérationnelle reste large sous l'eau. AquaCap prolonge les architectures "Code-as-Policy", qui font générer par des modèles de langage du code de contrôle exécutable plutôt que des politiques apprises par renforcement, une piste déjà explorée en robotique terrestre mais encore rare en milieu marin. Le résumé ne mentionne aucune affiliation industrielle ni partenaire commercial, ce qui situe le projet comme une recherche académique et non comme un produit prêt à déployer. Les démonstrations réelles se limitent pour l'instant à un seul ROV et à des tâches de préhension et de transport, sans calendrier de déploiement annoncé. La prochaine étape attendue pour ce type de système serait une validation sur davantage de plateformes et en conditions océaniques réelles, au-delà des bassins contrôlés, avant toute adoption par des opérateurs d'inspection sous-marine ou de robotique offshore.

RecherchePaper
1 source
FlashNav : entraînement ultra-rapide d'une politique de navigation robotique en 20 secondes
4arXiv cs.RO 

FlashNav : entraînement ultra-rapide d'une politique de navigation robotique en 20 secondes

FlashNav, un framework d'entraînement de politiques de navigation robotique présenté dans une préprint arXiv (2606.15846) publiée en juin 2026, annonce un entraînement en moins de 20 secondes sur GPU pour des politiques de navigation déployables sur robots réels. Les auteurs ont testé le système sur deux plateformes matérielles : le robot à roues TurtleBot2 et le robot quadrupède Unitree Go2. Sur une carte RTX 5090, FlashNav atteint un taux de succès de 100 % en dessous de 20 secondes, et reste dans les dizaines de secondes sur des GPU de bureau grand public. L'architecture repose sur un simulateur bitmap batché et un pipeline d'entraînement entièrement résidant sur GPU, piloté par un algorithme baptisé FastDSAC, qui génère en parallèle un volume massif de transitions de navigation sans jamais quitter la mémoire GPU. La clé du gain de vitesse est architecturale : FlashNav aligne strictement la simulation sur le MDP (processus de décision markovien) de navigation, en conservant uniquement les composantes utiles à l'apprentissage, géométrie d'occupation, capteurs de distance (range sensing), contrôle conditionné par objectif, dynamique de mouvement, gestion des collisions, terminaison et réinitialisation, tout en éliminant le rendu graphique et les détails physiques haute-fidélité habituellement présents dans les simulateurs. Ce choix réduit drastiquement le coût computationnel sans sacrifier la transférabilité : les politiques apprises se transfèrent sur robots physiques, en environnement intérieur statique et dynamique. Pour les intégrateurs robotiques, c'est un signal fort : le sim-to-real gap reste gérable même avec une simulation volontairement appauvrie, à condition que le MDP soit correctement modélisé. Le deep reinforcement learning pour la navigation autonome souffrait jusqu'ici d'un frein majeur à l'adoption industrielle : des cycles d'entraînement de plusieurs heures, voire de plusieurs jours, incompatibles avec l'itération rapide en production. FlashNav attaque directement ce verrou. Sur le plan concurrentiel, il se positionne face aux approches de navigation basées sur des cartes (SLAM classique) et aux VLA (Vision-Language-Action models) qui nécessitent des ressources de calcul bien supérieures. La prochaine étape naturelle sera de valider le passage à l'échelle dans des environnements dynamiques plus complexes et sur des flottes de robots, ce que la préprint ne couvre pas encore.

RecherchePaper
1 source