Cadre d'apprentissage par renforcement résiduel sensible à la stabilité pour la compensation des perturbations d'un bras robotique
Un cadre de compensation des perturbations pour bras manipulateurs, publié le 21 septembre 2026 sur arXiv sous la référence 2609.21307, combine un observateur de perturbation (DOB) analytique classique avec une politique d'apprentissage par renforcement (RL) résiduelle: le contrôleur déterministe gère la zone où le modèle est fiable, tandis que la politique RL corrige spécifiquement les résidus non capturés, comme les frottements non linéaires ou les perturbations composées. Un réseau estimateur associe l'historique des observations à un contexte de perturbation privilégié, structurant l'espace latent par régime pour accélérer l'adaptation lors des transitions. Une borne d'action dépendante de l'état, dérivée d'une analyse de stabilité entrée-état (ISS), confine mathématiquement l'erreur de suivi dans une enveloppe certifiée quelle que soit la sortie du réseau. Sur un bras à 6 degrés de liberté (DOF), l'erreur de suivi chute de 27,8% sur matériel réel en transfert sim-to-real zero-shot, et de 38,0% sous une vibration de la base absente de l'entraînement.
Pour la robotique industrielle de précision, l'apport dépasse la performance brute: le principal frein à l'adoption du RL dans des boucles de commande certifiées est l'absence de garanties de stabilité, un réseau pouvant produire des actions imprévisibles hors distribution. En dérivant une borne prouvable plutôt qu'en s'appuyant sur l'apprentissage pur, les auteurs répondent directement à cette objection, ce qui pourrait faciliter l'intégration de correcteurs appris dans des applications d'assemblage ou d'usinage où la sécurité doit être certifiée. Le transfert sim-to-real zero-shot, sans calibration fine sur le robot réel, va aussi à l'encontre de l'hypothèse répandue selon laquelle les politiques RL exigent un réglage matériel extensif pour être exploitables, un frein classique à la commercialisation de la robotique apprise.
Les observateurs de perturbation analytiques équipent les manipulateurs industriels depuis des décennies mais peinent face aux frottements non linéaires et aux incertitudes de paramètres, ce qui a nourri une vague de recherche en RL résiduel, apprenant une correction par-dessus un contrôleur classique plutôt qu'une politique de bout en bout, à l'image de travaux comparables en locomotion et en préhension robotique. Il s'agit toutefois d'un article de recherche déposé sur arXiv, non encore validé par relecture par les pairs et testé sur un seul bras à 6 DOF en laboratoire: aucun partenariat industriel, pilote ou calendrier de déploiement n'est mentionné, et la généralisation à d'autres manipulateurs ou perturbations reste à démontrer.
Dans nos dossiers




