Aller au contenu principal
RecherchearXiv cs.RO 

Cadre d'apprentissage par renforcement résiduel sensible à la stabilité pour la compensation des perturbations d'un bras robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un cadre de compensation des perturbations pour bras manipulateurs, publié le 21 septembre 2026 sur arXiv sous la référence 2609.21307, combine un observateur de perturbation (DOB) analytique classique avec une politique d'apprentissage par renforcement (RL) résiduelle: le contrôleur déterministe gère la zone où le modèle est fiable, tandis que la politique RL corrige spécifiquement les résidus non capturés, comme les frottements non linéaires ou les perturbations composées. Un réseau estimateur associe l'historique des observations à un contexte de perturbation privilégié, structurant l'espace latent par régime pour accélérer l'adaptation lors des transitions. Une borne d'action dépendante de l'état, dérivée d'une analyse de stabilité entrée-état (ISS), confine mathématiquement l'erreur de suivi dans une enveloppe certifiée quelle que soit la sortie du réseau. Sur un bras à 6 degrés de liberté (DOF), l'erreur de suivi chute de 27,8% sur matériel réel en transfert sim-to-real zero-shot, et de 38,0% sous une vibration de la base absente de l'entraînement.

Pour la robotique industrielle de précision, l'apport dépasse la performance brute: le principal frein à l'adoption du RL dans des boucles de commande certifiées est l'absence de garanties de stabilité, un réseau pouvant produire des actions imprévisibles hors distribution. En dérivant une borne prouvable plutôt qu'en s'appuyant sur l'apprentissage pur, les auteurs répondent directement à cette objection, ce qui pourrait faciliter l'intégration de correcteurs appris dans des applications d'assemblage ou d'usinage où la sécurité doit être certifiée. Le transfert sim-to-real zero-shot, sans calibration fine sur le robot réel, va aussi à l'encontre de l'hypothèse répandue selon laquelle les politiques RL exigent un réglage matériel extensif pour être exploitables, un frein classique à la commercialisation de la robotique apprise.

Les observateurs de perturbation analytiques équipent les manipulateurs industriels depuis des décennies mais peinent face aux frottements non linéaires et aux incertitudes de paramètres, ce qui a nourri une vague de recherche en RL résiduel, apprenant une correction par-dessus un contrôleur classique plutôt qu'une politique de bout en bout, à l'image de travaux comparables en locomotion et en préhension robotique. Il s'agit toutefois d'un article de recherche déposé sur arXiv, non encore validé par relecture par les pairs et testé sur un seul bras à 6 DOF en laboratoire: aucun partenariat industriel, pilote ou calendrier de déploiement n'est mentionné, et la généralisation à d'autres manipulateurs ou perturbations reste à démontrer.

Dans nos dossiers

À lire aussi

Stabilité de la récompense par transition d'étapes pour l'apprentissage par renforcement
1arXiv cs.RO 

Stabilité de la récompense par transition d'étapes pour l'apprentissage par renforcement

Une équipe de recherche présente STDR (Stage-Transition Dense Reward), un framework qui transforme des vidéos de démonstration non structurées en récompenses denses pour entraîner des agents d'apprentissage par renforcement (RL) sur des tâches de manipulation robotique à long horizon, sans design manuel de fonction de récompense. Le système infère automatiquement la structure en étapes d'une tâche à partir des démonstrations, puis fournit deux signaux complémentaires pendant l'entraînement en ligne : une récompense orientée objectif à chaque transition d'étape, et un signal de progression fine à l'intérieur de chaque étape. Un mécanisme de détection hors distribution (OOD) et un module de régulation de la préhension ont été ajoutés pour éviter le "reward hacking", ce biais classique où l'agent exploite des failles de la fonction de récompense plutôt que d'accomplir réellement la tâche. Les tests couvrent 14 tâches de manipulation réparties sur trois bancs d'essai standards du domaine, MetaWorld, ManiSkill et Franka Kitchen, avec des validations complémentaires sur robot réel. L'enjeu dépasse la seule performance académique. Concevoir des récompenses denses à la main reste l'un des goulots d'étranglement majeurs du RL appliqué à la robotique industrielle : chaque nouvelle tâche, chaque nouvelle configuration d'objets impose de retravailler manuellement le signal d'apprentissage, ce qui freine le déploiement à grande échelle chez les intégrateurs. En montrant que STDR égale voire dépasse les récompenses handcrafted sur plusieurs tâches complexes, tout en gagnant en efficacité d'échantillonnage, l'étude appuie l'hypothèse selon laquelle l'apprentissage par vidéos de démonstration peut remplacer l'ingénierie de récompense ad hoc, un argument déterminant pour accélérer l'entraînement de bras robotiques ou de mains manipulatrices en environnement réel plutôt qu'en simulation pure. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage de récompenses par vision (reward learning from video), un axe actif face aux limites du reward shaping manuel et aux coûts d'annotation. Les résultats sur robot réel, où STDR assigne des récompenses stables et bien calibrées sur les exécutions réussies tout en pénalisant correctement les échecs, suggèrent une robustesse au bruit visuel qui manquait souvent aux approches précédentes. Les prochaines étapes attendues porteront sur l'extension à des tâches encore plus longues et sur l'intégration avec des politiques de type VLA (vision-language-action) pour la généralisation multi-tâches.

RecherchePaper
1 source
NavRL++ : un cadre système pour améliorer le transfert simulation-réel dans la navigation robotique par apprentissage par renforcement
2arXiv cs.RO 

NavRL++ : un cadre système pour améliorer le transfert simulation-réel dans la navigation robotique par apprentissage par renforcement

Une équipe de chercheurs a publié NavRL++, un cadre de navigation autonome par apprentissage par renforcement (RL) conçu spécifiquement pour réduire l'écart entre simulation et déploiement réel. Présenté sur arXiv (2605.15559), le système propose à la fois un nouveau pipeline d'entraînement et de déploiement et une étude empirique systématique qui isole les facteurs dégradant les performances en conditions réelles : bruit de capteurs, échecs de perception, latence système et réponse du contrôleur. Les auteurs ont validé leur approche sur plusieurs plateformes physiques, dont des robots aériens et quadrupèdes, sur des tâches de navigation comme l'exploration et l'inspection, en obtenant un transfert zéro-shot depuis la simulation. Le problème que NavRL++ cherche à résoudre est structurel : la quasi-totalité des travaux récents en navigation par RL se concentre sur la conception du framework d'apprentissage (représentations d'entrée, espaces d'actions, fonctions de récompense), sans analyser rigoureusement pourquoi les politiques entraînées en sim échouent en réel. NavRL++ répond à cela avec deux contributions techniques. La première est le perturbation-aware fine-tuning, une stratégie post-entraînement qui injecte explicitement les perturbations identifiées lors de l'étude empirique pour rendre la politique plus robuste. La seconde est une politique à raisonnement temporel basée sur un Transformer, qui exploite une fenêtre d'observation courte pour lisser le contrôle et compenser la dégradation perceptuelle typique du monde réel. Les résultats quantitatifs montrent des performances supérieures aux baselines RL dans des environnements statiques et dynamiques, et comparables aux planificateurs classiques à optimisation en contexte statique. Le défi du sim-to-real reste l'un des verrous majeurs à la commercialisation de la navigation autonome par RL, notamment pour les robots mobiles en environnements industriels non structurés. La plupart des approches existantes, comme les travaux issus de Berkeley (BADGR, RECON) ou les pipelines de navigation d'Agility Robotics et Boston Dynamics, contournent partiellement le problème via de la simulation photo-réaliste ou du domain randomization intensif. NavRL++ adopte une approche complémentaire : diagnostiquer empiriquement les sources d'écart plutôt que de les masquer. La prochaine étape naturelle sera de tester cette méthodologie sur des flottes de robots en déploiement continu, notamment dans des scénarios entrepôt ou inspection d'infrastructures où la latence et la fiabilité des capteurs sont des contraintes opérationnelles dures.

RecherchePaper
1 source
Apprentissage par renforcement résiduel pour la téléopération de robots sous délais stochastiques
3arXiv cs.RO 

Apprentissage par renforcement résiduel pour la téléopération de robots sous délais stochastiques

Les délais de communication en téleopération robotique ne sont jamais constants : latences variables selon la charge réseau, paquets perdus, jitter. Ces instabilités stochastiques introduisent des discontinuités dans les observations reçues par le contrôleur. En conditions réelles, les méthodes classiques d'apprentissage par renforcement (RL) s'effondrent face à ces délais : l'agent, confronté à des états incohérents, produit des commandes oscillantes à haute fréquence, un phénomène dit de chattering, qui dégrade la stabilité mécanique et l'exécution des tâches. Une équipe de chercheurs publie sur arXiv (identifiant 2605.15480, mai 2025) un cadre hybride baptisé delay-resilient RL, combinant un estimateur d'état basé sur un réseau LSTM (Long Short-Term Memory) avec une politique RL résiduelle. Le LSTM reconstruit des estimations d'état lisses et continues à partir des observations retardées, permettant à l'agent d'apprendre une politique de compensation résiduelle en couple (residual torque). La validation expérimentale a été conduite sur des robots Franka Panda, bras 7-DOF largement utilisé comme référence en recherche sur la manipulation. L'approche tire parti de la complémentarité de deux techniques établies : les réseaux LSTM pour la reconstruction temporelle de séquences, et le RL résiduel pour corriger un contrôleur de base sans le remplacer. En séparant l'estimation d'état du problème de contrôle, les auteurs évitent que le chattering contamine le signal de commande, un défaut récurrent des architectures RL pures opérant avec des espaces d'observation augmentés. Pour les opérateurs industriels déployant des systèmes de téleopération en conditions réseau dégradées, maintenance en milieu hostile, chirurgie à distance ou contrôle d'assets offshore, la robustesse aux délais à forte variance représente un critère discriminant souvent absent des benchmarks académiques. Les résultats publiés montrent une supériorité sur les baselines état de l'art même sous des délais stochastiques élevés, suggérant une voie viable vers des contrôleurs plus robustes en déploiement réel. Le Franka Panda, produit par Franka Robotics (Munich), s'est imposé comme référence de facto dans les laboratoires de manipulation grâce à sa compliance active et son API ouverte. Les approches concurrentes pour gérer les délais en RL incluent l'augmentation de l'espace d'états avec l'historique d'observations ou les prédicteurs à horizon fixe ; la combinaison LSTM et RL résiduel reste une direction moins explorée dans la littérature. Ce travail est un preprint arXiv non évalué par les pairs, et les résultats restent limités à un environnement expérimental contrôlé avec un seul type de robot. Les prochaines étapes naturelles impliquent des validations sur des plateformes bimanuelles ou humanoïdes, ainsi que des tests en conditions réseau réelles plutôt que simulées.

UEFranka Robotics (Munich) est la plateforme de référence utilisée, et cette approche de robustesse aux délais stochastiques pourrait intéresser les équipes européennes travaillant sur la téleopération industrielle en milieu hostile ou la chirurgie à distance, domaines en développement dans l'UE.

RecherchePaper
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
4arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source