Aller au contenu principal
Robustesse des interactions robot-environnement grâce à des degrés de liberté passifs compliants : une approche hybride position-force avec linéarisation par retour d'état
RecherchearXiv cs.RO 

Robustesse des interactions robot-environnement grâce à des degrés de liberté passifs compliants : une approche hybride position-force avec linéarisation par retour d'état

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Traduction/synthèse de l'article :

Une équipe de recherche propose une nouvelle architecture de contrôle hybride position-force pour bras robotiques, décrite dans un article publié sur arXiv (2607.00571v1). Contrairement aux approches classiques qui reposent uniquement sur la rétroaction active, les capteurs de force et le réglage de gains, cette méthode combine une linéarisation par retour d'état avec un degré de liberté passif compliant intégré à l'effecteur terminal, sous forme d'une interface physique ressort-amortisseur. Cette interface stocke et dissipe l'énergie d'impact directement au point de contact, avant que les chocs haute fréquence ne se propagent vers les articulations actionnées et la boucle de contrôle en force. L'approche a été évaluée sous MATLAB/Simulink sur un manipulateur planaire à 2 degrés de liberté, avec trois configurations d'effecteur comparées : rigide, ressort seul, et ressort-amortisseur. En environnement fixe, la configuration ressort-amortisseur réduit l'écart-type de l'erreur de force tangentielle de 36,5%. En environnement variable, elle réduit l'écart-type de l'erreur de force normale de 25,4% et celui de l'erreur de vitesse normale de 41,1%, avec une réponse de couple articulaire plus lisse.

L'enjeu dépasse le simple exercice académique : les interactions robot-environnement en milieu dynamique ou non structuré, chocs, vibrations, incertitudes de géométrie de contact, restent un point faible des architectures de contrôle en force purement actives, qui peinent à absorber les transitoires avant qu'ils ne perturbent la boucle de commande. En ramenant une part de l'amortissement au niveau mécanique plutôt que purement logiciel, cette approche s'inscrit dans une tendance de fond de la robotique de manipulation : compenser les limites de la rétroaction pure par de la compliance physique, moins coûteuse en calcul et plus robuste aux incertitudes de modèle. Pour les intégrateurs travaillant sur des tâches de contact (assemblage, ébavurage, manipulation en environnement incertain), cela ouvre une piste de conception hybride matériel-logiciel plutôt qu'un simple ajustement des gains de commande.

Ce travail s'inscrit dans la lignée des recherches en contrôle d'impédance et en compliance passive, qui cherchent depuis plusieurs décennies à concilier précision de positionnement et sécurité des interactions physiques. Ici, la validation reste limitée à la simulation, sur un bras plan à seulement deux degrés de liberté, ce qui est loin des manipulateurs industriels à six axes ou des bras humanoïdes multi-DOF utilisés en conditions réelles. Les auteurs ne précisent pas de calendrier de validation expérimentale sur banc physique, étape généralement nécessaire avant tout transfert vers l'industrie, ni de comparaison directe avec les architectures de contrôle d'impédance déjà déployées commercialement.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement résiduel hybride pour l'insertion robotique de livres en environnement à contacts multiples
1arXiv cs.RO 

Apprentissage par renforcement résiduel hybride pour l'insertion robotique de livres en environnement à contacts multiples

Une étude publiée en septembre 2026 sur arXiv (référence 2609.19962) s'attaque à l'insertion robotique de livres dans une étagère serrée, une tâche de manipulation en contact riche où une erreur de pose de l'ordre du millimètre peut provoquer un blocage, un échec de relâchement ou un mauvais positionnement de l'objet. La méthode proposée est hybride: un contrôleur nominal dans l'espace de la tâche gère l'insertion et le positionnement structurés, pendant qu'une politique d'apprentissage par renforcement résiduel (PPO) apporte des corrections locales bornées et décide du moment du relâchement; seule la brève séquence d'ouverture-retrait-refermeture reste scriptée. En simulation calibrée sur le déploiement réel, sur 512 conditions fixes et trois entraînements indépendants, le taux de succès moyen atteint 98,50% (écart-type de 0,23 point) contre 37,89% pour le contrôleur nominal seul. Sur un bras robotique physique xArm7 à 7 degrés de liberté, 60 essais répartis sur 30 conditions appariées montrent un succès passant de 26,7% à 63,3% avec l'approche résiduelle, les échecs chutant de 22 à 11 cas, avec une victoire sur 13 des 15 conditions où les deux méthodes divergent. L'écart marqué entre les résultats en simulation (98,5%) et ceux obtenus en conditions réelles (63,3%) illustre concrètement le fossé sim-to-real qui reste un obstacle pour la manipulation robotique en contact riche, au-delà des tâches de navigation ou de préhension simple déjà largement maîtrisées. Pour les intégrateurs et décideurs en logistique, entrepôts ou service, ce résultat confirme qu'une architecture hybride, combinant contrôle géométrique fiable pour la structure globale de la tâche et correction apprise concentrée sur les phases sensibles au contact, surpasse nettement le contrôle purement scripté, tout en restant plus économe en données que des politiques bout-en-bout entraînées sur de vastes corpus de démonstrations. Les tests de robustesse, avec des performances maintenues au-dessus de 87% sous des perturbations d'initialisation jusqu'à 1,5 fois la normale, nuancent toutefois les promesses de généralisation totale par apprentissage pur: sur des espaces très serrés, la limite géométrique de la correction locale réapparaît. Ce travail s'inscrit dans la lignée des architectures hybrides associant contrôle classique et apprentissage résiduel, une alternative aux politiques vision-langage-action entraînées de bout en bout comme Pi-0, GR00T N2 ou Helix, qui cherchent à remplacer entièrement les contrôleurs structurés par des réseaux appris. En ne déléguant à l'apprentissage que la phase de contact la plus délicate, insertion et relâchement, tout en conservant la structure géométrique du reste de la tâche, les auteurs proposent une voie intermédiaire de fiabilisation pour des manipulateurs comme le xArm7 d'UFactory. L'étude, de nature académique, ne mentionne ni partenaire industriel ni calendrier de déploiement commercial.

RecherchePaper
1 source
Adaptation des compétences avec prise en compte de la sécurité pour l'apprentissage par renforcement en environnements dynamiques
2arXiv cs.RO 

Adaptation des compétences avec prise en compte de la sécurité pour l'apprentissage par renforcement en environnements dynamiques

Une équipe de chercheurs présente Dist-GPRL, un framework d'apprentissage par renforcement guidé par la sécurité pour l'adaptation de compétences robotiques, dans une prépublication arXiv (2609.11433v1). Construit sur une paramétrisation de trajectoires par processus gaussiens (GP), le système adapte séquentiellement des fenêtres locales de points de passage plutôt que la trajectoire complète à chaque étape, la covariance du GP assurant des mises à jour cohérentes dans le temps et réduisant les difficultés d'attribution de crédit propres à l'adaptation globale. La sécurité combine un a priori de sous-espace faisable dérivé du planificateur Hausdorff Approximation Planner (HAP) et des récompenses fondées sur un champ de distance aux obstacles mis à jour dynamiquement, complétées par un régularisateur qui préserve les profils de vitesse et d'accélération démontrés. Testé sur deux tâches de manipulation d'objets dynamiques, d'abord en simulation puis transféré à l'exécution réelle sur robot, Dist-GPRL affiche un taux de réussite plus élevé, moins de collisions et un apprentissage plus stable que les méthodes de référence. L'enjeu dépasse la démonstration académique. La plupart des cadres RL d'adaptation de compétences imposent des observations fixes ou des schedules d'exploration rigides pour rester stables, ce qui les rend inadaptés dès qu'un environnement encombré ou des objets mobiles entrent en jeu, un scénario courant en manipulation industrielle. En intégrant la sécurité directement dans la boucle d'exploration plutôt qu'en garde-fou externe, ce travail s'attaque à un point de friction réel pour les intégrateurs qui veulent déployer des politiques apprises près d'obstacles ou d'opérateurs. Le transfert simulation vers réel réussi, même circonscrit à deux tâches, reste un indice utile mais ne vaut pas preuve de robustesse à grande échelle. La méthode s'inscrit dans la lignée des approches de paramétrisation de compétences par processus gaussiens, réputées compactes mais fragiles face aux changements d'environnement, défaut que Dist-GPRL cherche à corriger en s'appuyant sur le planificateur HAP pour la garantie géométrique de sécurité. Elle se distingue ainsi des architectures VLA de bout en bout type Pi-0 ou GR00T N2, en combinant planification classique et apprentissage par renforcement plutôt qu'un modèle unique bout à bout. La publication ne mentionne ni partenaire industriel, ni robot commercial, ni calendrier de déploiement: il s'agit à ce stade d'une contribution de recherche validée en simulation et sur un banc réel limité, sans pilote industriel annoncé.

RecherchePaper
1 source
Brachiation robuste sur un robot bibras taille humaine grâce à l'apprentissage par renforcement guidé par points de passage
3arXiv cs.RO 

Brachiation robuste sur un robot bibras taille humaine grâce à l'apprentissage par renforcement guidé par points de passage

Une prépublication arXiv (2608.17320), publiée mi-août 2026, décrit une méthode d'apprentissage par renforcement permettant à un robot bipède à deux bras de taille humaine de pratiquer la brachiation, le déplacement par les bras seuls comme chez les primates sur des barres suspendues. Baptisée Waypoint-Guided Reinforcement Learning (WGRL), la technique ne spécifie que quelques points de passage épars pour la trajectoire de l'effecteur terminal; le mouvement complet du corps est ensuite généré par renforcement, guidé par une récompense mêlant respect des points de passage, réussite de la tâche et efficacité énergétique. Conçu pour le transfert sim-to-real, l'entraînement a été validé par des essais sim-to-sim sur des parcours de barres à géométrie variable, puis par des tests sur le robot physique, confirmant une brachiation robuste avec récupération après échec de prise. Le résultat s'attaque à un verrou resté ouvert sur les plateformes grandeur nature: la coordination fine et le timing précis pour saisir et relâcher un appui, sans données de démonstration humaine disponibles, la tâche étant trop spécifique pour un jeu d'apprentissage par imitation. En s'appuyant sur de simples points de passage plutôt que sur des trajectoires complètes annotées, la méthode contourne ce manque de données, un frein courant à l'apprentissage par renforcement en robotique réelle. Pour les chercheurs en locomotion et les intégrateurs travaillant sur des humanoïdes, elle élargit les modes de déplacement envisageables au-delà de la marche bipède, qui concentre l'essentiel des efforts du secteur, vers des structures, échafaudages ou sites industriels sans appui continu au sol. La brachiation robotique est étudiée depuis plusieurs décennies, mais les démonstrations concluantes restaient jusqu'ici cantonnées à des simulateurs ou à des robots miniatures et légers, la coordination bras-corps se compliquant nettement à l'échelle humaine entre inertie et contraintes de couple. Ce travail prolonge un courant de recherche qui combine apprentissage par renforcement et transfert sim-to-real pour la locomotion dynamique, déjà exploité pour la marche et la course des humanoïdes bipèdes. L'article ne précise ni le laboratoire d'origine ni le nom commercial de la plateforme testée, et présente ses résultats comme des lignes directrices méthodologiques réutilisables plutôt que comme un produit finalisé, sans calendrier de déploiement ni partenariat industriel annoncé.

RecherchePaper
1 source
Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond
4arXiv cs.RO 

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.25031) une nouvelle méthode de suivi humain-robot fondée sur l'apprentissage par renforcement profond (DRL), qui rompt avec les approches classiques imposant une position fixe au robot par rapport à la personne accompagnée, derrière, devant ou à ses côtés. Le système modélise un "espace d'interaction" liant humain, robot et environnement, utilisé comme espace d'état pour l'agent DRL, et s'appuie sur un contrôleur combinant Model Predictive Path Integral (MPPI) et Control Barrier Functions (CBF) pour suivre précisément la position et l'orientation de la cible tout en évitant les obstacles. Testé en conditions réelles, en intérieur comme en extérieur, et comparé à des méthodes existantes, le robot accompagne une personne marchant jusqu'à 1,7 m/s en ajustant dynamiquement sa stratégie de positionnement, avec un taux de réussite amélioré d'au moins 24% et une précision de suivi améliorée d'au moins 47%, tout en respectant l'espace intime de la personne pour garantir sécurité et confort. L'intérêt dépasse la démonstration technique: la plupart des robots d'accompagnement actuels, en logistique, en assistance ou en robotique de service, reposent sur des règles de positionnement figées, peu robustes face aux changements de vitesse, aux couloirs étroits ou à la densité de foule. Un positionnement adaptatif piloté par apprentissage, capable de basculer entre suivi latéral, frontal ou arrière selon le contexte, répond à une limite connue de la navigation sociale robotique, le compromis entre sécurité, fluidité de déplacement et acceptabilité sociale. Pour les intégrateurs travaillant sur des robots mobiles autonomes (AMR) destinés à l'accompagnement de personnes en environnement industriel ou de santé, cette approche laisse entrevoir des systèmes moins rigides et potentiellement plus sûrs en cohabitation avec des humains. Le travail s'inscrit dans un courant de recherche en interaction humain-robot (HRI) qui cherche à dépasser les schémas de suivi rigides documentés dans la littérature existante, et les auteurs comparent directement leurs résultats à ceux d'études antérieures. Comme souvent pour ce type de publication académique, les métriques de réussite et de confort restent définies et mesurées par les auteurs eux-mêmes sur un nombre limité de scénarios, ce qui appelle une validation indépendante avant toute généralisation. Aucune affiliation industrielle ni calendrier de transfert commercial n'est mentionné: il s'agit à ce stade d'une contribution de recherche, sans pilote ni déploiement annoncé, dont la suite logique serait une extension à des scénarios multi-personnes et une validation sur d'autres plateformes robotiques.

RecherchePaper
1 source