Apprentissage par renforcement guidé par contraintes pour le contrôle en impédance variable dans l'insertion robotique à contacts multiples
Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.13516) CG-RL (Constraint-Grounded Reinforcement Learning), un contrôleur d'impédance variable pour l'insertion robotique en contact incertain, où la limite de force axiale tolérée et le gain adapté varient selon la tâche et imposent normalement un retuning manuel des contrôleurs classiques. La politique reçoit en entrée la limite de force et le retour de contact, produit un mouvement résiduel, un taux d'insertion et un gain demandé, que le contrôleur projette ensuite dans une plage admissible sans exposer cette plage à la politique elle-même. Testée en simulation sur une tâche d'insertion oblique, sur cinq graines d'entraînement, CG-RL atteint un taux de réussite de 85,8 % ± 7,7 % sans violation de la limite de force, contre seulement 50,1 % pour une référence à gain fixe réglée au point médian de la plage.
Pour les intégrateurs travaillant sur l'assemblage à contact riche (connecteurs, pièces mécaniques), l'intérêt tient à la suppression du réglage manuel des gains d'impédance à chaque changement de tâche : une seule politique généralise à des limites de force inédites, y compris plus permissives que celles vues à l'entraînement, sans réentraînement. Privée de l'information sur la limite de force, la même politique ne montre pas cette adaptation continue, ce qui isole clairement l'apport du conditionnement par contrainte. Le gain reste garanti dans la plage admissible par construction du contrôleur, mais le respect effectif de la limite de force n'est validé qu'empiriquement, sans garantie formelle, une limite explicitement assumée par les auteurs. Le travail reste cantonné à la simulation, sans transfert démontré vers un robot physique : il s'agit d'une preuve de concept méthodologique, pas d'une solution prête pour l'usine.
Le contrôle d'impédance reste depuis des décennies la référence pour la manipulation en contact, mais son réglage à gain fixe exige une expertise humaine propre à chaque tâche ; l'apprentissage par renforcement appliqué à l'impédance variable cherche depuis plusieurs années à automatiser ce réglage. CG-RL s'en distingue par une séparation explicite entre la politique apprise et la contrainte de sécurité, cette dernière étant appliquée par projection côté contrôleur plutôt qu'apprise par le réseau, ce qui garantit formellement l'admissibilité du gain sans garantir la satisfaction de la contrainte de force. L'article, classé comme nouvelle soumission arXiv sans partenaire industriel cité, appelle logiquement une validation sur robot réel et une extension à d'autres géométries d'insertion que le cas oblique testé ici.
Dans nos dossiers




