
Apprendre à exploiter la compliance : un cadre d'apprentissage de politique en admittance pour l'insertion robotique
Une équipe de chercheurs a publié le 28 septembre 2026 sur arXiv (référence 2609.31439v1) un nouveau cadre baptisé LeCo, pour "Leverage Compliance", destiné à l'assemblage robotique de précision par insertion de connecteurs. Le système combine une politique visuelle apprise par apprentissage automatique avec un contrôle en admittance à raideur fixe, et ajoute un mécanisme de rétroaction multi-fréquence qui agrège les mesures de contact haute fréquence en récompenses au niveau des transitions de la politique. Deux termes de coût inédits structurent l'apprentissage: un coût de conflit intégré, qui pénalise les situations où la politique continue de pousser pendant que le contrôleur relâche la pression sans progression réelle, et un coût de traînée directionnelle en force, qui sanctionne les épisodes de chargement prolongé au sein d'une même transition. Testé sur quatre tâches réelles d'assemblage de connecteurs avec un bras robotique physique, LeCo atteint un taux de réussite agrégé de 94%. Par rapport à une méthode de référence, les pics de force résultante chutent d'environ 30% et les pics de couple d'environ 64% sur les essais réussis, tandis qu'une étude d'ablation montre que le seul ajout du coût de conflit réduit de 53% la densité médiane de conflits en situation de contact.
L'enjeu dépasse la simple démonstration technique: l'assemblage par insertion (connecteurs électriques, câblage automobile, électronique) reste l'un des points faibles classiques des politiques visuo-motrices, car une politique entraînée à atteindre un objectif visuel peut continuer à pousser mécaniquement même quand un contrôleur conforme cède sous la résistance, générant des charges inutiles sans avancement. LeCo apporte une preuve empirique que ce défaut de coordination entre perception, décision et contrôle physique peut être corrigé par un signal de récompense dédié, plutôt que par un simple ajustement de la raideur mécanique. Pour les intégrateurs industriels visant l'automatisation de lignes d'assemblage fin (connectique, PCB, câblage), ce type de résultat réduit concrètement le risque de casse de pièces fragiles et améliore la fiabilité des cycles d'insertion, un enjeu direct de rentabilité en production.
Ce travail s'inscrit dans une littérature plus large sur la manipulation robotique en contact riche, où l'articulation entre contrôle hybride position/force et politiques apprises par imitation ou renforcement reste un problème ouvert, distinct des efforts actuels sur les modèles généralistes vision-langage-action (Pi-0, GR00T N2, Helix) qui visent une polyvalence de tâches plutôt qu'une précision d'insertion fine. Les auteurs ne précisent pas d'affiliation industrielle ni de calendrier de transfert vers une ligne de production; il s'agit à ce stade d'une contribution de recherche validée sur quatre tâches en laboratoire, sans annonce de déploiement commercial.
Dans nos dossiers




