Aller au contenu principal
Apprendre à exploiter la compliance : un cadre d'apprentissage de politique en admittance pour l'insertion robotique
RecherchearXiv cs.RO 

Apprendre à exploiter la compliance : un cadre d'apprentissage de politique en admittance pour l'insertion robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié le 28 septembre 2026 sur arXiv (référence 2609.31439v1) un nouveau cadre baptisé LeCo, pour "Leverage Compliance", destiné à l'assemblage robotique de précision par insertion de connecteurs. Le système combine une politique visuelle apprise par apprentissage automatique avec un contrôle en admittance à raideur fixe, et ajoute un mécanisme de rétroaction multi-fréquence qui agrège les mesures de contact haute fréquence en récompenses au niveau des transitions de la politique. Deux termes de coût inédits structurent l'apprentissage: un coût de conflit intégré, qui pénalise les situations où la politique continue de pousser pendant que le contrôleur relâche la pression sans progression réelle, et un coût de traînée directionnelle en force, qui sanctionne les épisodes de chargement prolongé au sein d'une même transition. Testé sur quatre tâches réelles d'assemblage de connecteurs avec un bras robotique physique, LeCo atteint un taux de réussite agrégé de 94%. Par rapport à une méthode de référence, les pics de force résultante chutent d'environ 30% et les pics de couple d'environ 64% sur les essais réussis, tandis qu'une étude d'ablation montre que le seul ajout du coût de conflit réduit de 53% la densité médiane de conflits en situation de contact.

L'enjeu dépasse la simple démonstration technique: l'assemblage par insertion (connecteurs électriques, câblage automobile, électronique) reste l'un des points faibles classiques des politiques visuo-motrices, car une politique entraînée à atteindre un objectif visuel peut continuer à pousser mécaniquement même quand un contrôleur conforme cède sous la résistance, générant des charges inutiles sans avancement. LeCo apporte une preuve empirique que ce défaut de coordination entre perception, décision et contrôle physique peut être corrigé par un signal de récompense dédié, plutôt que par un simple ajustement de la raideur mécanique. Pour les intégrateurs industriels visant l'automatisation de lignes d'assemblage fin (connectique, PCB, câblage), ce type de résultat réduit concrètement le risque de casse de pièces fragiles et améliore la fiabilité des cycles d'insertion, un enjeu direct de rentabilité en production.

Ce travail s'inscrit dans une littérature plus large sur la manipulation robotique en contact riche, où l'articulation entre contrôle hybride position/force et politiques apprises par imitation ou renforcement reste un problème ouvert, distinct des efforts actuels sur les modèles généralistes vision-langage-action (Pi-0, GR00T N2, Helix) qui visent une polyvalence de tâches plutôt qu'une précision d'insertion fine. Les auteurs ne précisent pas d'affiliation industrielle ni de calendrier de transfert vers une ligne de production; il s'agit à ce stade d'une contribution de recherche validée sur quatre tâches en laboratoire, sans annonce de déploiement commercial.

À lire aussi

PHASE : récupération de phase tactile pour un apprentissage d'insertion en peu d'exemples, avec compliance
1arXiv cs.RO 

PHASE : récupération de phase tactile pour un apprentissage d'insertion en peu d'exemples, avec compliance

Des chercheurs ont publié le 28 septembre 2026 sur arXiv (2609.30889) un article décrivant PHASE (Phase-Aware Segmentation and REtrieval), une méthode d'apprentissage par imitation augmentée par récupération de données, appliquée à l'insertion de type peg-in-hole, une tâche d'assemblage à contact riche. Le système exploite un poignet compliant qui maintient le contact tout au long du mouvement, générant des signaux tactiles et de force qui révèlent la structure en phases de l'insertion, de la recherche du trou jusqu'à l'insertion finale. PHASE combine un apprentissage de représentation multimodale sensible au contact, une segmentation en phases de longueur variable à partir des signaux tactiles, et une récupération de données cohérente avec la phase en cours pour entraîner la politique de contrôle. Les auteurs l'ont testé sur un robot réel avec cinq géométries de tige différentes, en le comparant à des stratégies de récupération issues de méthodes de référence sous une architecture de politique partagée. Résultat: un taux de réussite global supérieur de 13 points de pourcentage à la meilleure référence non sensible aux phases, et un gain de 30 points de pourcentage lorsque la position initiale de la pièce est inédite. L'insertion de précision reste l'un des goulots d'étranglement de l'automatisation flexible en assemblage électronique et mécanique: les tâches à contact riche exigent d'ordinaire des centaines de démonstrations pour généraliser, ce qui freine leur adoption par les intégrateurs souhaitant reconfigurer une cellule robotique pour un nouveau connecteur sans recollecter de données. En montrant qu'aligner la récupération de données antérieures sur les phases physiques de l'interaction, plutôt que sur des découpages temporels arbitraires, améliore fortement la robustesse en apprentissage à faible nombre de démonstrations, notamment face à des positions de départ jamais vues, PHASE apporte un argument concret au débat sur la capacité réelle des politiques apprises par imitation à généraliser au-delà de leurs démonstrations, un point sensible pour les approches génériques de type VLA appliquées à la manipulation fine. Il s'agit néanmoins d'un résultat de recherche évalué en laboratoire sur un nombre limité de géométries, pas d'un système déployé en usine ni d'un produit commercial. Le travail s'inscrit dans la lignée de l'apprentissage par imitation augmenté par récupération, une piste explorée récemment pour réduire le nombre de démonstrations nécessaires en réutilisant des données antérieures pertinentes, mais jusqu'ici peu testée sur des tâches à contact riche comme l'assemblage. Les auteurs comparent PHASE à plusieurs stratégies de récupération considérées comme état de l'art mais qui ignorent la structure en phases de l'interaction, afin d'isoler l'apport spécifique de leur segmentation tactile. L'article ne précise ni l'institution ni la plateforme robotique commerciale utilisée au-delà du poignet compliant, et ne mentionne aucun partenariat industriel ni pilote programmé: il se présente comme une contribution méthodologique destinée à la communauté de recherche en manipulation robotique, sans calendrier de transfert vers l'industrie annoncé à ce stade.

RecherchePaper
1 source
Apprentissage par admittance vision-force pour l'insertion de tige dans un trou mobile
2arXiv cs.RO 

Apprentissage par admittance vision-force pour l'insertion de tige dans un trou mobile

Des chercheurs présentent VFAL (Vision-Force Admittance Learning), un cadre robotique pour insérer une pièce (peg) dans un trou en mouvement, une tâche classique d'assemblage industriel rendue instable par un environnement dynamique, comme une base mobile ou une cible dont le déplacement n'est pas connu à l'avance. Le système fusionne un retour visuel asynchrone et basse fréquence avec un modèle d'admittance basé sur la force à haute fréquence, l'estimation de pose visuelle servant de terme de régularisation pour stabiliser l'ensemble. Pour l'estimation de pose, les auteurs s'appuient sur des modèles de fondation en vision de dernière génération plutôt que sur des marqueurs ou capteurs dédiés, et ajoutent des mécanismes de récupération après échec pour renforcer la robustesse. Le papier, publié sous la référence arXiv:2609.14133v1, rapporte des expériences réelles montrant un taux de réussite élevé et une bonne adaptabilité à différents types de pegs et de contextes dynamiques, tout en conservant une précision de l'ordre du millimètre, sans toutefois préciser de chiffres exacts de taux de succès, de temps de cycle ou de charge utile dans le résumé. L'insertion peg-in-hole est un test de référence en robotique de manipulation depuis des décennies car elle exige une précision millimétrique difficilement compatible avec l'incertitude d'un environnement mobile. Pour les intégrateurs industriels, notamment en assemblage automobile ou électronique où les pièces peuvent être portées par un convoyeur ou une plateforme mobile, une solution qui combine vision et force sans dépendre d'une cible fixe ouvre la voie à des lignes d'assemblage plus flexibles, sans immobiliser systématiquement la pièce à insérer. Le recours à des modèles de fondation en vision pour l'estimation de pose, plutôt qu'à des pipelines de vision sur mesure, illustre aussi une tendance plus large du secteur à réutiliser des modèles génériques pré-entraînés pour des sous-tâches de perception, réduisant l'ingénierie spécifique par cas d'usage. Ce travail s'inscrit dans une longue lignée de recherches académiques sur l'admittance control et l'apprentissage par renforcement pour la manipulation fine, un domaine où des laboratoires universitaires et industriels publient régulièrement sur arXiv avant toute commercialisation. Le document ne mentionne ni partenariat industriel, ni déploiement en usine, ni feuille de route de commercialisation : il s'agit d'une contribution de recherche validée par des expériences en laboratoire, à distinguer clairement d'un produit prêt à l'emploi. Les prochaines étapes attendues pour ce type de travaux sont généralement l'extension à d'autres géométries de pièces, l'intégration sur des bras robotiques commerciaux, puis d'éventuels essais pilotes avec des intégrateurs industriels, mais aucun calendrier n'est communiqué dans cette publication.

RecherchePaper
1 source
CANTABILE : un apprentissage de la dynamique expressive pour le piano robotique
3arXiv cs.RO 

CANTABILE : un apprentissage de la dynamique expressive pour le piano robotique

Un preprint publié le 17 septembre 2026 sur arXiv (2609.18213v1) présente CANTABILE, un framework qui ajoute la dimension expressive au jeu de piano robotique en simulation. Jusqu'ici, les systèmes évalués sur RoboPianist, le benchmark de référence pour la manipulation bimanuelle dextre, n'étaient jugés que sur la justesse des notes, à savoir quelle touche presser et à quel instant, sans tenir compte de l'intensité du toucher. CANTABILE conditionne sa politique sur des objectifs de vélocité à venir, convertit la vitesse angulaire de chaque touche au moment de l'impact en valeur MIDI, et combine une récompense de fidélité de vélocité à une récompense de couverture des notes jouées, pour empêcher le système de sauter les passages difficiles afin de préserver son score. Sur EXPRESSIVE-51, un sous-ensemble de 51 morceaux riches en nuances dynamiques, le score Velocity F1, qui mesure conjointement hauteur, timing et intensité avec une tolérance de plus ou moins 8 sur l'échelle MIDI, passe de 0,06 à 0,34 par rapport à la référence RoboPianist, avec une amélioration sur l'ensemble des 51 morceaux, une erreur de vélocité sur les notes correctement jouées divisée par plus de deux, et une distance log-mel à l'enregistrement de référence réduite de 8 %. Un raffinement additionnel, un résidu localisé aux doigts et pondéré par un coefficient alpha appliqué à une politique de base gelée, ainsi qu'un entraînement à intensité aléatoire, permet de régler l'intensité du jeu au moment de l'exécution sans réentraîner le modèle. L'intérêt dépasse la seule musique: il révèle un angle mort des benchmarks de dextérité robotique, où mesurer uniquement précision temporelle et hauteur des notes laisse de côté l'intensité du geste et peut inciter un système à éviter les passages difficiles pour préserver son score. En couplant explicitement fidélité de vélocité et couverture des notes, CANTABILE ferme cette faille et propose une méthode transposable à d'autres tâches de manipulation fine où la force ou la vitesse du contact compte autant que sa localisation, un enjeu direct pour les politiques de type VLA et les architectures de contrôle bimanuel visées par la robotique humanoïde et les bras dextres industriels. Il ne s'agit toutefois pas d'une démonstration sur robot physique: RoboPianist et EXPRESSIVE-51 restent des benchmarks en simulation, et un F1 qui passe de 0,06 à 0,34 mesure un progrès relatif sur une tâche difficile plutôt qu'une performance musicale aboutie. CANTABILE s'inscrit dans la continuité de RoboPianist, benchmark de simulation déjà établi pour évaluer la manipulation bimanuelle dextre de mains robotiques jouant du piano, jusqu'ici centré sur la seule justesse note par note. Le résumé ne mentionne ni acteur industriel, ni société commerciale associée, ni calendrier de portage sur matériel réel: il s'agit d'une contribution académique publiée en preprint. Elle s'ajoute à un ensemble de travaux cherchant à combler l'écart entre les démonstrations de dextérité en simulation et des critères d'évaluation plus complets, dans un contexte où la recherche en robotique pousse vers des politiques capables de généraliser des compétences motrices fines, du jeu d'instrument à la manipulation d'objets fragiles.

RecherchePaper
1 source
Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude
4arXiv cs.RO 

Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude

Une nouvelle version (v2) de l'article arXiv:2410.24035 propose un cadre de politique adaptatif au contexte pour la manipulation robotique, combinant robustesse et réactivité. Les auteurs s'appuient sur l'apprentissage par démonstration (Learning from Demonstration, LfD), et plus précisément sur les approches basées sur des systèmes dynamiques (DS), pour apprendre une politique conditionnée à la fois par l'état du robot et par des paramètres de tâche de basse dimension représentant le contexte environnant. Cette politique est ensuite combinée à des politiques additionnelles sensibles à l'incertitude via une formulation de type mélange d'experts (Mixture of Experts, MoE). Le système est validé sur le jeu de données de référence LASA handwriting, utilisé classiquement pour évaluer l'apprentissage de trajectoires, ainsi que sur un robot réel à 7 degrés de liberté (7-DoF), dans trois scénarios concrets : la saisie conditionnée par la force appliquée, la manipulation d'aliments déformables, et la saisie centrée sur l'objet. L'enjeu technique visé est précis : les approches DS de l'état de l'art excellent généralement en robustesse mais restent rigides face aux variations de contexte, car elles ne modulent pas leur comportement selon des variables dépendantes de la tâche. En articulant fusion de politiques et quantification d'incertitude, ce cadre cherche à améliorer le comportement hors distribution (out-of-distribution) et la convergence des trajectoires générées, deux propriétés critiques pour tout déploiement en environnement réel non contrôlé. Pour les intégrateurs robotiques, l'intérêt pratique tient surtout à la manipulation d'objets déformables, un cas d'usage encore mal résolu dans l'industrie (agroalimentaire, logistique), et à la promesse d'une politique réutilisable sans réentraînement complet à chaque changement de tâche ou d'environnement. Sur le plan du contexte scientifique, le LfD via systèmes dynamiques est un axe de recherche établi depuis plusieurs années pour produire des politiques de contrôle réactives en robotique. Ce travail se positionne comme une extension de recherches antérieures sur la fusion de politiques et l'estimation d'incertitude, plutôt que comme une rupture méthodologique. L'abstract ne mentionne ni laboratoire ni entreprise associée, et il s'agit d'une publication académique (statut « replace », donc une révision d'un article déjà soumis) sans indication de déploiement industriel à ce stade.

RecherchePaper
1 source