Aller au contenu principal
Imp-ACT : contrôle d'impédance adaptatif et segmentation d'action par transformers pour la manipulation en contact
RecherchearXiv cs.RO 

Imp-ACT : contrôle d'impédance adaptatif et segmentation d'action par transformers pour la manipulation en contact

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Imp-ACT, une méthode de contrôle robotique pour la manipulation en contact riche, décrite dans une prépublication arXiv (2609.31225v1, non encore relue par les pairs). Le principe consiste à intégrer la modulation de rigidité cartésienne directement dans la phase de collecte de démonstrations par téléopération, plutôt que de fixer cette rigidité au niveau du contrôleur comme le font la plupart des politiques vision-action actuelles. Un contrôleur d'impédance auto-ajustable adapte la rigidité selon la direction instantanée du mouvement tout en conservant de la souplesse dans les directions orthogonales, sans sélection manuelle ni reconstruction de cible hors ligne. Cette rigidité adaptée est enregistrée en même temps que les observations visuelles, proprioceptives et de force, puis utilisée pour entraîner une architecture Action Chunking with Transformer (ACT) qui prédit conjointement la pose de l'effecteur, l'action du gripper et la rigidité directionnelle. Sur deux tâches test, essuyage de surface et insertion de fiche, Imp-ACT égale ou dépasse le taux de réussite de deux références à rigidité fixe (basse et haute), tout en réduisant les forces de contact : la vibration des forces de contact chute d'environ 29 fois par rapport à la référence souple et 180 fois par rapport à la référence rigide lors de l'essuyage, et les forces orthogonales à l'axe d'insertion baissent de 43% par rapport à la meilleure référence à rigidité fixe lors de l'insertion.

L'enjeu dépasse la simple démonstration académique : la plupart des politiques d'apprentissage par imitation actuelles séparent l'apprentissage du mouvement de la gestion de la compliance, laissant les intégrateurs choisir manuellement un compromis rigide/souple selon la tâche, un réglage coûteux et rarement optimal pour l'ensemble d'une opération de contact. En montrant qu'une politique unique peut apprendre à moduler sa rigidité en fonction de la direction, à partir de simples démonstrations téléopérées, Imp-ACT suggère une voie pour automatiser ce réglage dans des tâches industrielles sensibles comme l'assemblage, le câblage ou le nettoyage de surfaces, où un excès de rigidité génère des forces dommageables et un excès de souplesse compromet la précision.

Le travail s'appuie sur l'architecture ACT, déjà répandue dans l'apprentissage par imitation robotique, et se distingue des politiques généralistes de type VLA en se concentrant spécifiquement sur le sous-problème du contrôle de compliance plutôt que sur la généralisation multi-tâches. Il s'agit à ce stade d'une évaluation de laboratoire sur deux tâches ciblées, sans annonce de déploiement industriel ni de partenariat commercial.

À lire aussi

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche
1arXiv cs.RO 

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche

Une équipe de chercheurs propose CoRAL (Contact-Rich Adaptive LLM-based control), un framework publié en preprint sur arXiv (2605.02600) en mai 2025, conçu pour résoudre l'une des limites persistantes des grands modèles de langage appliqués à la robotique : la manipulation en contact riche, c'est-à-dire les tâches nécessitant des interactions physiques précises et réactives. L'architecture repose sur un découplage strict entre raisonnement de haut niveau et exécution de bas niveau. Contrairement aux approches VLA (Vision-Language-Action) qui emploient le modèle comme contrôleur direct, CoRAL utilise le LLM comme concepteur de fonctions de coût pour un planificateur par échantillonnage (MPPI, Model Predictive Path Integral). Un VLM fournit des priors sémantiques sur les paramètres physiques de l'environnement - masse et friction - affinés en temps réel par identification de système en ligne, tandis qu'une mémoire par récupération permet de réutiliser des stratégies validées sur des tâches récurrentes. Sur des scénarios incluant le retournement d'objets contre des murs via des contacts extrinsèques, CoRAL affiche un taux de succès supérieur de plus de 50 % en moyenne aux baselines VLA testées, sur des tâches jamais vues en entraînement, aussi bien en simulation que sur hardware réel. L'intérêt principal pour les intégrateurs réside dans la résilience au gap sim-to-real : en adaptant dynamiquement sa représentation des paramètres physiques lors des premières interactions, le système corrige en vol ses erreurs stratégiques sans nécessiter de re-entraînement. La séparation raisonnement/exécution garantit en outre une stabilité temps réel, le LLM étant par nature trop lent pour s'insérer dans une boucle de contrôle réactif. C'est un argument concret contre les VLA pures, qui peinent précisément sur les tâches à fort contact car leurs politiques apprises ne s'adaptent pas aux incertitudes physiques non vues. Le gain de 50 % mérite cependant d'être pondéré : les baselines exactes et le périmètre précis des tâches de test ne sont pas détaillés dans le résumé, et ce travail reste un preprint non relu par les pairs. CoRAL s'inscrit dans un champ de recherche actif qui cherche à hybrider planification symbolique et modèles de fondation pour dépasser les limites des VLA comme Pi-0 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA. Ces modèles ont montré des capacités convaincantes sur des tâches de manipulation standards mais buttent sur les contacts complexes et les environnements non vus. Le planificateur MPPI est une méthode stochastique éprouvée en robotique, ce qui ancre CoRAL dans un socle technique solide plutôt que dans une approche purement émergente. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade - la prochaine étape naturelle serait une validation sur un spectre plus large de tâches industrielles, comme l'assemblage ou la manipulation d'objets déformables, pour mesurer la généralisation réelle de l'approche.

RecherchePaper
1 source
PAC-ACT : post-entraînement acteur-critique pour transformeurs à segmentation d'actions
2arXiv cs.RO 

PAC-ACT : post-entraînement acteur-critique pour transformeurs à segmentation d'actions

Des chercheurs proposent PAC-ACT, un cadre d'apprentissage par renforcement pour affiner après coup les politiques ACT (Action Chunking Transformer) déjà entraînées, publié le 13 juillet 2026 sur arXiv (2607.09590). Ces politiques, courantes en manipulation industrielle de précision au contact, sont habituellement entraînées par clonage comportemental (behavior cloning) puis souffrent d'un décalage de distribution dès que la tâche implique des contacts physiques répétés, sous des contraintes de force et de perturbations de pose. PAC-ACT reformule l'optimisation au niveau du "chunk" (bloc d'actions), construit une architecture acteur-critique dérivée d'ACT, et introduit une contrainte hybride de préservation du comportement pré-entraîné pendant le fine-tuning en ligne. Sur un benchmark industriel de contact de précision baptisé Contour, la méthode réduit fortement la force de contact maximale et divise par 46 la proportion de mesures de force dépassant 60 newtons, tout en conservant une latence d'inférence et une consommation de mémoire GPU faibles. L'enjeu dépasse la simple performance académique: les modèles vision-langage-action (VLA) généralisent bien mais restent trop lourds et lents pour du contrôle industriel temps réel, alors que les politiques de type ACT sont rapides mais fragiles dès que le contact physique entre en jeu, un défaut connu qui limite leur usage en usine sur des tâches d'assemblage ou d'insertion nécessitant une gestion fine de la force. En démontrant qu'un post-entraînement par renforcement peut corriger ce défaut sans sacrifier la vitesse d'exécution, PAC-ACT apporte une réponse concrète à un point de friction connu entre robotique de recherche et déploiement industriel réel, là où beaucoup d'annonces se limitent à des démonstrations en environnement contrôlé. Le travail s'inscrit dans la lignée des politiques ACT, popularisées pour leur efficacité dans l'apprentissage par imitation sur tâches manipulatoires fines, et cherche à combler leur principal talon d'Achille face aux approches VLA plus généralistes mais coûteuses en ressources. L'ablation en récompense éparse montre par ailleurs que la contrainte de préservation comportementale favorise une exploration efficace même avec des poses initiales aléatoires, ouvrant la voie à une validation plus large sur d'autres tâches de contact industriel avant un éventuel déploiement en conditions réelles.

RecherchePaper
1 source
Clonage d'impédance : apprendre les paramètres du point d'équilibre pour la manipulation en contact riche
3arXiv cs.RO 

Clonage d'impédance : apprendre les paramètres du point d'équilibre pour la manipulation en contact riche

Une équipe de recherche présente, dans une prépublication arXiv (2609.30842v1), une méthode d'apprentissage par imitation nommée Impedance Cloning, testée sur deux bras CRANE-X7. Plutôt que reproduire des trajectoires comme le clonage comportemental classique, elle apprend les paramètres biomécaniques du mouvement, raideur et point d'équilibre, extraits par filtre particulaire de démonstrations en téléopération bilatérale, sans capteur de force/couple. En essuyage, la référence par trajectoire perd le contact sous -6 cm, tandis qu'Impedance Cloning maintient 4 à 5 newtons de force au-dessus de ce seuil, avec une baisse progressive en dessous ; en commande cartésienne, sa pente force-hauteur n'est que de 0,13 +/- 0,03 N/cm contre 0,34 à 0,83 N/cm pour les références à impédance fixe. En prise-dépose (dix tasses, 100 essais), elle réussit 84 fois contre 74 pour la référence à impédance fixe et 82 pour un contrôleur à impédance variable, ce dernier avec dix fois plus de démonstrations. Elle réduit aussi l'erreur de suivi de couple en préhension, avec les architectures ILBiT et Mamba. Le travail cible une faiblesse connue de l'apprentissage par imitation en manipulation de contact : les politiques entraînées sur des trajectoires précises s'effondrent dès que la géométrie réelle d'une surface s'écarte des conditions d'entraînement. En apprenant l'intention, raideur et équilibre, plutôt que le résultat observé, la méthode absorbe passivement l'incertitude de contact, un enjeu direct pour les intégrateurs travaillant sur l'essuyage, l'assemblage ou la préhension d'objets à géométrie variable, où les capteurs de force/couple restent coûteux ou absents. Réussir avec une seule démonstration là où un contrôleur à impédance variable en réclame dix réduit le coût de collecte de données, frein connu au déploiement à l'échelle. La méthode reprend le concept du point d'équilibre, issu de la biomécanique du mouvement humain, appliqué au contrôle par impédance, technique robotique ancienne rarement combinée à l'apprentissage par imitation à partir de démonstrations téléopérées. L'estimer par filtre particulaire, sans capteur de force/couple dédié, abaisse la barrière matérielle pour les équipes non équipées de capteurs spécialisés. Les essais, sur CRANE-X7 avec deux backbones, ILBiT et Mamba, visent à montrer la généralité de l'approche. Publiée comme simple prépublication, non encore relue par les pairs ni déployée industriellement, l'étude se positionne comme une alternative aux contrôleurs à impédance variable plutôt qu'un rival des politiques vision-langage-action comme Pi-0 ou GR00T N2.

RecherchePaper
1 source
BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain
4arXiv cs.RO 

BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain

Une équipe de recherche présente BEACON (Belief-Enabled Adaptive CONtrol), une méthode d'apprentissage par imitation pour la manipulation robotique en environnement partiellement observable, décrite dans un article publié sur arXiv le 22 septembre 2026 (arXiv:2609.22730v1). Le problème ciblé : quand une tâche de manipulation dépend d'un état caché qui ne peut être observé directement mais doit être inféré via des interactions physiques successives, conditionner une politique uniquement sur l'historique brut d'observations récentes produit de mauvaises performances, un phénomène appelé aliasing d'état, où des observations identiques correspondent à des états cachés différents et génèrent des étiquettes d'action contradictoires pour une même entrée. BEACON conditionne à la place une politique de diffusion sur une représentation structurée de croyance bayésienne, qui expose à la fois l'estimation la plus probable de l'état courant et l'incertitude résiduelle. La méthode est testée sur deux tâches aux représentations de croyance qualitativement différentes : une croyance continue pour l'alignement d'une pince sur une tige de maïs via détection tactile, et une distribution catégorielle discrète pour l'ouverture d'une porte verrouillée. Sur les deux tâches, la politique conditionnée par la croyance surpasse nettement la référence fondée uniquement sur l'observation et s'approche de la performance obtenue avec un accès privilégié à la vérité terrain sur l'état caché. Des ablations montrent que la politique module implicitement son comportement entre exploration et exploitation selon le niveau d'incertitude au moment de l'inférence, sans bascule de mode explicite ni ingénierie de récompense. Ce résultat cible une limite connue des politiques d'apprentissage par imitation conditionnées sur historique brut, y compris dans des architectures type vision-langage-action : leur difficulté à distinguer des états physiquement différents mais similaires en apparence ou au toucher, un problème fréquent en manipulation fine où le contact porte l'essentiel de l'information utile. Pour des intégrateurs travaillant sur la préhension délicate ou la manipulation d'objets à contrainte mécanique cachée (loquets, verrous, alignement d'outils agricoles), l'approche esquisse une voie pour réduire l'écart entre démonstrations contrôlées et robustesse en conditions réelles, sans dépendre uniquement de volumes massifs de données. BEACON s'inscrit dans la lignée des politiques de diffusion pour l'apprentissage par imitation, devenues une approche de référence en manipulation robotique ces dernières années, et s'attaque spécifiquement à leur angle mort en environnement partiellement observable. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche évalué en laboratoire sur des tâches ciblées, sans mise à l'échelle annoncée ni calendrier de transfert vers des plateformes commerciales.

RecherchePaper
1 source