Aller au contenu principal
CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts
RecherchearXiv cs.RO 

CoRMA : RMA contrastive pour la méta-adaptation aux tâches riches en contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié CoRMA (Contrastive Robotic Motor Adaptation), un framework de méta-adaptation pour robots manipulateurs confrontés à des tâches d'assemblage à contact intense, insertion de goupille (PegInsert), engrenage (GearMesh) et vissage d'écrou (NutThread). CoRMA étend RMA (Rapid Motor Adaptation), une architecture initialement développée pour la locomotion, en remplaçant l'adaptation brute aux paramètres simulateur par un contexte de contact sémantique compact en six dimensions. Ce vecteur 6D encode cinq états discrets du contact : déclenchement, engagement latéral, transition guidée, direction de force, et blocage par coincement (jamming). Un adaptateur Transformer causal déployable infère ce contexte en ligne à partir des historiques de force, de proprioception et d'actions, sans démonstrations humaines, sans entrées privilégiées ni mise à jour de gradient au déploiement. Les évaluations ont été conduites dans Isaac Lab / Isaac Sim 5.0 et validées sur un bras réel Marvin, en comparaison directe avec les baselines FORGE.

Le résultat central est que CoRMA maintient un taux de succès réel supérieur aux baselines FORGE sous bruit contrôlé sur la pose cible, alors que ces baselines obtiennent des scores élevés en simulation mais se dégradent significativement au passage sur hardware. Ce résultat adresse directement l'un des problèmes structurels de l'assemblage robotique industriel : le sim-to-real gap sur les tâches à contact fin, où les forces de contact ne se transfèrent pas fidèlement depuis le simulateur. L'inférence sémantique du contact comme interface d'adaptation réutilisable est une piste directement exploitable par les intégrateurs travaillant sur des familles de tâches d'assemblage proches, sans nécessiter de recalibration ou de données terrain supplémentaires.

RMA a originellement démontré sa valeur en locomotion quadrupède chez Berkeley et CMU ; l'extension aux manipulateurs en contact forcé est une direction suivie par plusieurs groupes, dont ceux travaillant sur des politiques de type VLA (Vision-Language-Action) ou sur l'apprentissage par imitation pour l'assemblage. La comparaison avec FORGE situe CoRMA dans un espace concurrent actif. Les auteurs reconnaissent que la généralisation à des tâches hors de la famille d'assemblage testée et la calibration Real2Sim restent des travaux futurs, ce qui limite pour l'instant la portabilité directe en production industrielle.

Dans nos dossiers

À lire aussi

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche
1arXiv cs.RO 

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche

Une équipe de chercheurs propose CoRAL (Contact-Rich Adaptive LLM-based control), un framework publié en preprint sur arXiv (2605.02600) en mai 2025, conçu pour résoudre l'une des limites persistantes des grands modèles de langage appliqués à la robotique : la manipulation en contact riche, c'est-à-dire les tâches nécessitant des interactions physiques précises et réactives. L'architecture repose sur un découplage strict entre raisonnement de haut niveau et exécution de bas niveau. Contrairement aux approches VLA (Vision-Language-Action) qui emploient le modèle comme contrôleur direct, CoRAL utilise le LLM comme concepteur de fonctions de coût pour un planificateur par échantillonnage (MPPI, Model Predictive Path Integral). Un VLM fournit des priors sémantiques sur les paramètres physiques de l'environnement - masse et friction - affinés en temps réel par identification de système en ligne, tandis qu'une mémoire par récupération permet de réutiliser des stratégies validées sur des tâches récurrentes. Sur des scénarios incluant le retournement d'objets contre des murs via des contacts extrinsèques, CoRAL affiche un taux de succès supérieur de plus de 50 % en moyenne aux baselines VLA testées, sur des tâches jamais vues en entraînement, aussi bien en simulation que sur hardware réel. L'intérêt principal pour les intégrateurs réside dans la résilience au gap sim-to-real : en adaptant dynamiquement sa représentation des paramètres physiques lors des premières interactions, le système corrige en vol ses erreurs stratégiques sans nécessiter de re-entraînement. La séparation raisonnement/exécution garantit en outre une stabilité temps réel, le LLM étant par nature trop lent pour s'insérer dans une boucle de contrôle réactif. C'est un argument concret contre les VLA pures, qui peinent précisément sur les tâches à fort contact car leurs politiques apprises ne s'adaptent pas aux incertitudes physiques non vues. Le gain de 50 % mérite cependant d'être pondéré : les baselines exactes et le périmètre précis des tâches de test ne sont pas détaillés dans le résumé, et ce travail reste un preprint non relu par les pairs. CoRAL s'inscrit dans un champ de recherche actif qui cherche à hybrider planification symbolique et modèles de fondation pour dépasser les limites des VLA comme Pi-0 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA. Ces modèles ont montré des capacités convaincantes sur des tâches de manipulation standards mais buttent sur les contacts complexes et les environnements non vus. Le planificateur MPPI est une méthode stochastique éprouvée en robotique, ce qui ancre CoRAL dans un socle technique solide plutôt que dans une approche purement émergente. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade - la prochaine étape naturelle serait une validation sur un spectre plus large de tâches industrielles, comme l'assemblage ou la manipulation d'objets déformables, pour mesurer la généralisation réelle de l'approche.

RecherchePaper
1 source
VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts
2arXiv cs.RO 

VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts

Des chercheurs du ROAM Lab présentent VibeCheck, un préhenseur de robot équipé de deux doigts piézoélectriques : l'un émet une vibration acoustique à travers l'objet saisi, l'autre la reçoit. Cette configuration de captation acoustique active permet d'extraire, en temps réel, des informations sur l'état de l'objet, ses propriétés matérielles, la position de saisie, la pose de structures internes, et la nature des contacts extrinsèques que l'objet entretient avec son environnement. Le système a été validé sur un bras UR5, en prenant le retour acoustique comme unique feedback sensoriel, sur la tâche d'insertion de goupille (peg insertion), un benchmark classique de manipulation dite contact-riche. Les travaux sont disponibles sur arXiv (2504.15535v2). L'intérêt principal de cette approche est d'offrir une modalité sensorielle tactile qui ne repose ni sur la vision (contrairement à GelSight ou DIGIT), ni sur un capteur force-couple classique, souvent coûteux et fragile. Le fait d'inférer le type de contact extrinsèque uniquement par signature acoustique, et d'en dériver une politique d'imitation learning robuste aux prédictions imparfaites du classificateur, suggère une voie sérieuse vers des manipulateurs capables de réagir à des contacts non planifiés sans percevoir explicitement la scène. La résilience de la politique à l'imperfection du signal est un point notable : elle a été entraînée sur un modèle de transition simulé calibré sur les performances réelles du capteur, ce qui réduit partiellement le sim-to-real gap habituel dans ce type de pipelines. L'acoustique active en robotique n'est pas nouvelle, des travaux comme SonicSense ou les approches vibrotactiles en exploration de matériaux existent depuis plusieurs années, mais son intégration dans un préhenseur commercialement plausible (doigts piézoélectriques standard) pour des tâches longue-durée reste rare. Côté concurrence, les capteurs vision-based (GelSight de MIT, DIGIT de Meta/CMU) dominent la recherche en tactile, tandis que des startups comme Touchlab ou Xela Robotics misent sur d'autres modalités. VibeCheck se distingue par sa capacité à fonctionner à travers l'objet, pas seulement à sa surface. Les prochaines étapes probables incluent l'extension à des géométries d'objets variées et l'intégration à des systèmes multi-modaux combinant acoustique et vision.

RecherchePaper
1 source
FA-RDP : une politique de diffusion réactive adaptative en fréquence pour la manipulation à contact riche
3arXiv cs.RO 

FA-RDP : une politique de diffusion réactive adaptative en fréquence pour la manipulation à contact riche

FA-RDP, une politique de diffusion réactive à fréquence adaptative pour la manipulation robotique riche en contacts, a été présentée dans un article arXiv (2607.28596v1). Le problème identifié par les auteurs est le suivant: avant le contact entre un effecteur et un objet, plusieurs trajectoires sont valables et il faut préserver cette diversité de modes d'action; après le contact, les contraintes géométriques et les limites de force réduisent l'espace des solutions et exigent une réaction rapide au retour de force. Les politiques de diffusion classiques utilisent une fréquence d'inférence et un nombre d'étapes fixes tout au long de l'épisode, ce qui impose un compromis: un échantillonnage basse fréquence à plusieurs étapes préserve mieux la multimodalité pré-contact mais réagit lentement à la force, tandis qu'un échantillonnage haute fréquence améliore la réactivité mais tend à effondrer les modes distincts. FA-RDP répond à ce compromis via un Transformer visuel-force multi-fréquence partagé qui prédit des blocs d'action à basse et haute fréquence, couplé à un indicateur de multimodalité appris qui bascule dynamiquement entre échantillonnage multi-étapes basse fréquence avant contact et échantillonnage à une étape haute fréquence quand l'ambiguïté diminue. Les auteurs ajoutent une distillation de cohérence de variété (Manifold Consistency Distillation, MCD), qui reparamètre le réseau de diffusion pour prédire les actions directement sur la variété d'action du robot tout en conservant la supervision résiduelle de type DDPM. Pour l'industrie robotique, cette approche s'attaque à un goulot d'étranglement concret des politiques par diffusion en manipulation fine: le compromis entre diversité des trajectoires et vitesse de réaction en temps réel, un frein connu pour les tâches d'assemblage, d'insertion ou de manipulation avec contact physique. Si les résultats se confirment à plus grande échelle, cela renforcerait la viabilité des politiques de diffusion pour des applications industrielles où la précision au contact (force, couple) est critique, un axe suivi de près par les intégrateurs travaillant sur l'automatisation fine et la robotique collaborative. Les expériences ont porté sur trois tâches de manipulation riche en contacts, où FA-RDP obtient le taux de réussite le plus élevé tout en conservant des trajectoires pré-contact diversifiées, comparé aux approches à fréquence fixe. Le travail s'inscrit dans la lignée des politiques de diffusion pour le contrôle robotique (dans la continuité de Diffusion Policy et d'approches VLA comme Pi-0 ou GR00T), un champ de recherche actif où la question de la fréquence d'inférence et de la réactivité reste ouverte. Le code et des vidéos de démonstration sont disponibles sur fa-rdp.github.io, mais aucune information sur un déploiement matériel réel ou une intégration industrielle n'est mentionnée à ce stade: il s'agit d'un résultat de recherche en simulation/laboratoire, pas d'un produit commercialisé.

RecherchePaper
1 source
SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts
4arXiv cs.RO 

SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts

Des chercheurs proposent SARI (Simulated Approach, Real Interaction), un cadre de co-entraînement simulation-réel « à phases séparées » destiné à adapter des modèles vision-langage-action (VLA) à des tâches de manipulation riches en contacts. Le principe : générer les trajectoires d'approche, en espace libre, dans un jumeau numérique photoréaliste, et ne collecter en conditions réelles que les phases de contact, sur un petit nombre de positions d'objets. Une seule politique est ensuite post-entraînée sur ces démonstrations segmentées par phase. Elle enchaîne approche simulée et interaction réelle grâce à un alignement de l'apparence visuelle et à une représentation d'action partagée, exprimée par rapport à la caméra. Elle n'utilise ni étiquettes de phase explicites ni commutateurs codés à la main. Testé sur cinq tâches de manipulation réelles, SARI réduit de 34,3 % le temps de collecte de données réelles et atteint 27,5 % de réussite sur des positions jamais vues, là où toutes les approches de référence sim-réel entraînées sur la tâche complète échouent totalement (0 %). Le travail est publié sur arXiv (2610.02804). Ces résultats comptent pour les équipes qui adaptent des VLA à des tâches d'assemblage ou d'insertion, où le coût des démonstrations téléopérées est le principal frein. L'intérêt tient à la répartition du travail : la diversité spatiale, gourmande en données mais tolérante aux écarts de simulation, est confiée à la synthèse. La physique du contact, sensible aux erreurs de modèle mais peu dépendante de la position de l'objet, reste réelle. Cela nuance l'idée d'un transfert sim-vers-réel de bout en bout et suggère qu'un découpage par phase est plus rentable. Il faut toutefois relativiser les chiffres. Un taux de 27,5 % sur positions inédites reste très loin d'un seuil industriel, et un gain de 34,3 % sur le temps de collecte est modeste. Les résultats portent sur cinq tâches, avec un échantillon et des conditions de laboratoire dont l'article ne détaille pas ici la variabilité. Le contraste avec les références à 0 % est parlant, mais il dépend du choix de ces références. L'article s'inscrit dans la série de travaux sur le co-entraînement sim-réel pour les politiques VLA, qui cherchent à réduire la dépendance aux démonstrations réelles, aujourd'hui l'un des principaux postes de coût du déploiement de modèles généralistes. Les approches concurrentes, qui mélangent simulation et réel sur la tâche entière, se heurtent à l'écart de réalité dès que le contact intervient, ce que SARI cherche à contourner. Il s'agit ici d'un résultat de recherche et non d'un produit ni d'un déploiement : aucun partenaire industriel, calendrier de pilote ni code disponible n'est mentionné dans le résumé. Les suites probables sont des validations sur davantage de tâches, de robots et de géométries d'objets, ainsi que des comparaisons avec les VLA généralistes actuels, afin de vérifier si le gain tient hors du cadre expérimental initial.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source