Aller au contenu principal
CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche
RecherchearXiv cs.RO 

CoRAL : contrôle adaptatif basé sur LLM pour la manipulation robotique en contact riche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose CoRAL (Contact-Rich Adaptive LLM-based control), un framework publié en preprint sur arXiv (2605.02600) en mai 2025, conçu pour résoudre l'une des limites persistantes des grands modèles de langage appliqués à la robotique : la manipulation en contact riche, c'est-à-dire les tâches nécessitant des interactions physiques précises et réactives. L'architecture repose sur un découplage strict entre raisonnement de haut niveau et exécution de bas niveau. Contrairement aux approches VLA (Vision-Language-Action) qui emploient le modèle comme contrôleur direct, CoRAL utilise le LLM comme concepteur de fonctions de coût pour un planificateur par échantillonnage (MPPI, Model Predictive Path Integral). Un VLM fournit des priors sémantiques sur les paramètres physiques de l'environnement - masse et friction - affinés en temps réel par identification de système en ligne, tandis qu'une mémoire par récupération permet de réutiliser des stratégies validées sur des tâches récurrentes. Sur des scénarios incluant le retournement d'objets contre des murs via des contacts extrinsèques, CoRAL affiche un taux de succès supérieur de plus de 50 % en moyenne aux baselines VLA testées, sur des tâches jamais vues en entraînement, aussi bien en simulation que sur hardware réel.

L'intérêt principal pour les intégrateurs réside dans la résilience au gap sim-to-real : en adaptant dynamiquement sa représentation des paramètres physiques lors des premières interactions, le système corrige en vol ses erreurs stratégiques sans nécessiter de re-entraînement. La séparation raisonnement/exécution garantit en outre une stabilité temps réel, le LLM étant par nature trop lent pour s'insérer dans une boucle de contrôle réactif. C'est un argument concret contre les VLA pures, qui peinent précisément sur les tâches à fort contact car leurs politiques apprises ne s'adaptent pas aux incertitudes physiques non vues. Le gain de 50 % mérite cependant d'être pondéré : les baselines exactes et le périmètre précis des tâches de test ne sont pas détaillés dans le résumé, et ce travail reste un preprint non relu par les pairs.

CoRAL s'inscrit dans un champ de recherche actif qui cherche à hybrider planification symbolique et modèles de fondation pour dépasser les limites des VLA comme Pi-0 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA. Ces modèles ont montré des capacités convaincantes sur des tâches de manipulation standards mais buttent sur les contacts complexes et les environnements non vus. Le planificateur MPPI est une méthode stochastique éprouvée en robotique, ce qui ancre CoRAL dans un socle technique solide plutôt que dans une approche purement émergente. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade - la prochaine étape naturelle serait une validation sur un spectre plus large de tâches industrielles, comme l'assemblage ou la manipulation d'objets déformables, pour mesurer la généralisation réelle de l'approche.

À lire aussi

Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique
1arXiv cs.RO 

Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique

Publié sur arXiv le 21 août 2026 (arXiv:2608.21592v1), l'article présente une méthode d'adaptation cinématique en ligne pour la manipulation robotique en contact riche, où la relation entre les articulations d'un robot et l'outil qu'il tient change à chaque prise, parfois presque instantanément lors des changements de mode de contact, notamment pour les mains multi-doigts dont les points de contact ne sont pas fixés à l'avance. Les auteurs dérivent une loi de mise à jour dont la stabilité est démontrée mathématiquement: elle identifie la cinématique d'un outil inconnu à partir des seules mesures articulaires et d'un capteur de force/couple monté au poignet, sans aucune mesure extéroceptive de la pointe de l'outil, aussi bien en rigide qu'avec un contrôleur de compliance en boucle interne. L'identification ne porte que sur les directions excitées par le mouvement: la longueur d'un outil reste inobservable lors d'une insertion rigide en ligne droite, mais devient partiellement observable via le relâchement passif d'une boucle compliante. Une formulation alternative en programme quadratique reproduit le terme de prédiction de cette loi mais échoue à reproduire son terme de suivi. La validation reste, pour l'instant, une simulation d'insertion cheville-trou. Ce travail cible un verrou concret pour l'industrie: la plupart des systèmes de manipulation supposent une cinématique outil-effecteur fixe et connue, ce qui impose de recalibrer le robot à chaque changement d'outil ou de préhenseur, un frein à la polyvalence recherchée par les intégrateurs et les concepteurs de mains robotiques multi-doigts. En rendant l'estimation purement proprioceptive, sans caméra ni capteur tactile dédié, l'approche réduit l'instrumentation nécessaire pour des tâches de prise pleine main où les points de contact varient à chaque saisie. Elle s'inscrit aussi dans un débat plus large de la recherche en robotique: découpler l'apprentissage de la politique de tâche, par exemple via apprentissage par renforcement, de l'adaptation aux spécificités physiques d'un robot, d'une main ou d'un outil donné, dans l'idée de faciliter le transfert de politiques apprises vers d'autres configurations matérielles sans réentraînement complet. Les auteurs présentent ce travail comme une première étape d'un programme de recherche plus large, et non comme une solution aboutie: aucune validation sur robot physique n'est rapportée, seulement une simulation simple d'insertion, ce qui laisse ouverte la question du passage à l'échelle sur des prises complexes et sur du matériel réel. Le résumé public n'identifie ni laboratoire ni entreprise, et aucun lien n'est établi avec des plateformes commerciales comme Figure ou Tesla Optimus, ni avec des modèles vision-langage-action tels que Pi-0 ou GR00T N2. La démarche s'inscrit dans la lignée des recherches sur la manipulation dextre adaptative et l'estimation en ligne de paramètres physiques, un axe exploré en parallèle par plusieurs laboratoires de robotique pour réduire la dépendance des politiques de manipulation à une calibration extéroceptive précise.

RecherchePaper
1 source
Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche
2arXiv cs.RO 

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche

Le capteur tactile reste le parent pauvre des politiques vision-langage-action (VLA) pour la manipulation robotique, alors que les phases de contact critiques (préhension, insertion, glissement) échappent souvent à la caméra. Une équipe de recherche propose dans un article publié sur arXiv (2607.14609) une méthode pour mieux exploiter le toucher: au lieu de prédire directement le signal tactile brut, souvent bruité, le système apprend à anticiper de futurs états tactiles à partir des représentations internes du modèle. Par une analyse en sonde linéaire (linear probe), les chercheurs montrent que ce sont les caractéristiques intermédiaires de l'expert en action, la partie du réseau qui traduit une décision en mouvement, qui prédisent le mieux l'état tactile futur, bien mieux que les couches de perception vision-langage ou que l'état d'action final. Sur cette base, ils introduisent le Latent Tactile Predictor (LTP), un module léger qui prédit des embeddings tactiles compacts à partir de cette couche intermédiaire plutôt que le signal tactile brut. Des expériences sur des tâches de manipulation réelles à fort contact confirment que cet alignement représentationnel surpasse les approches de prédiction tactile moins ciblées ou multi-interfaces. Cette contribution touche à un point sensible du secteur robotique: la plupart des politiques VLA actuelles (Pi-0, GR00T N2, Helix) reposent presque exclusivement sur la vision et le langage, avec un toucher traité comme un canal secondaire greffé après coup. Montrer qu'il existe un endroit précis, dans l'architecture, où la supervision tactile est réellement utile change la manière de concevoir ces modèles multimodaux: cela suggère que brancher un capteur tactile n'importe où dans le réseau, sans réflexion sur l'alignement des représentations, gaspille l'information. Pour les intégrateurs travaillant sur des tâches à contact fin, assemblage, insertion de connecteurs, manipulation d'objets déformables, c'est un signal que la robustesse ne viendra pas seulement de plus de données mais d'une meilleure architecture de fusion des modalités. Le travail s'inscrit dans la lignée des VLA tactiles apparus ces deux dernières années pour combler l'angle mort de la seule vision. L'article ne détaille pas de déploiement industriel ni de partenariat avec un fabricant de robots, il s'agit d'une contribution de recherche fondamentale destinée à orienter la conception des futures générations de politiques VLA plutôt qu'un produit prêt à l'emploi.

RechercheActu
1 source
Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
3arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source
Manipulation robotique riche en contacts dans la construction par apprentissage zero-shot : contrôle adaptatif guidé par politique de diffusion
4arXiv cs.RO 

Manipulation robotique riche en contacts dans la construction par apprentissage zero-shot : contrôle adaptatif guidé par politique de diffusion

Une équipe de chercheurs présente un nouveau framework combinant des politiques de diffusion (diffusion policies) entraînées sur des données de pose et de force/couple générées par simulation, couplées à un contrôleur adaptatif inspiré de la méthode L1 qui corrige en ligne les actions prédites par la politique pour compenser les dynamiques de contact non modélisées. Le système a été testé sur trois tâches d'assemblage robotique dans le bâtiment : l'assemblage de charpente bois (timber joinery), le raccordement de tuyauterie (pipe fitting), et l'assemblage séquentiel d'une ferme de toit (truss) à échelle réelle. Les résultats rapportés font état de 100% de réussite sur les tâches d'assemblage isolées et de 90 à 100% de réussite sur les sous-tâches de l'assemblage séquentiel de ferme, avec des forces de contact plus faibles et plus stables que les méthodes de référence. Le papier, publié sur arXiv (2608.22100v1) fin août 2026, revendique un transfert "zero-shot" de la simulation vers le réel, c'est-à-dire sans réentraînement ni collecte de données supplémentaires sur le robot physique. Cette avancée cible un problème central et jusqu'ici mal résolu de la robotique du BTP : l'assemblage riche en contacts, où les tolérances serrées, les imprécisions de fabrication et la dynamique incertaine des contacts rendent les approches classiques peu fiables. Si les chiffres se confirment au-delà du benchmark, la méthode réduirait fortement le coût et le temps de collecte de données réelles nécessaires à l'entraînement des politiques, un frein majeur au déploiement de robots autonomes sur chantier. Elle apporte aussi un indice supplémentaire que les politiques de diffusion, combinées à un contrôle adaptatif classique, peuvent généraliser à des tâches de manipulation physique fine sans long cycle d'essais réels, un argument qui intéresse directement les intégrateurs et décideurs cherchant à automatiser des tâches d'assemblage répétitives et physiquement pénibles. Le travail s'inscrit dans la lignée des recherches en apprentissage par imitation et en contrôle robuste appliquées à la construction, un secteur confronté à une pénurie de main-d'oeuvre et à des cadences de chantier difficiles à automatiser avec des approches purement scriptées. Il se positionne face à des méthodes de référence comparées directement dans ses benchmarks, sans toutefois nommer de plateforme robotique commerciale ni de site de déploiement industriel : il s'agit à ce stade d'une démonstration de recherche en laboratoire et en simulation, pas d'un produit livré ou déployé sur un chantier réel. Les auteurs annoncent vouloir étendre l'approche à un éventail plus large de tâches de manipulation riches en contacts dans la construction, ce qui laisse présager des travaux de suite plutôt qu'un calendrier de commercialisation.

UEAucun acteur ni déploiement européen n'est cite, mais la méthode vise un problème (pénurie de main-d'oeuvre, assemblage BTP) directement pertinent pour le secteur de la construction en France et en UE.

RecherchePaper
1 source