Aller au contenu principal
TaCauchy : un framework FEM extensible pour la simulation tactile basée sur la vision
RecherchearXiv cs.RO 

TaCauchy : un framework FEM extensible pour la simulation tactile basée sur la vision

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié TaCauchy, un cadre de simulation par éléments finis (FEM) conçu pour les capteurs tactiles à vision, intégré directement dans Isaac Sim, la plateforme de simulation GPU d'NVIDIA. Basé sur le solveur UIPC (Unified Incremental Potential Contact), TaCauchy calcule des tenseurs de contrainte de Cauchy à partir de lois constitutives hyperélastiques, puis projette ces contraintes sur les surfaces de contact pour obtenir les forces de traction et les distributions de pression. Il prend en charge trois capteurs courants, GelSight Mini, DIGIT et 9DTact, via une interface modulaire permettant une intégration rapide par simple configuration. Sur le plan des performances, le framework atteint 33,40 FPS en environnement unique et 555 FPS de débit agrégé sur 60 environnements parallèles, avec un overhead d'extraction des contraintes inférieur à 1 ms. La validation physique montre un SSIM supérieur à 0,93 sur une plage de forces allant de 1,26 N à 4,73 N.

L'enjeu principal est le fossé sim-to-real qui pénalise l'entraînement par renforcement des politiques de manipulation tactile. Les approches existantes recourent généralement à des estimations empiriques des champs de contraintes, ce qui introduit des biais difficiles à corriger une fois déployé sur robot réel. TaCauchy propose à la place une vérité terrain mécanique dérivée des premiers principes physiques, ce qui représente un changement de paradigme pour les ingénieurs qui cherchent à entraîner des politiques de préhension fine sans collecter massivement de données réelles. Le débit de 555 FPS en parallèle rend cette précision physique compatible avec les pipelines d'apprentissage par renforcement à grande échelle.

Les capteurs tactiles à vision de type GelSight ont émergé comme une alternative économique aux capteurs de force-couple classiques, mais leur simulation restait un goulot d'étranglement dans les environnements GPU-parallèles comme Isaac Lab ou Orbit. TaCauchy s'inscrit dans une dynamique plus large de "physiques différentiables" qui cherchent à remplacer les proxies heuristiques par des modèles rigoureux directement différenciables. Du côté concurrentiel, des travaux comme Taxim ou DigiTac ont proposé des approches optiques ou basées sur des réseaux de neurones pour la simulation GelSight, mais sans calcul de champ de contraintes FEM intégré à un environnement GPU. La prochaine étape probable pour TaCauchy sera l'intégration avec des politiques de type diffusion ou VLA (Vision-Language-Action) pour des tâches d'assemblage ou de manipulation déformable.

Dans nos dossiers

À lire aussi

FeudalNav : un framework simple pour la navigation visuelle
1arXiv cs.RO 

FeudalNav : un framework simple pour la navigation visuelle

Des chercheurs ont publié sur arXiv (référence 2602.06974) FeudalNav, un cadre hiérarchique de navigation visuelle pour robots mobiles qui ne requiert ni carte métrique, ni GPS, ni données odométriques en phase d'entraînement ou d'inférence. Le système décompose la prise de décision en plusieurs niveaux : un réseau de sélection de sous-objectifs (waypoints) léger et transférable choisit des points intermédiaires, tandis qu'un module de mémoire dans l'espace latent organise les observations visuelles passées par similarité visuelle, utilisée comme proxy de distance. Ce module de mémoire remplace les représentations topologiques classiques basées sur des graphes, sans dégradation notable des performances. Les résultats sont obtenus dans les environnements simulés Habitat AI, un benchmark standard du domaine, et montrent des scores compétitifs face aux méthodes état de l'art. Les auteurs explorent également une modalité d'navigation interactive : ils quantifient la quantité minimale d'intervention humaine nécessaire pour atteindre un taux de succès de 100% sur l'ensemble des trajectoires testées. L'intérêt de FeudalNav réside dans sa sobriété architecturale. Là où la plupart des navigateurs apprenants reposent sur des graphes topologiques coûteux à maintenir ou sur des représentations métriques qui échouent dans des environnements non cartographiés, FeudalNav prouve qu'une mémoire visuelle latente simple suffit pour guider un agent vers un objectif en terrain inconnu. Cette approche réduit les exigences d'infrastructure embarquée (pas de capteur odométrique requis) et améliore la transférabilité entre environnements, deux critères directement pertinents pour les intégrateurs de robots de service ou d'inspection industrielle. La composante interactive est notable : même une intervention humaine minimale et ponctuelle augmente significativement le taux de réussite global, ce qui ouvre la voie à des architectures human-in-the-loop adaptatives. FeudalNav s'inscrit dans un courant de recherche actif visant à dépasser les navigateurs métriques classiques (SLAM, cartographie 2D/3D) en faveur d'approches fondées sur l'apprentissage et la mémoire sémantique, directement inspirées de la cognition spatiale humaine. Le benchmark Habitat AI, développé par Meta AI Research, est devenu la référence pour évaluer ce type de systèmes en simulation. Les méthodes concurrentes incluent les approches à graphes topologiques (NoMaD, ViNT de Berkeley) et les navigateurs basés sur des Vision-Language Models (VLMaps, CoW). FeudalNav se distingue par sa légèreté et l'absence d'odométrie, mais reste pour l'instant cantonné à la simulation, sans validation sur robot physique annoncée dans cet article.

RecherchePaper
1 source
BayesContact : estimation incertaine de la pose via propositions visuo-tactiles et inférence basée sur la simulation
2arXiv cs.RO 

BayesContact : estimation incertaine de la pose via propositions visuo-tactiles et inférence basée sur la simulation

Des chercheurs présentent BayesContact, un système d'estimation de pose par inférence basée sur la simulation pour la manipulation robotique en contact, appliqué en priorité aux tâches d'insertion de type peg-in-hole (goujon dans trou). Le système maintient une croyance probabiliste sous forme d'un nuage de particules sur la pose de l'objet manipulé, et fusionne deux sources de données : les observations de profondeur issues du capteur visuel et les indices de contact dérivés des mesures de force/couple. Pour chaque hypothèse de pose testée, un moteur de rendu simule les mesures de profondeur attendues, tandis qu'un simulateur physique prédit les résultats de contact obtenus lors de mouvements de sondage prudents (guarded probing) ; les deux prédictions sont comparées aux observations réelles du robot pour affiner la croyance sur la pose. Cette croyance multimodale permet en outre de choisir activement, par gain d'information, la prochaine action de sondage la plus utile pour lever l'ambiguïté sur la pose estimée. Les auteurs ont testé BayesContact à la fois sur des géométries simulées et sur un robot réel, et rapportent une amélioration de 30% de l'observabilité de la pose et du taux de succès d'insertion par rapport à une inférence basée uniquement sur la vision. Pour l'assemblage industriel et les tâches d'insertion de précision, en particulier pour les intégrateurs robotiques travaillant sur des lignes d'assemblage automatisées, l'estimation de pose reste un goulot d'étranglement quand la seule profondeur ne suffit pas à distinguer des géométries proches ou partiellement occluses. Les approches existantes combinant vision et contact reposent généralement sur un entraînement hors ligne coûteux, qu'il faut recommencer à chaque nouvel environnement ou nouvelle géométrie de pièce, ce qui limite leur déploiement sur des lignes de production changeantes. En s'appuyant sur des modèles génératifs de simulation plutôt que sur un apprentissage supervisé figé, BayesContact promet une adaptation plus rapide à de nouvelles pièces sans réentraînement complet, un argument qui, s'il se confirme à plus grande échelle, intéresserait directement les fabricants de bras robotiques et les intégrateurs cherchant à réduire le temps de reconfiguration des cellules d'assemblage. Ce travail s'inscrit dans le champ de la manipulation robotique riche en contact, où la fusion vision-tactile est étudiée depuis plusieurs années comme alternative à la vision seule pour des tâches fines comme l'insertion de connecteurs ou l'assemblage de petites pièces. Contrairement aux méthodes d'apprentissage par renforcement ou aux réseaux entraînés hors ligne sur de larges jeux de données, l'inférence bayésienne basée sur la simulation cherche à s'affranchir du coût de réentraînement en s'appuyant directement sur des modèles physiques et de rendu, calibrés en ligne face aux observations réelles. Publié sur arXiv (2607.16123), ce travail reste à ce stade une contribution de recherche académique, validée sur un nombre limité de géométries et un seul robot réel ; les auteurs ne mentionnent ni partenariat industriel ni calendrier de transfert vers un produit commercial, et la généralisation à des tâches d'assemblage plus complexes que le peg-in-hole reste à démontrer.

RecherchePaper
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
3arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
TactileReflex : contrôle réflexe vision-tactile piloté par les statistiques du bruit pour la manipulation sensible à la force
4arXiv cs.RO 

TactileReflex : contrôle réflexe vision-tactile piloté par les statistiques du bruit pour la manipulation sensible à la force

TactileReflex est un contrôleur en boucle fermée à trois canaux pour la manipulation de contenants déformables fragiles, comme des gobelets plastiques remplis de liquide. Publié sur arXiv (2605.23568), il utilise deux capteurs visuo-tactiles pour extraire, à environ 12 Hz, trois métriques image : l'intensité de cisaillement (Sy), l'intensité de contact (Fn) et le centre de pression (C), pilotant en parallèle la suppression du glissement, le relâchement adaptatif au poids et la protection contre les surcharges de force. La calibration est entièrement automatique : les seuils de contrôle sont dérivés du bruit intrinsèque des capteurs via un court protocole de maintien statique et déchargement, sans modèles physiques spécifiques aux matériaux ni réglage manuel par essais-erreurs. Les résultats sont nets : en tests d'ablation sur déformation de contenant, le système complet atteint 5/5 succès contre au maximum 1/5 pour les configurations partielles ; sur une tâche de versement dynamique, les approches à effort fixe échouent 10 fois sur 10, contre 9/10 pour TactileReflex sur deux volumes d'eau distincts. La difficulté de saisir un gobelet plastique tient à une marge de force extrêmement étroite : trop peu de pression entraîne le glissement, trop la déforme irrémédiablement. C'est un angle mort récurrent des politiques VLA (vision-language-action) et de la téléopération sans retour haptique, qui opèrent à l'aveugle face aux variations de rigidité et de poids des objets manipulés. TactileReflex est présenté comme une couche de sécurité "plug-and-play" pouvant s'intercaler sous tout pipeline de manipulation haut niveau. L'absence de calibration externe et l'interprétabilité du contrôleur réduisent le coût d'intégration, un argument concret pour les intégrateurs déployant des bras robotiques polyvalents sur des lignes incluant des produits fragiles ou déformables. Les capteurs visuo-tactiles de type GelSight ou DIGIT permettent depuis plusieurs années d'imager le contact à l'échelle millimétrique, mais leur intégration dans des boucles de contrôle temps réel avec des seuils fiables reste un défi ouvert. Dans la course actuelle à la manipulation généraliste, Figure AI, Physical Intelligence (Pi-0) et Google DeepMind (RT-2) travaillent principalement avec des objets rigides aux marges de force confortables, laissant la manipulation déformable en marge des grandes démonstrations. L'article reste un preprint non évalué par les pairs, sans affiliation institutionnelle clairement identifiée ni partenaire industriel ni timeline de déploiement annoncés. Sa compatibilité revendiquée avec les pipelines VLA et la téléopération VR ouvre néanmoins une voie vers les frameworks de collecte de données robotiques, un terrain où des acteurs européens comme Enchanted Tools (France) sont actifs.

RecherchePaper
1 source