Aller au contenu principal
TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension
RecherchearXiv cs.RO 

TacSE3 : estimation SE(3) équivariante sur images visuotactiles à faible texture pour suivi et compensation en préhension

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (identifiant 2605.17929) TacSE3, un pipeline d'estimation de mouvement tactile conçu pour le suivi d'objets en prise de robot. Le système prend en entrée des images visuotactiles à faible texture, les convertit en un champ de force tridimensionnel découplé, puis estime le mouvement rigide incrémental dans SE(3), c'est-à-dire le groupe euclidien spécial à six degrés de liberté combinant trois axes de translation et trois axes de rotation. L'architecture dérive la translation planaire depuis le déplacement du centroïde de contact, et estime la rotation principalement à partir des réponses tactiles de cisaillement (shear). Les expériences s'appuient sur une paire de capteurs visuotactiles DM-Tac montés en configuration bidigitale, sans autre précision sur le matériel robotique hôte ni sur les benchmarks comparatifs utilisés.

L'intérêt industriel réside dans deux propriétés rarement combinées : l'interprétabilité physique du signal et l'absence de ré-entraînement de la politique de base. En manipulation in-hand, l'occlusion visuelle fréquente prive les approches classiques de correspondances stables entre images, qu'il s'agisse de matching géométrique ou de flux optique. TacSE3 contourne ce problème en exploitant uniquement le retour tactile, lequel reste disponible même lorsque la caméra extéroceptive est aveugle. La configuration à deux capteurs réduit l'ambiguïté translation-rotation inhérente à un capteur unique et permet le suivi en rotation sur plusieurs axes et géométries d'objets. Le signal de compensation reste léger et s'intègre en surcouche d'une politique existante, ce qui simplifie l'industrialisation : pas besoin de reprendre l'apprentissage pour améliorer la tolérance aux perturbations.

La manipulation tactile en prise est un axe de recherche actif, porté notamment par les travaux autour des capteurs GelSight (MIT) et des approches vision-language-action (VLA) qui peinent encore sur la finesse des contacts. TacSE3 s'inscrit dans la tendance à enrichir ces pipelines avec un retour proprioceptif interprétable plutôt que de tout déléguer au visuel. Côté concurrence, des équipes comme celles derrière Digit (Meta/GelSight Technologies) ou Soft Robotics travaillent sur des capteurs tactiles embarqués, mais peu proposent une estimation SE(3) sans texture. La preprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement ; les résultats restent à confirmer hors laboratoire, en conditions d'encombrement et de bruit réels.

Dans nos dossiers

À lire aussi

Robot tenségrité : capteur visuotactile open source pour l'estimation du torseur de contact à 6 axes
1arXiv cs.RO 

Robot tenségrité : capteur visuotactile open source pour l'estimation du torseur de contact à 6 axes

Léo, une araignée-robot en tenségrité (structures de barres rigides tenues par des câbles élastiques) vient de recevoir une peau tactile open source capable de mesurer six axes de force et de couple à chaque point de contact. Décrit dans un article publié le 18 juillet sur arXiv, le capteur "endcap" combine une coque élastomère, une interface imprimée en 3D en polyuréthane thermoplastique (TPU) et une base rigide logeant une caméra miniature et un anneau de LED. La liaison entre l'élastomère et le TPU repose sur une nouvelle technique d'infill gyroïde qui évite tout adhésif, rendant l'ensemble léger et modulaire pour équiper de grandes structures de tenségrité. Un réseau de neurones convertit les champs vectoriels de cisaillement observés par la caméra en mesures de force et de couple sur six dimensions. Les tests affichent une erreur quadratique moyenne de 0,1531 en validation statique, avec une bonne généralisation hors domaine en mouvement dynamique, et l'intégration complète sur un robot de tenségrité de 12 kg confirme sa capacité à détecter fiablement les contacts au sol. Le code et les fichiers de fabrication sont publiés sur GitHub (Jonathan-Twz/tensegrity-gelfoot). L'intérêt dépasse le simple exercice académique: les robots en tenségrité, souples et résilients aux chocs, peinent depuis des années à obtenir une perception fiable de leur propre état, faute de capteurs adaptés à leur géométrie compliante et distribuée. Un capteur tactile bon marché, reproductible et physiquement interprétable ouvre la voie à une proprioception réellement embarquée, condition nécessaire pour que ces structures sortent du laboratoire vers des usages concrets comme l'exploration en terrain accidenté ou la manipulation douce. Les robots en tenségrité, popularisés notamment par les travaux de la NASA (le rover SUPERball) pour l'exploration planétaire à faible risque de casse, restent handicapés par l'absence de retour tactile natif comparé aux capteurs de type GelSight ou DIGIT conçus pour des mains robotiques classiques. Cette publication, en rendant le design entièrement open source, vise justement à combler ce manque et à standardiser l'instrumentation de ces plateformes encore largement expérimentales.

RecherchePaper
1 source
Modèles du monde visuotactiles compacts pour la préhension : prédiction, alignement de récompense et contraintes de force
2arXiv cs.RO 

Modèles du monde visuotactiles compacts pour la préhension : prédiction, alignement de récompense et contraintes de force

Une étude publiée sur arXiv le 10 septembre 2026 (référence 2609.09597) présente un modèle du monde visuotactile compact testé sur la tâche "Lift" du simulateur physique MuJoCo, sur 160 épisodes. Couplé à une calibration d'incertitude au niveau de la trajectoire et à un apprentissage acteur-critique par imagination, l'ajout d'un retour tactile fait chuter l'erreur de prédiction de force au point final de 1,058 à 0,228 newton, et l'erreur de pic sur intervalle de 2,724 à 0,523 N, moyennes sur trois graines d'entraînement; une variante à persistance tactile descend encore à 0,095 et 0,498 N. Sur 680 exécutions de contrôle réparties sur 40 conditions de test indépendantes, une révision de la fonction de récompense porte le taux de réussite du soulèvement à 10 cm de 20,0% à 93,3%, mais seulement 33,3% des essais respectent un budget de sécurité de 8 N par doigt sans retour de force, contre 70,0% avec retour de force actif. Sur des enregistrements publics de capteurs GelSight, un régresseur de force atteint 0,04234 N d'erreur, avec une couverture de calibration de 87,36% au niveau trajectoire contre seulement 15,80% image par image, pour une cible nominale de 90%. L'intérêt de l'étude tient à sa distinction rigoureuse entre trois progrès que les communiqués industriels ont tendance à confondre: mieux percevoir le contact, mieux réussir la tâche grâce à la récompense, et rester dans une contrainte de force sans risque pour l'objet manipulé. Le résultat central, un taux de succès qui grimpe de 20% à plus de 93% par simple ajustement de récompense mais qui retombe fortement sous contrainte de sécurité, rappelle aux intégrateurs et décideurs évaluant des politiques de préhension que des métriques de réussite affichées ne garantissent ni la sécurité de l'exécution ni un transfert vers un usage réel. C'est un signal utile à l'heure où les architectures vision-langage-action pour la manipulation fine suscitent un fort engouement commercial. Le travail prolonge la lignée des modèles du monde de type Dreamer, appliqués ici au toucher plutôt qu'à la seule vision, dans un secteur où des approches comme Pi-0 ou GR00T N2 misent surtout sur l'apprentissage par démonstrations à grande échelle plutôt que sur l'imagination interne. Il s'appuie sur des capteurs GelSight, déjà largement répandus dans les mains robotiques tactiles commerciales. Les auteurs reconnaissent eux-mêmes une limite centrale: aucun transfert n'a été démontré entre les enregistrements réels et l'exécution en simulateur, ce qui situe cette contribution du côté de la recherche amont plutôt que d'une brique prête à industrialiser, sans calendrier annoncé de validation sur robot physique.

RecherchePaper
1 source
VBT-MPC : commande prédictive tactile à base de vision pour le suivi de contour
3arXiv cs.RO 

VBT-MPC : commande prédictive tactile à base de vision pour le suivi de contour

Des chercheurs ont publié sur arXiv (2605.20392) un framework de contrôle prédictif baptisé VBT-MPC (Vision-Based Tactile Model Predictive Control), conçu pour le suivi de contours en manipulation robotique. Le système repose sur un capteur tactile à vision embarquée (VBTS, Vision-Based Tactile Sensor) monté en configuration eye-in-hand, c'est-à-dire fixé au poignet du robot de façon à co-localiser la perception et l'action. La contribution centrale est que le contrôleur MPC opère directement dans l'espace des descripteurs de contour extraits du capteur, sans passer par un module intermédiaire d'estimation de pose ni par une architecture de contrôle en effort dédiée. Les expériences couvrent des objets aux géométries et matériaux variés, évalués à la fois en simulation et en conditions réelles, avec comparaison systématique contre des stratégies de visual servoing adaptées aux features tactiles. Ce travail s'attaque à un verrou concret du suivi de surface industriel : maintenir un contact calibré tout en longeant un contour exige traditionnellement soit un estimateur de pose précis (coûteux en calcul et sensible aux erreurs de modèle), soit un contrôleur en force complexe. En faisant du MPC un contrôleur natif dans l'espace tactile, les auteurs réduisent la chaîne de traitement et potentiellement la latence de réaction. Pour un intégrateur ou un COO industriel, cela pointe vers des applications d'inspection de surface, de meulage ou d'assemblage de précision où la robustesse au glissement et aux irrégularités géométriques est critique. La comparaison avec le visual servoing tactile permet de quantifier le gain du MPC sur l'horizon de prédiction face à une loi de commande réactive pure, ce qui est une donnée utile pour le choix d'architecture. Les capteurs tactiles à vision (GelSight du MIT, DIGIT de Meta/CMU, Allsight, Soft-bubble) ont connu une forte montée en maturité depuis 2019, permettant d'extraire des champs de déformation et des features géométriques à haute résolution sans marqueurs. L'intégration du MPC à ce type de sensing prolonge des travaux antérieurs sur le contrôle en force/contact, mais substitue la mesure de force par une information visuelle riche et moins coûteuse en capteurs. Côté concurrence académique, des équipes comme CMU Robotics, Berkeley AUTOLAB et ETH Zurich RSL explorent des approches comparables (apprentissage par imitation tactile, diffusion policies avec retour haptique). La prochaine étape naturelle pour ce type de framework serait l'intégration dans des pipelines de manipulation généralistes ou des bancs d'inspection automatisée, potentiellement combinée avec des VLA (Vision-Language-Action models) pour la planification de haut niveau.

RecherchePaper
1 source
Compréhension des préférences utilisateur pour un filtre à admittance variable sensible à la pente d'un robot chien-guide
4arXiv cs.RO 

Compréhension des préférences utilisateur pour un filtre à admittance variable sensible à la pente d'un robot chien-guide

Un preprint arXiv publie le 15 septembre 2026 (arXiv:2609.15362) décrit un chien-guide robotique quadrupède pour personnes malvoyantes, équipe d'une poignée rigide sans capteur dédié. Le système combine suivi de trajectoire, estimation du couple d'interaction par la quantité de mouvement, et un filtre d'admittance dont la raideur et l'amortissement s'ajustent en temps réel selon la pente détectée par la camera de profondeur embarquée. Plusieurs stratégies d'adaptation ont été comparées par simulations haute fidélité puis lors d'une étude avec des participants voyants bandes, selon un plan d'expérience de Taguchi L9. Premiers résultats : augmenter la raideur en montée et la réduire en descente améliore les mesures objectives et subjectives, sans effet principal significatif de l'amortissement. Cette recherche s'inscrit dans un axe encore naissant de la robotique d'assistance, visant a compléter les chiens-guides dresses, dont la formation coute cher et dont l'offre reste très inférieure aux besoins mondiaux des personnes malvoyantes. L'absence de capteur de force dédié, l'interaction étant déduite de la dynamique même du robot, simplifie le matériel et pourrait en réduire le cout si l'approche est industrialisée. Pour les chercheurs en interaction physique homme-robot, l'apport principal est méthodologique : utiliser un plan de Taguchi pour régler objectivement des paramètres d'admittance habituellement fixes empiriquement, une méthode transposable a d'autres robots d'assistance a la mobilité. Le travail reste toutefois exploratoire : l'étude repose sur des participants voyants bandes plutôt que sur des personnes réellement malvoyantes, et aucun produit ni déploiement n'accompagne cette publication non encore validée par les pairs. Le concept de chien-guide robotique s'appuie sur la maturation des robots quadrupèdes commerciaux, dont la stabilité et la capacité tout-terrain ouvrent des usages d'assistance physique directe, au-delà de l'inspection industrielle qui a domine leurs premiers déploiements. D'autres équipes universitaires explorent des architectures comparables combinant navigation autonome et interfaces haptiques pour guider des personnes malvoyantes, sans qu'aucun acteur commercial français ou européen ne soit cite dans cette publication. Les auteurs qualifient eux-mêmes leurs résultats de préliminaires, ce qui laisse attendre des travaux futurs pour affiner la modélisation de l'amortissement et étendre l'étude a un public réellement malvoyant, sans date ni institution de suite précisées.

RecherchePaper
1 source