Aller au contenu principal
RecherchearXiv cs.RO 

TacRefineNet : affinage de la préhension tactile guidé par objectif pour objets à arêtes saillantes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente TacRefineNet, un système d'affinage tactile de prise pour objets à géométrie fine comme les plaques, disques et tiges, dont les contacts épars sont difficiles à capter par la vision en profondeur. Le framework utilise un réseau siamois entraîné à comparer les images tactiles multi-doigts actuelles et cibles, ainsi que les configurations articulaires de la main, pour prédire directement des corrections incrémentales de la pose du poignet. La main ouvre, déplace et resaisit l'objet de façon itérative, formant une boucle de servocontrôle tactile à dextérité externe. Les chercheurs ont collecté 156 007 échantillons simulés à partir de 15 objets (plaques, disques, tiges) et entraîné la politique entièrement dans MuJoCo avant un déploiement zero-shot sur une main à cinq doigts et 11 degrés de liberté équipée de capteurs piézorésistifs. Sur des objets déjà vus, le système réel atteint un taux de réussite de 80,7% pour les cibles fixes et 59,3% pour les cibles aléatoires selon le critère de 10 degrés et 10 mm, avec des erreurs moyennes d'environ 5,2 mm et 3,5 degrés après cinq étapes de correction.

Ce résultat s'attaque à un angle mort précis de la manipulation robotique: les objets fins et symétriques restent un point faible pour les capteurs de profondeur classiques, car leurs surfaces de contact sont trop réduites ou occultées pour une estimation de pose fiable par vision seule. En démontrant qu'un asservissement purement tactile peut corriger l'alignement final avec une précision millimétrique, l'étude conforte l'idée que la fusion vision-tactile, plutôt que la vision seule, sera nécessaire pour les tâches d'assemblage fin en usine ou en logistique. Le transfert zero-shot simulation-vers-réel, sans réentraînement sur le système physique, est aussi un signal encourageant pour réduire le coût de déploiement de ce type de politique sur du nouveau matériel.

Le travail s'inscrit dans la lignée des approches de manipulation dextre pilotées par retour tactile, un domaine où la rareté des données réelles pousse les équipes à s'appuyer sur la simulation pour l'entraînement. Les auteurs reconnaissent des limites: le transfert reste restreint à des objets non vus mais proches en catégorie, et la performance chute nettement pour les objets symétriques ou aux contacts peu discriminants, un écueil classique pour toute méthode fondée sur la comparaison d'images de contact. Le système montre en revanche une capacité de correction continue face à des perturbations prolongées, ce qui ouvre la voie à des essais sur des tâches d'assemblage réel où la précision fine de prise est critique, sans qu'aucun calendrier de déploiement industriel ne soit pour l'instant annoncé.

Dans nos dossiers

À lire aussi

TouchDrive : interface tactile sans électronique pour l'aide à la préhension
1arXiv cs.RO 

TouchDrive : interface tactile sans électronique pour l'aide à la préhension

Des chercheurs ont publié sur arXiv (réf. 2605.06432) TouchDrive, une interface de retour tactile entièrement passive destinée à la préhension robotique assistive. Le système repose sur un clapet pneumatique normalement fermé, un réservoir d'air comprimé, un élément de captation mécanique et un actionneur haptique, sans aucun composant électronique. Le principe est direct : les forces de contact générées lors de la saisie sont converties en pression pneumatique qui actionne le retour haptique vers l'opérateur dans une boucle mécanique unique, sans microcontrôleur, sans firmware, sans couche logicielle intermédiaire. Le système a été validé sur plusieurs plateformes robotiques et testé sur un panel de 20 objets représentatifs, dont des fruits et des articles du quotidien, couvrant à la fois des objets compliants et des objets fragiles. L'intérêt industriel et médical de TouchDrive tient à sa rupture architecturale : là où les interfaces tactiles concurrentes empilent capteurs à résistance variable ou piézoélectriques, unités de traitement embarquées et buses d'actuation pilotées par microcontrôleur, TouchDrive condense sensing, génération de signal et retour haptique dans un seul circuit pneumatique passif. Cette compression de la chaîne de traitement réduit directement le coût de fabrication, la surface de défaillance et les contraintes réglementaires liées aux dispositifs électroniques en milieu médical. Pour un COO qui intègre des bras robotiques dans des environnements sensibles ou à budget contraint, l'absence d'électronique signifie aussi une maintenance simplifiée et une certification potentiellement plus rapide. La capacité à moduler la force de préhension en temps réel via retour tactile est ce qui permet la manipulation précise d'objets déformables, un problème non résolu par les systèmes de contrôle en position pure. Le champ de la manipulation assistive est actuellement dominé par des capteurs tactiles électroniques comme GelSight (MIT), DIGIT (Meta AI) ou les solutions embarquées de Touchlab et Contactile, tous dépendants de GPU ou de microcontrôleurs pour le traitement. TouchDrive se positionne explicitement à contre-courant, en ciblant l'accessibilité et la robustesse plutôt que la densité d'information. Il s'agit pour l'heure d'un prototype de laboratoire publié sous forme de preprint, sans partenaire industriel ni calendrier de commercialisation annoncé. La prochaine étape logique serait une validation sur des tâches à contraintes de force plus strictes et un test en conditions d'usage réelles avec des utilisateurs en situation de handicap moteur.

RecherchePaper
1 source
GUIDE : compréhension directionnelle initialisée par l'objectif pour la navigation visuelle de bout en bout
2arXiv cs.RO 

GUIDE : compréhension directionnelle initialisée par l'objectif pour la navigation visuelle de bout en bout

Des chercheurs ont publié sur arXiv (référence 2606.10832, juin 2026) un framework d'apprentissage par renforcement baptisé GUIDE (Goal-Initialized Directional Understanding for End-to-End), conçu pour la navigation visuelle autonome de robots à pattes. Le principe fondamental est simple : contrairement aux systèmes existants qui alimentent le robot en mises à jour continues de sa cible depuis des modules d'estimation d'état hiérarchiques, GUIDE ne fournit la cible qu'une seule fois, au début de l'épisode. Le robot doit ensuite naviguer en s'appuyant exclusivement sur sa mémoire spatiale interne. Deux composants structurent le système : un prédicteur d'ancre spatiale qui exploite l'historique proprioceptif multi-fréquences pour construire des représentations d'egomouvement, et un flux de profondeur brut pour percevoir la géométrie locale. Les expériences ont été conduites sur un robot quadrupède, en simulation et en environnement réel, dans des scènes encombrées et des labyrinthes structurés, sans carte préalable. L'enjeu pour les intégrateurs est direct : supprimer la dépendance aux modules d'estimation d'état externes simplifie le stack de déploiement et réduit les points de défaillance. Les architectures hiérarchiques actuelles (localisation + cartographie + planification) sont coûteuses à calibrer et fragiles dans des environnements non cartographiés. GUIDE démontre qu'un robot peut maintenir une conscience directionnelle persistante grâce à la mémoire proprioceptive, sans SLAM ni GPS, un résultat qui renforce l'hypothèse que la proprioception peut partiellement suppléer la localisation explicite. La politique étant déployée de bout en bout sans modules séparés à l'inférence, la complexité opérationnelle en production s'en trouve réduite -- un argument concret pour les équipes industrielles. La navigation sans carte pour robots à pattes est un sujet actif : les travaux sur ANYmal (ETH Zurich), les politiques locomotrices de Unitree ou les recherches de CMU s'appuient encore majoritairement sur des représentations géométriques explicites. GUIDE s'inscrit dans la tendance "fully end-to-end" qui cherche à éliminer ces modules intermédiaires, tendance visible également dans les VLA (Vision-Language-Action models) appliqués à la manipulation. Il faut néanmoins rappeler qu'il s'agit d'une publication académique, sans pilote industriel ni déploiement commercial annoncé. Les suites naturelles incluent des tests dans des environnements non structurés à grande échelle et l'intégration avec des modèles de fondation visuels pour la spécification dynamique de la cible.

RecherchePaper
1 source
Reconstruction de maillage indépendante de la topologie d'objets déformables à partir de contacts tactiles épars
3arXiv cs.RO 

Reconstruction de maillage indépendante de la topologie d'objets déformables à partir de contacts tactiles épars

Des chercheurs proposent un unique modèle capable de reconstruire le maillage complet d'un objet déformable à partir de quelques points de contact seulement, sans aucune vision. L'architecture repose sur un mécanisme d'attention croisée invariant par permutation, ce qui lui permet de traiter indifféremment une corde en une dimension, un tissu en deux dimensions ou un corps mou volumétrique en trois dimensions avec le même estimateur, sans connaître à l'avance la topologie de l'objet. Sur les tests menés, ce modèle appris réduit l'erreur de reconstruction d'environ deux tiers par rapport à deux références classiques non apprises : une complétion géométrique de maillage et une méthode par processus gaussien. Il surpasse également un encodeur ensembliste plus simple à agrégation globale, l'écart se creusant à mesure que le nombre de contacts augmente. Les auteurs montrent en complément qu'une estimation d'incertitude par ensemble de réseaux (deep ensemble) permet de décider où toucher ensuite, ce qui réduit encore l'erreur et bat à la fois le toucher aléatoire et une stratégie active basée sur un processus gaussien, notamment à faible budget de contacts. Ce travail cible un angle mort classique de la manipulation robotique : les situations où la caméra ne sert à rien, dans l'obscurité, à l'intérieur d'un sac opaque, derrière la main du robot ou en cas d'occlusion sévère. Un modèle unique capable de gérer plusieurs topologies d'objets déformables sans reconfiguration évite de devoir entraîner un estimateur dédié par type d'objet, un vrai frein pratique pour les intégrateurs travaillant sur la manipulation tactile ou le tri en aveugle. Le gain apporté par le choix intelligent du point de contact suivant reste modeste en moyenne, mais devient significatif justement dans les cas les plus difficiles, forte occlusion et queue de distribution d'erreur, ce qui est précisément le scénario où le tact seul est indispensable. Le papier note aussi un résultat qui relativise l'intérêt de l'exploration tactile active : dès que la vision redevient disponible, l'endroit où l'on touche importe peu, ce qui justifie de cantonner cette approche aux contextes réellement privés de vision plutôt que d'en faire une brique générale de perception. Publié sur arXiv (2607.13479), le travail se positionne comme une alternative aux approches spécifiques par type d'objet et aux baselines géométriques ou par processus gaussien couramment utilisées en reconstruction tactile, sans toutefois préciser de déploiement matériel ou d'intégration industrielle à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en simulation ou en banc d'essai contrôlé, avant toute validation à plus grande échelle.

RecherchePaper
1 source
Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile
4arXiv cs.RO 

Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile

Une équipe de recherche publie sur arXiv (réf. 2606.28899) YOTO, pour "You Only Touch Once", un système d'estimation de pose 6-DoF fondé exclusivement sur le toucher. Contrairement aux approches visuelles classiques, YOTO reconstruit la position et l'orientation complète d'un objet à partir d'une seule paire de contacts tactiles simultanés, sans nécessiter d'historique de manipulation. Chaque contact est modélisé comme un nuage de points 3D local, puis localisé sur la surface de l'objet par un réseau coarse-to-fine. Les deux contacts localisés, combinés aux poses calibrées des capteurs, alimentent un solveur SVD en forme fermée, conscient des normales de surface, qui restitue la pose 6-DoF en une seule passe. Le réseau est préentraîné sur des patches tactiles virtuels générés depuis le modèle 3D de l'objet, puis affiné avec un petit nombre de contacts réels, réduisant significativement les besoins en données terrain. Les expériences portent sur quatre objets aux géométries variées avec des capteurs GelSight, et incluent une évaluation comparative entre reconstructions issues de scans mobiles grand public et modèles CAO de référence. Ce travail s'attaque à un angle mort bien documenté de la manipulation robotique : les méthodes visuelles de pose estimation échouent systématiquement en cas d'occlusion, d'éclairage défavorable, ou face à des surfaces réfléchissantes et transparentes, conditions courantes en environnement industriel réel. L'approche à contact unique sans historique constitue un avantage pratique majeur, car elle élimine les séquences d'exploration multi-contacts et s'intègre dans des boucles de manipulation courtes. YOTO surpasse les baselines visuelles et géométriques testées dans les scénarios où la perception visuelle est dégradée. La compatibilité avec des scans mobiles plutôt que des modèles CAO précis abaisse la barrière d'intégration pour des objets non catalogués, un point non négligeable pour les intégrateurs industriels. L'estimation de pose par capteurs tactiles de type GelSight est un axe de recherche actif depuis les travaux pionniers du MIT et de l'entreprise éponyme GelSight Inc. Les méthodes antérieures nécessitaient généralement plusieurs contacts successifs ou un historique de manipulation pour converger ; YOTO rompt avec cette contrainte. Sur le plan compétitif, les pipelines visuels basés sur des modèles de fondation (MegaPose, FoundPose, benchmarks BOP) restent dominants en conditions nominales, mais leur robustesse aux surfaces dégradées est limitée, c'est précisément là que le toucher devient complémentaire. Le code, les modèles entraînés et le jeu de données GelSight seront publiés à l'acceptation de l'article. À ce stade, il s'agit d'un preprint arXiv sans déploiement annoncé ni partenaire industriel identifié.

RecherchePaper
1 source