Aller au contenu principal
PneuTac : manipulation tactile avec des robots pneumatiques souples grâce à une simulation unifiée MPM et Gaussian Splatting
RecherchearXiv cs.RO 

PneuTac : manipulation tactile avec des robots pneumatiques souples grâce à une simulation unifiée MPM et Gaussian Splatting

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PneuTac est un cadre logiciel de recherche, présenté sur arXiv (v1, 2609.38418), qui vise l'apprentissage de la manipulation tactile avec des robots souples pneumatiques. Les auteurs modélisent la dynamique du robot souple et de la membrane déformable du capteur tactile avec la méthode des points matériels (MPM), puis rendent la scène en 3D Gaussian splatting (3DGS). Le calage réel-vers-simulation repose sur une méthode visuelle simple. Des réseaux d'action et de perception, entraînés comme modèles de substitution, accélèrent ensuite la simulation. Ce pipeline sert à collecter des démonstrations guidées par le toucher directement en simulation. Les tests portent sur un doigt souple pneumatique conçu sur mesure, équipé d'un embout tactile à base de vision, avec des évaluations complémentaires sur d'autres dispositifs. Selon les auteurs, les politiques entraînées avec des démonstrations augmentées par la simulation surpassent des références entraînées sur les mêmes données réelles, sur trois tâches de manipulation compliante riches en contacts. Le résumé ne donne ni chiffres de performance ni taux de réussite.

L'enjeu est de lever un goulot d'étranglement connu. Les robots souples offrent un contact sûr grâce à leur compliance, et les capteurs tactiles optiques fournissent une perception fine du toucher. Mais les simulateurs existants les traitent séparément et laissent des écarts de calibration importants et coûteux à corriger. Unifier dans un même moteur MPM la déformation du corps pneumatique et celle de la membrane tactile, avec un rendu 3DGS pour l'image, permet de générer des données synthétiques exploitables pour des politiques d'imitation. Pour les intégrateurs, l'intérêt est indirect mais réel : la manipulation d'objets fragiles (alimentaire, logistique, soin) dépend de mains compliantes, et leur programmation par démonstrations réelles reste lente. Il faut toutefois rester prudent. Il s'agit d'un preprint non évalué par les pairs, validé sur un seul doigt et trois tâches, sans chiffres publics dans le résumé, ce qui ne permet pas de conclure à un « sim-to-real résolu » à l'échelle d'une main complète.

Ce travail s'inscrit dans la convergence entre simulation différentiable de matériaux mous, capteurs de type GelSight et rendu neuronal. Il se place à côté des grandes lignes de recherche sur les modèles vision-langage-action (VLA), qui restent surtout alimentés par la vision et très peu par le tactile. Les prochaines étapes naturelles sont l'extension à des effecteurs multi-doigts, la publication du code et des jeux de données, et des comparaisons chiffrées avec les simulateurs rigides ou à éléments finis. Aucun partenaire industriel, pilote ni calendrier de déploiement n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Des robots souples mais efficaces grâce à une co-conception globale
1arXiv cs.RO 

Des robots souples mais efficaces grâce à une co-conception globale

Les robots souples promettent une sécurité intrinsèque grâce à la compliance de leurs matériaux, ce qui les rend adaptés aux interactions avec les humains ou à la manipulation d'objets fragiles. Dans une publication de perspective diffusée sur arXiv (version 2 de l'article 2505.03761), des chercheurs constatent que le domaine peine à concilier la performance sur une tâche donnée avec des critères plus larges comme la durabilité et la fabricabilité. Selon eux, cette difficulté est aggravée par les processus de conception séquentiels classiques, où la forme du corps est définie avant le contrôle, sans boucle de rétroaction entre les deux. Le texte passe en revue les approches de co-conception émergentes, qui optimisent simultanément le corps et le « cerveau » (le contrôleur) du robot, et qui permettent de découvrir des morphologies non conventionnelles, très adaptées à leur tâche. Il s'agit d'un article de synthèse et de positionnement, sans robot ni chiffre de performance nouveaux, et non d'un produit ou d'un déploiement. L'enjeu est méthodologique, mais il touche directement la question du passage du laboratoire à l'industrie. Les auteurs identifient trois freins à l'adoption de la co-conception : des objectifs d'optimisation trop étroits, un écart persistant entre performances simulées et réelles (le fameux sim-to-real gap, particulièrement marqué pour les matériaux déformables, difficiles à modéliser), et un coût de calcul élevé. Pour un intégrateur ou un décideur B2B, cela rappelle qu'un robot souple optimisé en simulation pour une seule métrique a peu de chances de tenir en production s'il ignore l'usure, la reproductibilité de fabrication ou la maintenance. Le cadre proposé déplace donc l'optimisation vers des critères de valeur plus larges, ce qui contredit l'idée que la seule performance de tâche suffit à valider une conception. Pour y répondre, les auteurs proposent un cadre de co-conception « holistique » reposant sur trois leviers : intégrer une gamme plus large de valeurs de conception, insérer du prototypage physique pour affiner les évaluations, et gagner en efficacité via des métriques de substitution (surrogate) et des stratégies de commande fondées sur des modèles. Leurs priorités de recherche portent sur les connaissances a priori de conception et les métriques, l'évaluation assistée par l'IA, l'équilibre entre raffinement computationnel et essais physiques, et l'arbitrage entre sécurité et performance. Aucun calendrier de pilote ni partenaire industriel n'est annoncé. Le texte s'inscrit dans une lignée de travaux sur l'évolution morphologique et l'optimisation conjointe forme-contrôle, dont il cherche à lever les limites pratiques avant tout transfert vers des applications commerciales.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
2arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source
SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion
3arXiv cs.RO 

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion

Des chercheurs présentent SplatSearch, une nouvelle architecture de navigation robotique permettant à un robot mobile de retrouver un objet ou une personne spécifique à partir d'une seule image de référence, prise sous un angle arbitraire. Le système s'appuie sur des reconstructions 3D par Gaussian Splatting (3DGS) construites à partir de vues éparses, une technique bien moins gourmande en données que les reconstructions denses classiques. SplatSearch génère plusieurs points de vue synthétiques autour des objets candidats grâce à cette carte 3DGS, puis utilise un modèle de diffusion multi-vues pour compléter les zones manquantes des images rendues, ce qui permet une mise en correspondance robuste avec l'image cible. Une politique d'exploration de frontières a également été développée : elle combine le contexte visuel des vues synthétisées et le contexte sémantique de l'image but pour hiérarchiser les zones à explorer en priorité. Les auteurs rapportent des performances supérieures aux méthodes de référence actuelles, mesurées en taux de réussite et en longueur de chemin jusqu'au succès, sur des environnements domestiques photoréalistes et des tests en conditions réelles. Une étude d'ablation confirme la pertinence des choix de conception retenus. Cette avancée s'attaque à un problème central pour la robotique de service et l'inspection industrielle : la capacité d'un robot à localiser une cible précise dans un environnement inconnu, sans dépendre d'un scan 3D exhaustif préalable. La navigation par instance d'image (Instance Image Goal Navigation) est particulièrement exigeante lorsque l'image de référence est prise sous un angle très différent de celui du robot au moment de la recherche, un scénario fréquent en usage réel mais souvent contourné dans les benchmarks. En misant sur des reconstructions éparses complétées par diffusion plutôt que sur des cartes 3D denses coûteuses à construire, l'approche pourrait réduire le temps de calibration nécessaire au déploiement de robots de recherche et de récupération d'objets, un enjeu concret pour les intégrateurs travaillant sur des AMR en environnement domestique ou logistique. Le travail s'inscrit dans la lignée des recherches combinant 3D Gaussian Splatting et navigation robotique, une technique de rendu apparue en 2023 et rapidement adoptée pour la cartographie temps réel en raison de sa rapidité par rapport aux champs de radiance neuronaux (NeRF). SplatSearch se positionne face aux méthodes état de l'art existantes en IIN, qu'il dépasse selon les métriques de taux de réussite et de longueur de chemin rapportées dans l'article, republié en version 2 sur arXiv. Le papier ne précise pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, validée par simulation et par des tests réels limités, sans indication d'un acteur français ou européen impliqué.

RecherchePaper
1 source
ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne
4arXiv cs.RO 

ReTouch : de la manipulation dextérique à contacts riches grâce à la prédiction tactile affinée en ligne

ReTouch est un modèle vision-langage-action (VLA) conçu pour la manipulation dextre en contact riche, présenté dans un article publié le 1er août 2026 sur arXiv (arXiv:2608.01824v1). Le système s'appuie sur deux innovations principales : un Tactile-Patch Encoder qui représente les signaux tactiles sous forme de patches structurés préservant l'identité de chaque doigt et la structure locale du contact, et un module d'action haute fréquence qui prédit conjointement les états tactiles futurs et des blocs d'actions, en les affinant en continu grâce au retour tactile pendant l'exécution. Les chercheurs ont aussi construit XHT-Dataset, un jeu de données de 900 démonstrations réelles couvrant sept tâches de manipulation en contact riche, collectées sur une plateforme combinant une main robotique XHand et un bras UR7e. Testé en boucle fermée sur robot réel, ReTouch dépasse la meilleure référence existante de 18,4 points de pourcentage en conditions standards et de 23,8 points en conditions difficiles, en taux de réussite moyen. Ce résultat s'attaque à un angle mort connu des VLA actuels : la plupart des modèles de manipulation s'appuient surtout sur la vision et peinent à intégrer le retour tactile de façon exploitable en temps réel, alors que la manipulation fine (insertion, préhension d'objets déformables, ajustement de prise) dépend justement de ce signal. En démontrant qu'un raffinement tactile en boucle fermée améliore nettement la robustesse face aux erreurs d'exécution et aux changements de contact, les auteurs apportent un argument concret en faveur de l'intégration tactile native dans les architectures VLA, plutôt que comme un module accessoire ajouté après coup. Pour les intégrateurs et équipes de R&D en robotique dextre, cela suggère une voie pour réduire l'écart persistant entre démonstrations en laboratoire et fiabilité en conditions réelles, un problème récurrent pour les mains robotiques multi-doigts. Le travail s'inscrit dans une lignée de recherche académique sur la fusion tactile pour la manipulation dextre, un domaine resté largement expérimental faute de jeux de données réels standardisés et de méthodes exploitant efficacement le signal tactile à haute fréquence. En publiant à la fois le modèle et XHT-Dataset, les auteurs positionnent ReTouch comme une base de comparaison pour de futurs travaux sur les mains robotiques dextres, sans toutefois annoncer de déploiement industriel ni de partenariat commercial à ce stade : il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, non d'un produit prêt à l'intégration.

RechercheActu
1 source