BiView-Touch : apprentissage de représentations tactiles bimanuelles par complétion croisée des mains
Des chercheurs présentent BiView-Touch dans un article arXiv (2609.23352v1, catégorie "cross"), publié en soumission anonyme pour relecture en double aveugle. Le cadre auto-supervisé reconstruit les latents masqués d'une main cible à partir des régions tactiles encore visibles de cette même main et de la main controlatérale synchronisée. Il repose sur un encodeur étudiant associé à un décodeur directionnel conditionné par la géométrie, qui prédit des cibles latentes complètes calculées par moyenne mobile exponentielle (EMA) sur un réseau enseignant. Des contrefactuels temporels et de disposition spatiale forcent le modèle à exploiter une information controlatérale réellement alignée dans le temps et organisée anatomiquement, et non un simple bénéfice de l'entrée bilatérale brute. Évalué sur le jeu de données public HumanTouch, BiView-Touch dépasse des méthodes auto-supervisées de référence en régime de faible annotation: avec seulement 5% des étiquettes disponibles pour l'entraînement en aval, les gains relatifs de précision équilibrée atteignent 7,1% pour la reconnaissance du mouvement bimanuel du poignet et 14,1% pour la reconnaissance de phase d'interaction dérivée des forces mesurées. Les auteurs publient aussi BVT-20, un nouveau jeu de données tactile bilatéral couvrant 20 tâches, et montrent un transfert des représentations entre sessions d'enregistrement et corpus de pré-entraînement, y compris vers une tâche bimanuelle totalement absente de l'entraînement.
L'intérêt pour la robotique tient au fait que la plupart des approches tactiles auto-supervisées traitent encore chaque main indépendamment, ou ne fusionnent les deux flux qu'au niveau de la prédiction finale, sans modéliser leur relation croisée. Montrer qu'une structure inter-mains explicite améliore la qualité des représentations, surtout avec très peu d'étiquettes, cible un vrai goulot d'étranglement: les données tactiles annotées avec vérité terrain force/contact restent coûteuses à produire. Le résultat intéresse directement les pipelines de téléopération, l'apprentissage par imitation pour la manipulation bimanuelle ou humanoïde, et les tâches d'assemblage sensibles à la force en industrie, où généraliser sans gros volumes annotés est un enjeu concret.
Le travail s'inscrit dans la lignée des méthodes de prédiction de latents masqués avec schéma enseignant-étudiant EMA (type data2vec/JEPA), jusqu'ici surtout appliquées à la vision ou à une seule main, en les adaptant spécifiquement au tactile bimanuel. L'article ne nomme aucun concurrent industriel ni laboratoire, conformément à sa soumission anonyme; le code et les détails du jeu de données sont déjà accessibles sur une page projet anonyme, une publication complète étant probable après l'issue du processus de relecture.
Dans nos dossiers




