Aller au contenu principal
RecherchearXiv cs.RO 

STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 12 septembre 2026 sur arXiv (2609.12549) STAR, un système d'apprentissage pour modèles vision-tactile-langage-action destinés à la manipulation dextre bimanuelle. L'équipe a construit une plateforme robotique et un dispositif de téléopération pour collecter 200 heures de données, soit 10 576 trajectoires réparties sur 65 tâches, dont 69,5 % impliquent une manipulation multi-doigts fine, chaque séquence étant annotée simultanément en vision, tactile et langage. STAR combine trois mécanismes pour compenser la rareté spatiale, temporelle et informationnelle des signaux tactiles : un pré-entraînement conjoint visuel-tactile, une représentation par jetons tactiles globaux épars, et une prédiction tactile future éparse. Après entraînement sur ce corpus, puis un post-entraînement léger de seulement 100 trajectoires par tâche, le modèle atteint un taux de réussite moyen de 61 % sur quatre tâches réelles.

Ce résultat s'attaque à un goulot d'étranglement connu des modèles vision-langage-action (VLA) : le signal tactile, clairsemé par nature, est souvent négligé au profit de la seule combinaison vision-langage, ce qui limite la finesse de manipulation. Démontrer qu'un post-entraînement de 100 démonstrations par tâche suffit à dépasser 60 % de réussite renforce l'idée qu'une intégration tactile native, plutôt qu'ajoutée après coup, améliore la généralisation des politiques robotiques. Pour les intégrateurs en robotique humanoïde et en préhension industrielle, cela ouvre une piste concrète pour réduire le coût de collecte de données réelles, souvent le vrai frein au passage du laboratoire au terrain. Le chiffre de 61 % reste toutefois à confirmer sur des objets et environnements non vus, les quatre tâches testées ayant été sélectionnées par les auteurs eux-mêmes.

STAR s'inscrit dans une recherche croissante visant à doter les modèles VLA d'un véritable retour tactile, alors que des systèmes de référence du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, reposent surtout sur la coordination vision-langage sans exploiter systématiquement le toucher. La rareté des jeux de données vision-tactile-langage synchronisés à grande échelle explique en partie pourquoi peu d'acteurs disposent d'un corpus comparable aux 10 576 trajectoires réunies ici. Publié comme préprint sans affiliation industrielle revendiquée ni calendrier de déploiement, STAR reste à ce stade une contribution de recherche. La communauté attendra probablement la publication du code et du jeu de données, ainsi que des comparaisons directes avec d'autres architectures tactiles en cours de développement.

À lire aussi

ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile
1arXiv cs.RO 

ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile

Une équipe de chercheurs a publié en juin 2025 ViTacFormer, une architecture d'apprentissage de représentations multi-modales pour la manipulation dextre robotique. Le système couple un encodeur cross-attention fusionnant vision haute résolution et données tactiles avec une tête de prédiction autoregressive des signaux de contact futurs, entraîné selon un curriculum progressif allant des tâches simples aux plus complexes. La représentation apprise pilote un module d'imitation learning pour des mains anthropomorphes multi-doigts. Sur des benchmarks réels en laboratoire, ViTacFormer dépasse les systèmes état de l'art précédents d'environ 50 %, enchaîne jusqu'à 11 étapes séquentielles sans intervention humaine et maintient une opération continue de 2,5 minutes sur des tâches de manipulation de précision. L'architecture répond à un verrou concret de la manipulation fine : les occlusions visuelles rendent la vision seule insuffisante lorsque la main cache l'objet, un problème que les capteurs tactiles résolvent mais que peu de systèmes intègrent de façon apprenante. La prédiction anticipée des contacts plutôt que leur simple détection réactive réduit la latence de contrôle, décisive pour les gestes de précision. La capacité à enchaîner 11 sous-tâches ouvre une voie pour l'assemblage multi-étapes industriel, où les robots classiques nécessitent actuellement une programmation explicite à chaque étape. Ces résultats restent cependant des benchmarks de laboratoire contrôlés ; la distance avec un déploiement en ligne de production réelle, où la variabilité des pièces et la robustesse du capteur tactile dans le temps sont critiques, demeure entière. ViTacFormer s'inscrit dans une vague de travaux combinant modèles VLA (Vision-Language-Action) et retour haptique, explorée également par Google DeepMind (Robotic Transformer), Physical Intelligence (Pi-0) et des startups comme Dexterous AI. Côté matériel, la dépendance aux mains anthropomorphes multi-doigts reste un frein à la commercialisation : Shadow Robot (UK) et Inspire-Robots (CN) dominent ce segment, mais à des coûts et avec une fiabilité mécanique qui limitent encore les déploiements industriels à grande échelle. Le travail est publié sous forme de preprint arXiv (arXiv:2506.15953), sans code ni dataset public annoncé à ce stade ; la transition vers des résultats reproductibles et des pilotes hors laboratoire constitue l'étape critique à surveiller.

RechercheOpinion
1 source
HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action
2arXiv cs.RO 

HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action

Des chercheurs ont publié le 31 mai 2026 HARP-VLA (Human-Robot Aligned Representation Learning for Vision-Language-Action), un framework de pré-entraînement conçu pour exploiter les vastes corpus de vidéos humaines dans l'apprentissage de politiques de manipulation robotique. Le coeur de l'approche repose sur deux composants entraînés conjointement : un encodeur visuel adapté aux robots et un modèle d'action latente. L'entraînement combine un petit nombre de démonstrations appariées humain-robot utilisées comme ponts inter-embodiment, et une quantité bien plus importante de vidéos non appariées des deux types comme supervision de dynamique. Sur le benchmark CALVIN ABC-D, HARP-VLA atteint un score moyen de 4,481 tâches consécutives réussies, et enregistre un gain de 7,1 points de pourcentage de taux de succès en conditions réelles par rapport à la meilleure baseline testée. Le problème que résout HARP est structurel pour tout le champ des VLA (Vision-Language-Action models) : les vidéos humaines sont abondantes et bon marché, mais les représentations visuelles qu'on en extrait sont mal alignées avec celles d'un robot, ce qui rend le co-entraînement inefficace voire contre-productif. Les modèles d'action latente existants, comme ceux utilisés dans les travaux sur UniPi ou Genie, réduisaient déjà le gap d'exécution en apprenant des abstractions d'action, mais restaient dépendants de features visuelles non alignées induisant des actions latentes domain-dépendantes. HARP introduit une perte d'alignement par discrimination relative de paires (source-relative pair-discriminative alignment loss) qui adapte les représentations robot vers la sémantique humaine sans effacer la discrimination inter-paires. Pour les intégrateurs et les équipes de recherche en manipulation, c'est un signal concret que le sim-to-real gap peut être partiellement adressé au niveau de la représentation, pas seulement du domaine de simulation. Ce travail s'inscrit dans une lignée de recherches sur l'apprentissage inter-embodiment qui a pris de l'ampleur depuis RT-2 (Google DeepMind, 2023) et OpenVLA (2024), lesquels montraient qu'un pré-entraînement sur données humaines ou web pouvait transférer vers des politiques robotiques. Les approches concurrentes directes incluent Octo, pi-0 de Physical Intelligence, et GR00T N2 de NVIDIA, tous confrontés à la même tension entre généralisation cross-embodiment et performance sur tâches précises. HARP se distingue en n'exigeant que peu de démonstrations appariées, ce qui réduit le coût de collecte de données. L'article reste pour l'instant une publication arXiv sans déploiement industriel annoncé, et les résultats en conditions réelles, bien que positifs, portent sur un nombre limité de configurations de manipulation.

RechercheOpinion
1 source
VT-MUSE : apprentissage séquentiel unifié de représentations visuotactiles multimodales pour la manipulation
3arXiv cs.RO 

VT-MUSE : apprentissage séquentiel unifié de représentations visuotactiles multimodales pour la manipulation

Un preprint publié en août 2026 sur arXiv (2608.21290) décrit VT-MUSE, un framework en deux étapes pour l'apprentissage de représentations visuotactiles en manipulation robotique. La première étape aligne conjointement des encodeurs vision et toucher par alignement temporel cross-modal et cohérence sur vues masquées. La seconde combine un modèle latent variationnel conditionnel avec des séquences visuelles partiellement masquées et l'historique tactile complet, via des décodeurs auxiliaires qui reconstruisent les images manquantes et prédisent les variations de profondeur tactile ; la représentation obtenue alimente une politique Transformer légère par attention croisée à portes. Sur le benchmark de simulation retenu, VT-MUSE dépasse la meilleure méthode concurrente de 11 points de pourcentage sur toutes les tâches testées, avec des gains également substantiels en conditions réelles, non chiffrés. Le papier cible un angle mort connu de la manipulation robotique : la plupart des méthodes visuotactiles fusionnent tardivement des flux vision et toucher encodés séparément, limitant les corrélations fines entre modalités, et négligent l'évolution temporelle du contact au profit du seul instant présent. Pour des gestes sensibles comme l'insertion de précision, la préhension d'objets fragiles ou le contrôle de force en assemblage, c'est pourtant cette dynamique dans le temps qui conditionne la réussite du geste. Le résultat conforte l'idée que les politiques d'action de type VLA gagnent en robustesse quand le tact est traité comme un signal temporel structuré, même si le gain de 11 points reste mesuré face à une seule baseline sur un benchmark propre à l'étude, et la validation réelle demeure peu détaillée. VT-MUSE s'inscrit dans une recherche plus large visant à traiter le signal tactile avec la même rigueur temporelle que la vision, aux côtés d'architectures génériques comme Pi-0 ou GR00T N2 qui restent, elles, centrées sur la vision et le langage. Sa contribution tient à l'alignement conjoint des modalités dès l'encodage et à la modélisation explicite de l'historique tactile complet, là où les approches existantes fusionnent des flux traités indépendamment. S'agissant d'un preprint tout juste mis en ligne, la suite logique passe par la publication du code et une évaluation sur des tâches et plateformes robotiques plus variées, préalable à toute adoption par des intégrateurs industriels.

RecherchePaper
1 source
HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique
4arXiv cs.RO 

HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique

Une équipe de chercheurs a publié HT-Bench, un benchmark à grande échelle destiné à évaluer les représentations tactiles main entière dans la manipulation robotique dextre, avec un dataset de 10 millions de trames RGB et 7,8 millions de trames tactiles collectées sur 226 tâches distinctes. La publication (arXiv:2606.19161, juin 2026) propose une approche centrée sur la vision égocentrique couplée à des capteurs tactiles couvrant l'intégralité de la main robotique. Le benchmark structure l'évaluation autour de quatre tâches : récupération de similarité tactile fine, inpainting de trames masquées, synthèse vision-vers-tactile, et prédiction multimodale de trames tactiles. En parallèle, les auteurs introduisent HandTouch, un encodeur vision-tactile à quantification vectorielle (VQ), entraîné selon trois phases progressives : spatiale, cross-modale et temporelle. Les gains quantitatifs de HandTouch sur HT-Bench sont nets : le Recall@5 en récupération de similarité tactile passe de 74,65 % à 85,23 %, l'erreur quadratique moyenne (RMSE) en inpainting chute de 0,022 à 0,010, et le score cIoU hors-distribution (OOD) en synthèse vision-tactile progresse de 0,628 à 0,705. Pour l'industrie robotique, cela valide une hypothèse structurante : coupler vision égocentrique et retour tactile main entière constitue une base d'apprentissage généralisable, sans exiger des capteurs ou des embodiments standardisés. C'est un signal concret pour les intégrateurs et équipes R&D travaillant sur la manipulation dextre en environnements non structurés, où percevoir l'état d'une prise sans vision directe reste un verrou majeur. Le domaine du tactile en robotique souffre depuis longtemps d'une fragmentation des formats de capteurs et des protocoles, rendant les comparaisons entre travaux difficiles. HT-Bench s'inscrit dans une dynamique de benchmarking qui émerge en 2025-2026, aux côtés d'initiatives comme RoboSet, DROID ou LIBERO pour la manipulation généraliste. Des laboratoires comme le CMU Robotics Institute et le MIT CSAIL, ainsi que des entreprises comme Sanctuary AI, explorent des approches similaires de fusion tactile-visuelle. Aucun acteur européen n'est directement cité dans ce travail, mais des startups comme Enchanted Tools ou Wandercraft, actives sur la manipulation avancée, pourraient tirer parti d'un tel benchmark pour standardiser leurs évaluations internes. L'étape suivante logique serait l'intégration de HandTouch dans des pipelines VLA (Vision-Language-Action), où le retour tactile reste aujourd'hui largement absent.

RecherchePaper
1 source