Aller au contenu principal
RecherchearXiv cs.RO 

EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent EgoTac, un modèle capable de prédire des signaux tactiles directement à partir de vidéos égocentriques humaines, sans capteur physique de toucher. Publié sur arXiv (2608.15060v1) en août 2026, le modèle est entraîné sur un corpus unifié de plus de 5,7 millions de paires image-tactile, combinant mesures de force continues et contacts binaires. En prédiction intra-domaine, EgoTac atteint une erreur de force moyenne inférieure à 0,06 newton. Sur des benchmarks de prédiction de contact hors domaine, il dépasse l'estimateur de contact considéré jusqu'ici comme référence de l'état de l'art. Le modèle reproduit aussi les courbes de montée et de descente des signaux tactiles réels, et parvient à des prédictions en zero-shot sur des vidéos du monde réel non contraintes, c'est-à-dire filmées hors laboratoire.

Cette approche répond à un goulot d'étranglement bien identifié dans l'apprentissage robotique : les données vidéo égocentriques humaines, de plus en plus utilisées pour entraîner des modèles vision-langage-action, sont abondantes et riches en contacts, mais dépourvues d'information tactile, faute de capteurs adaptés à une collecte à grande échelle. En démontrant qu'un signal tactile plausible peut être inféré par la seule vision, EgoTac ouvre une voie pour injecter des a priori tactiles dans l'apprentissage de la manipulation dextre sans multiplier les déploiements de capteurs physiques coûteux et fragiles. Pour les intégrateurs et laboratoires travaillant sur la manipulation fine, cela pourrait réduire la dépendance aux gants ou capteurs tactiles embarqués lors de la collecte de données, tout en conservant un signal exploitable pour entraîner des politiques robotiques.

Le travail s'inscrit dans la lignée des efforts de collecte de données égocentriques massives pour la robotique, où la vision domine largement le toucher faute de standardisation des capteurs tactiles. Les auteurs comparent EgoTac à un estimateur de contact jugé état de l'art, qu'il surpasse sur les benchmarks hors domaine testés. Leurs analyses de passage à l'échelle montrent que la diversité des interactions et le volume de données améliorent tous deux la performance de façon régulière, suggérant une marge de progression via l'extension future du corpus d'entraînement et une possible intégration dans des pipelines d'apprentissage robotique tactile plus larges.

À lire aussi

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
1arXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%. Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel. Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

RechercheActu
1 source
EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet
2arXiv cs.RO 

EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet

Des chercheurs ont publié en juin 2026 sur arXiv un framework baptisé EgoAERO, capable d'apprendre la manipulation dextre à partir d'une unique démonstration vidéo RGB-D égocentrique humaine, sans recourir à aucun asset 3D de l'objet manipulé. Le pipeline enchaîne trois modules : un tracking et une reconstruction de l'objet sans asset préalable, une compensation du mouvement égocentrique de la caméra, et une optimisation adaptative des contacts main-objet. Les trajectoires cohérentes obtenues sont ensuite converties en politiques robotiques via un apprentissage résiduel en deux étapes. Les auteurs introduisent également un mécanisme d'évaluation de qualité en ligne et publient EgoDex-R, un dataset de 4,3 millions de frames RGB-D pour l'entraînement de politiques dextres. En simulation comme en conditions réelles, EgoAERO atteint des performances proches des reconstructions assistées par modèles CAD sur le benchmark HOI4D, référence standard pour l'interaction main-objet. Le verrou technique levé ici est structurant pour la robotique dextre : jusqu'ici, les méthodes d'imitation à partir de vidéo humaine exigeaient soit des scans 3D préalables des objets, soit plusieurs démonstrations, soit des marqueurs visuels. Or, scanner chaque objet d'un environnement industriel ou domestique est un frein majeur à la scalabilité des systèmes. EgoAERO suggère qu'une caméra RGB-D standard (de type Intel RealSense ou intégrée à des lunettes connectées) et une seule prise vidéo suffisent pour bootstrapper une politique robotique fonctionnelle. C'est un signal fort en faveur d'une démocratisation de la collecte de données dextres, potentiellement réalisable par des opérateurs non spécialisés plutôt que par des sessions de télé-opération coûteuses. Ce travail s'inscrit dans une vague de recherche visant à exploiter les corpus vidéo égocentrique à grande échelle (Ego4D, HOI4D, EPIC-Kitchens), jusqu'ici sous-utilisés pour le robot learning faute de géométrie objet exploitable. Les approches concurrentes en manipulation dextre reposent encore largement sur la télé-opération avec gants haptiques (Physical Intelligence avec pi0, Dexterous Manipulation Lab de CMU) ou sur des assets CAD (DITTO, DexMV). EgoAERO n'est à ce stade qu'un preprint, sans déploiement industriel annoncé ni validation sur une large variété d'objets du monde réel : les expériences rapportées restent sur des scènes contrôlées du benchmark HOI4D, et la robustesse à des objets déformables ou transparents reste à démontrer.

RecherchePaper
1 source
Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique
3arXiv cs.RO 

Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique

Des chercheurs ont publié sur arXiv (réf. 2606.25160v1) une étude sur l'élagage des modèles vision-langage (VLMs) appliqué à la compréhension visuelle égocentrique, c'est-à-dire depuis le point de vue d'un robot ou d'un humain équipé de capteurs embarqués. L'objectif est de réduire la latence d'inférence pour des tâches collaboratives homme-robot (HRC) en temps réel, où chaque milliseconde compte. Les auteurs introduisent le concept de "prédiction doublement correcte" : une sortie du modèle doit être à la fois précise dans sa réponse ET ancrée dans les bonnes preuves visuelles (localisation d'evidence correcte). Leurs expériences montrent un résultat surprenant : les méthodes d'élagage existantes (weight pruning) tendent à préserver la localisation des indices visuels pertinents, mais dégradent la précision de la prédiction finale. Pour corriger cela, ils proposent une stratégie d'élagage informée par le raisonnement (rationale-informed pruning), validée sur des jeux de données vidéo égocentrique, sur lesquels elle surpasse les approches concurrentes en précision et en taux de prédictions doublement correctes. Pour les intégrateurs robotiques et les équipes qui déploient des VLMs sur des robots collaboratifs, ce résultat a des implications directes. La sécurité en HRC exige non seulement que le robot prenne la bonne décision, mais qu'il la prenne pour les bonnes raisons, ce qui est essentiel pour l'auditabilité et la conformité dans des contextes industriels réglementés. La démonstration que les techniques d'élagage standards cassent silencieusement la chaîne preuve-décision est un signal d'alarme pour quiconque compresse des VLMs à des fins de déploiement embarqué sans valider ce couplage. Cette publication s'inscrit dans une vague de travaux visant à rendre les VLMs exploitables sur hardware contraint, en réponse à la montée en puissance des architectures vision-action comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), qui intègrent déjà des capacités de compréhension visuelle pour la manipulation. L'élagage structuré reste une voie active face à la distillation ou la quantification. La prochaine étape naturelle serait de tester cette approche sur des benchmarks de manipulation réelle ou des pipelines de type VLA (Vision-Language-Action), où le gap sim-to-real reste ouvert. Il s'agit pour l'instant d'un preprint non évalué par les pairs.

RechercheOpinion
1 source
HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique
4arXiv cs.RO 

HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique

Une équipe de chercheurs a publié HT-Bench, un benchmark à grande échelle destiné à évaluer les représentations tactiles main entière dans la manipulation robotique dextre, avec un dataset de 10 millions de trames RGB et 7,8 millions de trames tactiles collectées sur 226 tâches distinctes. La publication (arXiv:2606.19161, juin 2026) propose une approche centrée sur la vision égocentrique couplée à des capteurs tactiles couvrant l'intégralité de la main robotique. Le benchmark structure l'évaluation autour de quatre tâches : récupération de similarité tactile fine, inpainting de trames masquées, synthèse vision-vers-tactile, et prédiction multimodale de trames tactiles. En parallèle, les auteurs introduisent HandTouch, un encodeur vision-tactile à quantification vectorielle (VQ), entraîné selon trois phases progressives : spatiale, cross-modale et temporelle. Les gains quantitatifs de HandTouch sur HT-Bench sont nets : le Recall@5 en récupération de similarité tactile passe de 74,65 % à 85,23 %, l'erreur quadratique moyenne (RMSE) en inpainting chute de 0,022 à 0,010, et le score cIoU hors-distribution (OOD) en synthèse vision-tactile progresse de 0,628 à 0,705. Pour l'industrie robotique, cela valide une hypothèse structurante : coupler vision égocentrique et retour tactile main entière constitue une base d'apprentissage généralisable, sans exiger des capteurs ou des embodiments standardisés. C'est un signal concret pour les intégrateurs et équipes R&D travaillant sur la manipulation dextre en environnements non structurés, où percevoir l'état d'une prise sans vision directe reste un verrou majeur. Le domaine du tactile en robotique souffre depuis longtemps d'une fragmentation des formats de capteurs et des protocoles, rendant les comparaisons entre travaux difficiles. HT-Bench s'inscrit dans une dynamique de benchmarking qui émerge en 2025-2026, aux côtés d'initiatives comme RoboSet, DROID ou LIBERO pour la manipulation généraliste. Des laboratoires comme le CMU Robotics Institute et le MIT CSAIL, ainsi que des entreprises comme Sanctuary AI, explorent des approches similaires de fusion tactile-visuelle. Aucun acteur européen n'est directement cité dans ce travail, mais des startups comme Enchanted Tools ou Wandercraft, actives sur la manipulation avancée, pourraient tirer parti d'un tel benchmark pour standardiser leurs évaluations internes. L'étape suivante logique serait l'intégration de HandTouch dans des pipelines VLA (Vision-Language-Action), où le retour tactile reste aujourd'hui largement absent.

RecherchePaper
1 source