Aller au contenu principal
EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique
RecherchearXiv cs.RO 

EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent EgoTac, un modèle capable de prédire des signaux tactiles directement à partir de vidéos égocentriques humaines, sans capteur physique de toucher. Publié sur arXiv (2608.15060v1) en août 2026, le modèle est entraîné sur un corpus unifié de plus de 5,7 millions de paires image-tactile, combinant mesures de force continues et contacts binaires. En prédiction intra-domaine, EgoTac atteint une erreur de force moyenne inférieure à 0,06 newton. Sur des benchmarks de prédiction de contact hors domaine, il dépasse l'estimateur de contact considéré jusqu'ici comme référence de l'état de l'art. Le modèle reproduit aussi les courbes de montée et de descente des signaux tactiles réels, et parvient à des prédictions en zero-shot sur des vidéos du monde réel non contraintes, c'est-à-dire filmées hors laboratoire.

Cette approche répond à un goulot d'étranglement bien identifié dans l'apprentissage robotique : les données vidéo égocentriques humaines, de plus en plus utilisées pour entraîner des modèles vision-langage-action, sont abondantes et riches en contacts, mais dépourvues d'information tactile, faute de capteurs adaptés à une collecte à grande échelle. En démontrant qu'un signal tactile plausible peut être inféré par la seule vision, EgoTac ouvre une voie pour injecter des a priori tactiles dans l'apprentissage de la manipulation dextre sans multiplier les déploiements de capteurs physiques coûteux et fragiles. Pour les intégrateurs et laboratoires travaillant sur la manipulation fine, cela pourrait réduire la dépendance aux gants ou capteurs tactiles embarqués lors de la collecte de données, tout en conservant un signal exploitable pour entraîner des politiques robotiques.

Le travail s'inscrit dans la lignée des efforts de collecte de données égocentriques massives pour la robotique, où la vision domine largement le toucher faute de standardisation des capteurs tactiles. Les auteurs comparent EgoTac à un estimateur de contact jugé état de l'art, qu'il surpasse sur les benchmarks hors domaine testés. Leurs analyses de passage à l'échelle montrent que la diversité des interactions et le volume de données améliorent tous deux la performance de façon régulière, suggérant une marge de progression via l'extension future du corpus d'entraînement et une possible intégration dans des pipelines d'apprentissage robotique tactile plus larges.

À lire aussi

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
1arXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%. Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel. Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

RechercheActu
1 source
EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet
2arXiv cs.RO 

EgoAERO : apprendre la manipulation habile à partir d'une seule vidéo égocentrique sans ressources d'objet

Des chercheurs ont publié en juin 2026 sur arXiv un framework baptisé EgoAERO, capable d'apprendre la manipulation dextre à partir d'une unique démonstration vidéo RGB-D égocentrique humaine, sans recourir à aucun asset 3D de l'objet manipulé. Le pipeline enchaîne trois modules : un tracking et une reconstruction de l'objet sans asset préalable, une compensation du mouvement égocentrique de la caméra, et une optimisation adaptative des contacts main-objet. Les trajectoires cohérentes obtenues sont ensuite converties en politiques robotiques via un apprentissage résiduel en deux étapes. Les auteurs introduisent également un mécanisme d'évaluation de qualité en ligne et publient EgoDex-R, un dataset de 4,3 millions de frames RGB-D pour l'entraînement de politiques dextres. En simulation comme en conditions réelles, EgoAERO atteint des performances proches des reconstructions assistées par modèles CAD sur le benchmark HOI4D, référence standard pour l'interaction main-objet. Le verrou technique levé ici est structurant pour la robotique dextre : jusqu'ici, les méthodes d'imitation à partir de vidéo humaine exigeaient soit des scans 3D préalables des objets, soit plusieurs démonstrations, soit des marqueurs visuels. Or, scanner chaque objet d'un environnement industriel ou domestique est un frein majeur à la scalabilité des systèmes. EgoAERO suggère qu'une caméra RGB-D standard (de type Intel RealSense ou intégrée à des lunettes connectées) et une seule prise vidéo suffisent pour bootstrapper une politique robotique fonctionnelle. C'est un signal fort en faveur d'une démocratisation de la collecte de données dextres, potentiellement réalisable par des opérateurs non spécialisés plutôt que par des sessions de télé-opération coûteuses. Ce travail s'inscrit dans une vague de recherche visant à exploiter les corpus vidéo égocentrique à grande échelle (Ego4D, HOI4D, EPIC-Kitchens), jusqu'ici sous-utilisés pour le robot learning faute de géométrie objet exploitable. Les approches concurrentes en manipulation dextre reposent encore largement sur la télé-opération avec gants haptiques (Physical Intelligence avec pi0, Dexterous Manipulation Lab de CMU) ou sur des assets CAD (DITTO, DexMV). EgoAERO n'est à ce stade qu'un preprint, sans déploiement industriel annoncé ni validation sur une large variété d'objets du monde réel : les expériences rapportées restent sur des scènes contrôlées du benchmark HOI4D, et la robustesse à des objets déformables ou transparents reste à démontrer.

RecherchePaper
1 source
Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique
3arXiv cs.RO 

Vers des modèles vision-langage à faible latence avec prédictions doublement correctes pour la compréhension visuelle égocentrique

Des chercheurs ont publié sur arXiv (réf. 2606.25160v1) une étude sur l'élagage des modèles vision-langage (VLMs) appliqué à la compréhension visuelle égocentrique, c'est-à-dire depuis le point de vue d'un robot ou d'un humain équipé de capteurs embarqués. L'objectif est de réduire la latence d'inférence pour des tâches collaboratives homme-robot (HRC) en temps réel, où chaque milliseconde compte. Les auteurs introduisent le concept de "prédiction doublement correcte" : une sortie du modèle doit être à la fois précise dans sa réponse ET ancrée dans les bonnes preuves visuelles (localisation d'evidence correcte). Leurs expériences montrent un résultat surprenant : les méthodes d'élagage existantes (weight pruning) tendent à préserver la localisation des indices visuels pertinents, mais dégradent la précision de la prédiction finale. Pour corriger cela, ils proposent une stratégie d'élagage informée par le raisonnement (rationale-informed pruning), validée sur des jeux de données vidéo égocentrique, sur lesquels elle surpasse les approches concurrentes en précision et en taux de prédictions doublement correctes. Pour les intégrateurs robotiques et les équipes qui déploient des VLMs sur des robots collaboratifs, ce résultat a des implications directes. La sécurité en HRC exige non seulement que le robot prenne la bonne décision, mais qu'il la prenne pour les bonnes raisons, ce qui est essentiel pour l'auditabilité et la conformité dans des contextes industriels réglementés. La démonstration que les techniques d'élagage standards cassent silencieusement la chaîne preuve-décision est un signal d'alarme pour quiconque compresse des VLMs à des fins de déploiement embarqué sans valider ce couplage. Cette publication s'inscrit dans une vague de travaux visant à rendre les VLMs exploitables sur hardware contraint, en réponse à la montée en puissance des architectures vision-action comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), qui intègrent déjà des capacités de compréhension visuelle pour la manipulation. L'élagage structuré reste une voie active face à la distillation ou la quantification. La prochaine étape naturelle serait de tester cette approche sur des benchmarks de manipulation réelle ou des pipelines de type VLA (Vision-Language-Action), où le gap sim-to-real reste ouvert. Il s'agit pour l'instant d'un preprint non évalué par les pairs.

RechercheOpinion
1 source
TacPAC : prédiction tactile, correction d'action en temps réel, modèles monde-action pour manipulation à contacts riches
4arXiv cs.RO 

TacPAC : prédiction tactile, correction d'action en temps réel, modèles monde-action pour manipulation à contacts riches

Des chercheurs du Logos Robotics Group ont publié le 7 septembre 2026 sur arXiv (2609.05266) TacPAC, un mécanisme de correction tactile en temps réel pour les modèles monde-action de manipulation robotique. Alors que ces modèles planifient habituellement leurs actions à partir de prédictions purement visuelles des observations futures, TacPAC met en cache le contact prédit lors de la planification, ainsi que la représentation du plan lui-même, puis compare chaque image tactile réellement perçue à ce cache pour corriger, en cours d'exécution, les actions pas encore jouées. Sur cinq tâches réalisées avec un robot réel, insertion de précision, manipulation d'objets fragiles, réorientation d'objets et manipulation à long horizon, le taux de réussite moyen passe de 22% pour le modèle de référence purement visuel à 64% avec TacPAC, pour un coût de correction 20,7 fois inférieur à celui d'une régénération complète du segment d'actions. Le code est publié sur GitHub sous LogosRoboticsGroup/TacPAC. Ce résultat cible une faiblesse connue des modèles vision-langage-action et monde-action: leur cécité aux repères de contact locaux, pourtant déterminants dans les tâches riches en contact comme l'assemblage de précision ou la manipulation d'objets fragiles. Les auteurs montrent surtout qu'ajouter la prédiction tactile comme simple vue supplémentaire ne récupère qu'un tiers du gain possible, à cause d'un décalage temporel entre la prédiction, qui précède l'action, et le retour tactile, qui arrive pendant son exécution. Pour les intégrateurs industriels, la leçon dépasse le simple ajout d'un capteur tactile: sans boucle de correction dédiée exploitant ce que le plan avait anticipé, le tactile apporte peu de gain réel, un point qui tempère l'enthousiasme actuel autour des modèles génératifs multimodaux appliqués à la manipulation fine. Le travail prolonge la lignée des modèles monde-action qui conditionnent la génération d'actions sur des observations futures prédites, une approche jusqu'ici centrée sur la vision et illustrée par des systèmes comme Pi-0, GR00T N2 ou Helix. TacPAC reste un article de recherche déposé sur arXiv, pas un produit commercial ni un déploiement industriel: ses résultats portent sur cinq tâches en laboratoire avec un seul robot, sans précision sur le nombre d'essais ni sur une généralisation à d'autres plateformes ou bras robotiques. Le code source ouvert laisse toutefois la porte à une reprise par d'autres équipes de recherche en manipulation robotique. Aucun acteur français ou européen n'apparaît dans cette publication.

RechercheActu
1 source