Aller au contenu principal
RecherchearXiv cs.RO 

TacDyn-WAM : apprentissage de la dynamique tactile implicite dans un modèle du monde et d'actions visuo-tactile hétérogène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient TacDyn-WAM, un « world action model » visuo-tactile hétérogène (arXiv 2610.00638) qui prédit la dynamique tactile implicite plutôt que de reconstruire les futures images tactiles. Les world action models conditionnent les actions du robot sur des futurs prédits. Leurs variantes tactiles actuelles reprennent les pipelines de génération vidéo, avec reconstruction itérative par débruitage. TacDyn-WAM apprend TacRep, un espace de représentation tactile entraîné par prédiction spatio-temporelle masquée sur des séquences tactiles, et régularisé par distillation de structure relationnelle. Deux experts, l'un visuel, l'autre tactile, prédisent des représentations futures dans des espaces cibles distincts et échangent par attention conjointe. L'expert tactile prédit, en une seule passe avant, les représentations futures et leurs variations à plusieurs horizons. Une mémoire tactile en lecture seule fournit l'état de contact courant. Sur le benchmark UniVTAC, le modèle atteint 81,5 % de réussite moyenne avec les seules démonstrations fournies. Sur cinq tâches réelles, il obtient 71,0 %, et 85,0 % après un pré-entraînement de taille modeste.

L'enjeu porte sur la robustesse en déploiement. Les auteurs soutiennent qu'un léger décalage de position ou de force de contact modifie fortement les pixels tactiles, alors que l'évolution du contact reste prévisible. Reconstruire ces pixels devient alors fragile, tandis que prédire la dynamique dans un espace latent y serait moins sensible. Le résultat est notable pour les intégrateurs de manipulation fine, par exemple l'insertion ou la saisie sous contact, car il suggère qu'un tactile utile ne demande pas forcément de lourds modèles génératifs. Le modèle reste compétitif face à des approches pré-entraînées sur de vastes trajectoires visuo-tactiles. Les ablations indiquent que les deux voies tactiles et TacRep l'emportent sur les alternatives par reconstruction de pixels ou statiques. Les chiffres viennent toutefois des auteurs, sur un benchmark, avec un nombre limité de tâches réelles. Le papier ne donne ni temps de cycle ni matériel de déploiement industriel, et l'écart entre simulation, laboratoire et production reste à démontrer.

Ce travail s'inscrit dans la montée des modèles du monde appliqués au contrôle robotique, où le tactile reste le parent pauvre face à la vision. Les VLA comme Pi-0 ou GR00T s'appuient surtout sur la vision et le langage, tandis que les capteurs tactiles de type vision-based (GelSight et dérivés) restent peu intégrés aux modèles de fondation. Les variantes tactiles concurrentes héritent des architectures de génération vidéo que TacDyn-WAM remet en cause. Il s'agit d'une prépublication v1, sans produit ni déploiement annoncé. La suite probable passera par des pré-entraînements plus vastes, davantage de tâches réelles et une réplication indépendante. Aucun acteur français ou européen n'est cité dans l'article.

Dans nos dossiers

À lire aussi

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
1arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
Point Completion 3D pour les modèles du monde : une méthode plus précise d'apprentissage de la dynamique
2arXiv cs.RO 

Point Completion 3D pour les modèles du monde : une méthode plus précise d'apprentissage de la dynamique

Les faits d'abord : une équipe de recherche présente sur arXiv (juillet 2026) 3DPWM, un modèle de monde en 3D conçu pour la planification robotique. Contrairement aux modèles de dynamique fondés sur la vidéo, largement utilisés aujourd'hui pour prédire les conséquences d'une action avant de l'exécuter, 3DPWM travaille directement dans l'espace 3D : il complète d'abord les nuages de points partiels captés par les capteurs (souvent incomplets à cause des occlusions), puis apprend une dynamique conditionnée par l'action sur cette géométrie reconstituée. Le modèle est qualifié de "task-agnostic", c'est-à-dire réutilisable d'une tâche à l'autre sans réentraînement complet. Testé sur plusieurs incarnations robotiques et plusieurs bancs d'essai de manipulation sur table, il produit des trajectoires prédictives fiables sur 100 à 300 pas de temps et plus, fonctionne en boucle ouverte comme en boucle fermée, et démontre un transfert réussi de la simulation vers le réel. L'enjeu porte sur un problème central de la robotique fondée sur l'apprentissage : les modèles de monde vidéo, bien que puissants pour générer des scènes plausibles, dérivent géométriquement sur les horizons longs, accumulant des erreurs qui rendent la planification peu fiable au-delà de quelques dizaines de pas. Les modèles 3D à base de nuages de points partiels corrigent en partie ce défaut mais restent vulnérables aux occlusions et à la dérive de prédiction. En comblant explicitement les trous de la géométrie observée avant de simuler la dynamique, 3DPWM attaque directement ce goulot d'étranglement. Pour les équipes qui travaillent sur la planification par modèle (model-based planning), c'est un signal que la fiabilité sur le long terme, condition nécessaire pour improviser des solutions sur des tâches nouvelles, reste atteignable sans reposer uniquement sur des modèles vidéo massifs coûteux à entraîner. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles de monde pour la robotique, une famille qui inclut aussi bien les approches génératives vidéo que les architectures VLA (vision-langage-action) type Pi-0 ou GR00T N2, davantage orientées vers l'exécution directe que vers la planification explicite. La démonstration d'un transfert sim-to-real réussi est le test classique pour juger la maturité d'une méthode de ce type, avant toute adoption industrielle. À ce stade, il s'agit d'une publication de recherche accompagnée de résultats expérimentaux sur bancs d'essai standards, sans déploiement produit ni partenariat industriel annoncé ; la suite logique serait une validation sur des plateformes robotiques réelles au-delà des configurations de laboratoire testées.

RecherchePaper
1 source
AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins
3arXiv cs.RO 

AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins

Des chercheurs publient sur arXiv (v2, référence 2609.33299) AquaWAM, présenté comme le premier World Action Model (WAM) conçu pour des agents sous-marins. Un WAM permet à un robot d'anticiper les conséquences d'une action candidate avant de l'exécuter. Les WAM existants prédisent surtout des observations visuelles conditionnées par l'action. AquaWAM prédit à la place des états de navigation compacts. Il modélise la dynamique commandée et la dynamique passive: zone morte des propulseurs, glissement inertiel qui dépasse chaque commande, courants ambiants. Il perçoit via un DVL (capteur de vitesse Doppler), une centrale inertielle (IMU), un capteur de pression et des encodeurs d'articulations. Les caméras ne servent qu'à fournir la sémantique, c'est-à-dire les objectifs et la pose de la cible. Sur le benchmark USIM (20 tâches sous-marines), le modèle atteint 72,6 % de succès. Il décide 2,7 fois plus vite que U0 sur un NVIDIA Jetson AGX Orin. Sans les mesures de vitesse du DVL, il conserve 61,6 % de succès, contre 39,4 % pour U0. Ces résultats visent une hypothèse répandue dans les modèles du monde, selon laquelle prédire des pixels serait la voie générique vers le contrôle. Sous l'eau, l'inertie, la flottabilité, la traînée et la dérive continuent d'agir après la commande. Modéliser directement ces effets, plutôt que la scène, réduit la taille du modèle et le coût de calcul. La vitesse d'inférence sur Jetson AGX Orin, un module embarqué courant, compte pour les intégrateurs d'ROV et d'AUV, dont le calcul et l'énergie sont limités. La robustesse à la perte de capteurs répond à un problème opérationnel: un DVL perd son verrouillage sur le fond, et les eaux turbides dégradent la vision. L'écart entre 61,6 % et 39,4 % suggère une meilleure tolérance à la dégradation, à confirmer hors simulation. Il faut toutefois lire ces chiffres avec prudence. Les résultats proviennent d'un benchmark en simulation, USIM. L'abstract ne mentionne ni essai en bassin ni essai en mer. Il ne dit pas non plus si le comparatif avec U0 est réalisé à budget équivalent. Le résumé ne précise pas non plus l'écart de réalité entre simulation et milieu réel pour des courants variables. Le travail s'inscrit dans l'extension des WAM et des modèles vision-langage-action (VLA) au-delà des manipulateurs terrestres et des humanoïdes, vers des véhicules à dynamique passive marquée. U0 sert ici de référence pour l'embarqué sous-marin. Aucun acteur français ou européen n'est cité dans l'abstract. Les suites probables sont des validations en conditions réelles, l'ouverture éventuelle du code et des tests sur des véhicules physiques. Ce travail reste pour l'instant une publication de recherche, sans produit ni déploiement annoncé.

RecherchePaper
1 source
VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches
4arXiv cs.RO 

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches

Des chercheurs présentent VT-WAM, un modèle de manipulation robotique combinant vision et toucher, décrit dans un article déposé sur arXiv (2607.02503v1) et accompagné d'un site dédié (vt-wam.github.io). Le système, un "Visual-Tactile World Action Model", apprend simultanément trois choses dans un même cadre de flow matching : prédire les images visuelles futures, prédire la déformation tactile future, et prédire l'action à exécuter. Deux mécanismes techniques soutiennent cette approche : une attention "Asymmetric Mixture-of-Transformers" (MoT) qui relie une première image de référence à la dynamique tactile dans le temps, et un module nommé AVTAG (Action-Visual-Tactile Attention Guidance) qui force le modèle à s'appuyer davantage sur le signal tactile pendant les phases de contact. Sur six tâches de manipulation en conditions réelles impliquant un contact physique important, VT-WAM atteint un taux de réussite moyen de 71,67%, contre des scores inférieurs de 26,67 points pour Fast-WAM et de 35,84 points pour OmniVTLA, deux modèles de référence utilisés en comparaison. L'enjeu dépasse la simple performance chiffrée : les politiques visuo-tactiles existantes se contentent généralement d'injecter le signal tactile brut dans la prédiction d'action, sans modéliser comment cette déformation évolue dans le temps. Or c'est précisément sur les tâches à fort contact (insertion, préhension d'objets déformables, gestion du glissement) que les modèles purement visuels ou de type VLA (vision-language-action) échouent le plus souvent, malgré des démonstrations impressionnantes en environnement contrôlé. Pour les intégrateurs industriels qui cherchent à automatiser des opérations d'assemblage fin, ce travail illustre une piste concrète pour combler l'écart entre démonstration et fiabilité réelle. Le papier s'inscrit dans la lignée des "world models" appliqués à la robotique, dont Fast-WAM constitue un prédécesseur direct servant de base de comparaison, aux côtés de familles de modèles VLA comme OmniVTLA. Il s'agit toutefois d'une publication académique, sans acteur industriel identifié ni date de déploiement annoncée : les résultats restent circonscrits à six tâches de laboratoire, et les auteurs eux-mêmes soulignent via leurs ablations que la modélisation de la dynamique tactile reste un problème ouvert plutôt qu'une solution définitivement close.

RecherchePaper
1 source