Aller au contenu principal
WAM-TTT : piloter les modèles monde-action en observant le jeu humain en temps de test
RecherchearXiv cs.RO 

WAM-TTT : piloter les modèles monde-action en observant le jeu humain en temps de test

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente WAM-TTT, une méthode d'entraînement au moment du test ("test-time training") permettant d'orienter des modèles fondation robotiques de type world-action model (WAM) simplement en leur montrant des vidéos humaines, sans démonstration robotique ni fine-tuning spécifique à la tâche. Publié sur arXiv (2607.06988v1), le système ne traite pas les vidéos humaines comme des trajectoires à imiter directement : il les absorbe dans une mémoire adaptative légère, greffée sur un WAM gelé, via un objectif de prédiction vidéo auto-supervisé. Une étape de méta-entraînement, utilisant des paires de données humain-robot et un objectif de reconstruction de mémoire par clé-valeur, aligne en amont les démonstrations humaines avec les comportements robotiques attendus. Résultat : au moment du déploiement, seules des vidéos humaines non annotées suffisent pour adapter le comportement du robot, le modèle fondation pré-entraîné restant intégralement gelé. Les auteurs rapportent que WAM-TTT surpasse systématiquement les approches de référence par conditionnement contextuel sur vidéos humaines, sur un ensemble varié de tâches de manipulation et de scénarios de généralisation.

Cette approche s'attaque à un vrai goulot d'étranglement des modèles fondation robotiques (RFM) : aujourd'hui, adapter un modèle vision-langage-action (VLA) à une nouvelle variante de tâche ou à une préférence utilisateur exige généralement de nouvelles démonstrations robotiques coûteuses à collecter, un fine-tuning dédié, ou un long contexte de conditionnement gourmand en calcul. En permettant un pilotage à partir de simples vidéos humaines, sans action robotique ni annotation, WAM-TTT réduit potentiellement le coût d'adaptation et de personnalisation des robots pour les intégrateurs, tout en préservant les capacités de généralisation du modèle de base, un compromis que les méthodes de fine-tuning classiques peinent souvent à tenir.

Le papier s'inscrit dans la lignée des travaux récents sur les world-action models et le conditionnement en contexte par vidéo, dont il cherche explicitement à dépasser les limites en tant que méthode de référence comparée. À ce stade, il s'agit d'un résultat de recherche évalué en simulation et sur des bancs de manipulation expérimentaux, sans indication de déploiement industriel ni de partenariat avec un fabricant de robots humanoïdes ou d'AMR ; les auteurs ne précisent pas de calendrier de transfert vers des plateformes commerciales.

À lire aussi

Faster-WAM : les modèles monde-action ont-ils besoin de modules d'action profonds ?
1arXiv cs.RO 

Faster-WAM : les modèles monde-action ont-ils besoin de modules d'action profonds ?

Une équipe de recherche présente Faster-WAM, un nouveau modèle d'architecture pour les World Action Models (WAM), systèmes qui couplent la prédiction d'actions robotiques avec des modèles de monde vidéo. Publié sur arXiv début août 2026, le papier introduit le principe du Dock of Transformer (DoT) : plutôt que de calquer la profondeur du module d'action sur celle du backbone vidéo, comme le font les architectures existantes à backbone partagé ou de type Mixture-of-Transformers, DoT traite le Transformer vidéo pré-entraîné comme un simple hub de représentations et y greffe des têtes de sortie légères via une interface de "docking". Concrètement, Faster-WAM branche une tête d'action d'une seule couche sur un backbone vidéo de 30 couches, l'interface fusionnant les clés et valeurs de toutes les couches vidéo avec un réalignement RoPE. Sans pré-entraînement embodied supplémentaire, le modèle obtient des performances compétitives sur les benchmarks LIBERO et RoboTwin 2.0, une bonne généralisation hors distribution sur LIBERO-Plus, et surtout une latence de bout en bout de 66,5 millisecondes par inférence, soit 3,2 fois plus rapide que Fast-WAM, la référence précédente. Pour l'industrie robotique, l'enjeu est moins la performance brute que la latence exploitable en temps réel : un modèle de contrôle qui prend 200 ms à répondre est difficilement utilisable sur un bras ou un robot mobile évoluant dans un environnement dynamique. En découplant la taille de la tête d'action de la profondeur du backbone vidéo, cette approche laisse entrevoir des VLA (vision-language-action) capables d'exploiter de gros modèles de monde pré-entraînés sans en hériter le coût d'inférence, un compromis que beaucoup d'architectures actuelles peinent à tenir. Le travail s'inscrit dans la tendance de fond des World Action Models, qui cherchent à unifier prédiction vidéo et prédiction d'action dans un même réseau plutôt que d'empiler des modules séparés. À ce stade, les résultats restent cantonnés à des benchmarks de simulation (LIBERO, RoboTwin 2.0) et non à un déploiement sur robot réel : il s'agit d'une contribution architecturale, pas d'un produit commercialisé. Les auteurs ne précisent pas de suite ni de calendrier de transfert vers du matériel physique.

RechercheActu
1 source
ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action
2arXiv cs.RO 

ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action

Des chercheurs publient ActiveWAM, un modèle unifié « monde-action » (world-action model) destiné à la manipulation à vision active, c'est-à-dire des politiques qui pilotent à la fois les effecteurs et la caméra. Le système génère des actions bimanuelles et des mouvements pan/tilt, y compris des comportements de maintien du point de vue (« stay ») et de réacquisition, à partir d'un historique tenant compte des vues, puis met à jour son contexte avec les nouvelles images RGB mesurées. Il est entraîné par une « inversion au moment de l'entraînement » (training-time inversion), qui contraint un prior vidéo figé par les preuves visuelles de la tâche et les changements temporels visibles. Cela supprime l'inversion au test et le classement de candidats. La prédiction de vidéo future sert de signal de co-entraînement, mais la génération d'actions n'exige ni décodage vidéo futur ni annotation de point de vue optimal. L'équipe introduit aussi RoboTwin-AV, un benchmark de 50 tâches avec contrôle pan/tilt exécutable et démonstrations générées automatiquement. ActiveWAM gagne jusqu'à 17,0 points de pourcentage de réussite hors distribution sur TAVIS face aux meilleures références. Il devance Fast-WAM de 20,0 points sur RoboTwin-AV et de 26,7 points sur des tâches physiques de cuisine en conditions réelles. L'intérêt tient à la manière dont le travail formalise un problème souvent traité de façon empirique. Bouger la caméra pour acquérir une nouvelle vue peut écarter du champ des indices critiques pour la tâche, tandis que conserver la vue perd des observations potentiellement utiles. Poser ce compromis « garder ou acquérir » comme un problème de gestion des preuves, appris conjointement avec la manipulation, évite de recourir à des heuristiques de recherche de vue ou à du classement de candidats coûteux à l'exécution. Le fait que l'action se génère sans décoder la vidéo future réduit aussi la charge de calcul au déploiement, un point sensible pour les intégrateurs. Les gains réels de 26,7 points sont notables, mais ils portent sur des tâches de cuisine dont le nombre et la diversité ne sont pas précisés dans le résumé. Le benchmark étant introduit par les mêmes auteurs, la comparaison reste à confirmer par des évaluations indépendantes. Ce travail s'inscrit dans l'essor des modèles monde-action, qui exploitent des priors vidéo pré-entraînés pour guider le contrôle, avec Fast-WAM comme principale référence ici. La plupart des politiques de manipulation actuelles supposent une caméra fixe ou montée sur la tête, et ne contrôlent pas activement la vue. Le benchmark RoboTwin-AV prolonge l'écosystème RoboTwin en y ajoutant le contrôle de caméra, ce qui pourrait servir de base commune à d'autres équipes. Il s'agit d'une publication de recherche, sans produit, déploiement industriel ni calendrier commercial annoncés. Les prochaines étapes naturelles seraient des tests sur davantage de plateformes, des environnements moins structurés que la cuisine, et une intégration avec les grands modèles VLA du secteur.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
3arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
SG-WAM : guidage sémantique ancré au texte et conscient de l'espace pour les modèles monde-action
4arXiv cs.RO 

SG-WAM : guidage sémantique ancré au texte et conscient de l'espace pour les modèles monde-action

Un article de recherche publié sur arXiv (référence 2608.08839, avril... plutôt août 2026) présente SG-WAM, une méthode de guidage sémantique pour les modèles dits "World-Action Models" (WAM), une famille d'architectures utilisées en manipulation robotique qui prédisent à la fois une vidéo future de la scène et les actions du robot à partir d'une observation visuelle et d'une instruction en langage naturel. Le constat de départ des auteurs est que la plupart des WAM existants s'appuient surtout sur l'image et peu sur le texte, car les encodeurs de texte classiques traitent l'instruction indépendamment de ce que voit le robot. Résultat, la vidéo prédite s'écarte souvent du sens réel de la consigne, ce qui dégrade la précision des actions calculées. Pour corriger cela, SG-WAM ajoute un planificateur basé sur un modèle vision-langage (VLM), entraîné à produire deux types de prévisions sémantiques: une prévision "ancrée dans le texte", qui identifie les bons objets cibles mentionnés dans l'instruction, et une prévision "consciente de l'espace", qui restitue la géométrie de la scène pour une manipulation précise. Ces prévisions sont injectées comme guidage de haut niveau dans le WAM, pour aligner génération vidéo et prédiction d'action sur l'instruction donnée. Les auteurs rapportent des expériences en simulation et en conditions réelles. Sur le fond, ce travail s'attaque à un point de friction classique des architectures VLA et WAM: la tendance des modèles à bien fonctionner en démonstration contrôlée mais à perdre l'instruction de vue dès que la scène contient plusieurs objets similaires ou une ambiguïté spatiale. Pour les équipes qui évaluent des piles de manipulation robotique en entrepôt ou en usine, ce type de contribution touche directement la fiabilité du suivi d'instruction, un critère souvent plus déterminant que la vitesse d'exécution pour la mise en production. Il s'agit toutefois d'une publication académique, testée sur des protocoles expérimentaux et non d'un produit commercialisé ni d'un déploiement industriel chiffré. Le papier s'inscrit dans la lignée des travaux qui cherchent à combler l'écart entre modèles purement vision-action et modèles de "monde" capables d'anticiper les conséquences physiques d'une action avant de l'exécuter. L'abstract ne précise ni les benchmarks utilisés, ni de calendrier de mise à disposition du code, ni de partenariat industriel.

RecherchePaper
1 source