Aller au contenu principal
Long-WAM : étendre le contexte des modèles monde-action
RecherchearXiv cs.RO 

Long-WAM : étendre le contexte des modèles monde-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient Long-WAM, un cadre modèle-système conçu pour étendre le contexte visuel des world-action models (WAM) causaux, ces architectures qui prédisent à la fois les futures images et les actions d'un robot. Le travail, déposé sur arXiv, repose sur un constat central : disposer d'un historique n'implique pas de s'en servir. Les historiques longs ne rapportent beaucoup que si le modèle vidéo de base a été préentraîné de façon autorégressive (AR). Les auteurs apprennent d'abord la prédiction causale sur des vidéos de robots et des vidéos égocentriques sans étiquettes d'action, puis préservent cette structure historique-futur lors de l'adaptation aux actions. Sur RoboCasa GR-1, passer de 0,0 à 19,2 secondes de contexte fait grimper le taux de succès de 63,3 % à 78,7 %. Une initialisation préentraînée de manière bidirectionnelle n'en tire aucun gain net. Long-WAM affiche aussi les meilleurs résultats parmi les méthodes comparées sur LIBERO-Long, RoboTwin 2.0 et DOMINO.

L'intérêt tient à deux points. D'abord, le résultat contredit l'idée répandue qu'il suffit d'allonger la fenêtre de contexte pour obtenir de la mémoire utile : le mode de préentraînement vidéo pèse davantage que la longueur brute de l'historique. Ensuite, la contrainte temps réel est traitée de front. L'encodage des observations en flux continu, l'exécution asynchrone et l'accélération spécifique à chaque matériel permettent un déploiement sur RTX 5090, DGX Spark et Jetson AGX Thor, sans supprimer la prédiction du futur. Sur RTX 5090, chaque bloc d'actions, prédiction du latent vidéo futur comprise, demande 107,4 ms. Sur robots réels, Unitree G1 et YAM, le système gère des tâches dynamiques et à long horizon. Il atteint 95 % de réussite à l'empilement dynamique de gobelets, là où Pi0.5 et Fast-WAM échouent sur les 20 essais. Ces chiffres viennent des auteurs, sur un jeu de 20 essais et une tâche choisie par eux. Ils méritent donc une réplication indépendante avant d'être généralisés.

Ce travail s'inscrit dans la montée des WAM, qui concurrencent les politiques vision-langage-action (VLA) comme Pi0.5 en exploitant la vidéo comme signal d'apprentissage dense. Fast-WAM, l'autre référence directe de l'article, cherchait déjà à rendre ces modèles assez rapides pour le contrôle. Long-WAM ajoute la mémoire à cette équation, avec des benchmarks surtout simulés, et le pilotage de robots d'Unitree et de YAM, plateformes accessibles aux laboratoires. Les auteurs indiquent que le modèle sert aussi d'exécuteur doté de mémoire, complémentaire d'une planification de plus haut niveau dans des tâches composites. Il s'agit d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra de la publication éventuelle du code et des poids, et de la tenue des résultats hors des tâches de démonstration.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action
1arXiv cs.RO 

ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action

Des chercheurs publient ActiveWAM, un modèle unifié « monde-action » (world-action model) destiné à la manipulation à vision active, c'est-à-dire des politiques qui pilotent à la fois les effecteurs et la caméra. Le système génère des actions bimanuelles et des mouvements pan/tilt, y compris des comportements de maintien du point de vue (« stay ») et de réacquisition, à partir d'un historique tenant compte des vues, puis met à jour son contexte avec les nouvelles images RGB mesurées. Il est entraîné par une « inversion au moment de l'entraînement » (training-time inversion), qui contraint un prior vidéo figé par les preuves visuelles de la tâche et les changements temporels visibles. Cela supprime l'inversion au test et le classement de candidats. La prédiction de vidéo future sert de signal de co-entraînement, mais la génération d'actions n'exige ni décodage vidéo futur ni annotation de point de vue optimal. L'équipe introduit aussi RoboTwin-AV, un benchmark de 50 tâches avec contrôle pan/tilt exécutable et démonstrations générées automatiquement. ActiveWAM gagne jusqu'à 17,0 points de pourcentage de réussite hors distribution sur TAVIS face aux meilleures références. Il devance Fast-WAM de 20,0 points sur RoboTwin-AV et de 26,7 points sur des tâches physiques de cuisine en conditions réelles. L'intérêt tient à la manière dont le travail formalise un problème souvent traité de façon empirique. Bouger la caméra pour acquérir une nouvelle vue peut écarter du champ des indices critiques pour la tâche, tandis que conserver la vue perd des observations potentiellement utiles. Poser ce compromis « garder ou acquérir » comme un problème de gestion des preuves, appris conjointement avec la manipulation, évite de recourir à des heuristiques de recherche de vue ou à du classement de candidats coûteux à l'exécution. Le fait que l'action se génère sans décoder la vidéo future réduit aussi la charge de calcul au déploiement, un point sensible pour les intégrateurs. Les gains réels de 26,7 points sont notables, mais ils portent sur des tâches de cuisine dont le nombre et la diversité ne sont pas précisés dans le résumé. Le benchmark étant introduit par les mêmes auteurs, la comparaison reste à confirmer par des évaluations indépendantes. Ce travail s'inscrit dans l'essor des modèles monde-action, qui exploitent des priors vidéo pré-entraînés pour guider le contrôle, avec Fast-WAM comme principale référence ici. La plupart des politiques de manipulation actuelles supposent une caméra fixe ou montée sur la tête, et ne contrôlent pas activement la vue. Le benchmark RoboTwin-AV prolonge l'écosystème RoboTwin en y ajoutant le contrôle de caméra, ce qui pourrait servir de base commune à d'autres équipes. Il s'agit d'une publication de recherche, sans produit, déploiement industriel ni calendrier commercial annoncés. Les prochaines étapes naturelles seraient des tests sur davantage de plateformes, des environnements moins structurés que la cuisine, et une intégration avec les grands modèles VLA du secteur.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WAMJET : un cadre pour accélérer les modèles d'action du monde
2arXiv cs.RO 

WAMJET : un cadre pour accélérer les modèles d'action du monde

WAMJET, présenté sur arXiv (2610.03797, version 2), est un « harness » agentique qui accélère l'inférence des World Action Models (WAM). Ces modèles réutilisent des modèles de fondation vidéo pré-entraînés pour la manipulation robotique, en prédisant conjointement la vidéo future et les actions. Ce couplage et la taille des backbones rendent l'inférence coûteuse. Le harness dote des agents de code de consignes d'optimisation réutilisables et d'outils de mesure et de validation. L'agent suit un flux piloté par les goulots d'étranglement : il profile l'inférence, modifie le code ciblé, valide les effets, puis affine la pile d'accélération à mesure que les goulots se déplacent, sans dégrader la qualité des actions. Les expériences couvrent six WAM, trois agents de code et deux architectures de GPU. WAMJET atteint jusqu'à 9,95x d'accélération sans perte par rapport aux implémentations amont. Des optimisations par approximation et adaptées au matériel réduisent encore la latence, avec des taux de succès comparables. Ce travail s'attaque à un frein concret du déploiement des WAM : leurs latences d'inférence. Les techniques d'accélération existent déjà (quantification, distillation, réduction du nombre de pas de diffusion, optimisation des noyaux), mais choisir et composer celles qui conviennent à chaque modèle et à chaque plateforme matérielle demande un travail d'ingénierie lourd et répété. En automatisant cette étape avec des agents de code, les auteurs proposent de la traiter comme un problème d'optimisation outillé plutôt que comme du sur-mesure. Pour un intégrateur ou une équipe qui porte un WAM sur un robot réel, le gain de latence conditionne la fréquence de contrôle atteignable. Le résultat suggère aussi que les implémentations amont des WAM laissent beaucoup de performance inexploitée. Le chiffre de 9,95x est un maximum, obtenu sur le meilleur cas, et non une moyenne. L'extrait disponible ne détaille ni les latences absolues ni la liste des six modèles, ce qui limite la lecture de ce chiffre. La mention de taux de succès « comparables » pour les variantes approximatives demande à être vérifiée sur des tâches physiques variées, et pas seulement sur des benchmarks. Cette approche s'inscrit dans deux tendances. La première est la montée des modèles d'action fondés sur la vidéo, qui héritent de la qualité des modèles vidéo génératifs, mais aussi de leur coût de calcul, par opposition aux VLA classiques, plus légers. La seconde est l'usage d'agents de code pour optimiser des systèmes, sur le modèle de l'ingénierie assistée de noyaux GPU. Les travaux concurrents sur l'accélération des VLA, comme les politiques à flow matching ou à diffusion réduite en pas, visent le même objectif de contrôle temps réel, mais sans automatiser la composition des techniques. La suite logique est une validation sur robots physiques et sur davantage de plateformes, notamment embarquées, où les contraintes de calcul sont les plus fortes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
UniWAM : modèle unifié du monde et de l'action
3arXiv cs.RO 

UniWAM : modèle unifié du monde et de l'action

UniWAM, présenté sur arXiv (2610.02054, première version), est une architecture unifiée qui combine trois blocs : un « raisonneur physique » issu d'un modèle vision-langage préentraîné, un générateur de monde (vidéo) et un prédicteur d'actions. L'ensemble apprend conjointement la compréhension sémantique du monde physique, la génération visuelle et la prédiction d'actions. Les auteurs ont construit un pipeline de nettoyage et d'annotation pour les données égocentriques humaines et les données robot. Les actions bas niveau sont exprimées en langage naturel, afin de préserver les capacités linguistiques du modèle de base. Le préentraînement répartit les supervisions entre composants : VQA (questions-réponses visuelles), vidéos égocentriques humaines et démonstrations robot. Au post-entraînement, une augmentation par bruit visuel sur le futur réduit la dépendance à des prédictions précises, et un flow matching conditionné par l'historique d'actions initialise la génération d'actions. Selon les auteurs, cela réduit nettement le nombre d'étapes de débruitage sans perte de performance. Ils revendiquent l'état de l'art en performance in-distribution, robustesse, généralisation, suivi d'instructions et tâches longues. Le résumé ne donne ni chiffres ni noms de benchmarks. L'intérêt est de s'attaquer à un compromis connu. Les modèles VLA (vision-langage-action) héritent du raisonnement des VLM, mais une supervision limitée aux actions leur donne peu d'ancrage dans la dynamique physique. À l'inverse, les modèles monde-action, bâtis sur la génération vidéo, captent bien les régularités spatio-temporelles mais comprennent et raisonnent moins bien hors distribution. Unifier les deux dans un seul modèle est une réponse directe à ce problème de robustesse, qui compte pour les intégrateurs confrontés au fossé entre démo et déploiement. La réduction des étapes de débruitage compte aussi pour la latence de contrôle, point faible des approches fondées sur la vidéo. Le résultat le plus transposable est la loi d'échelle log-linéaire du co-entraînement humain-robot. Si elle se confirme, elle soutient l'idée que les vidéos humaines, bien moins chères que la téléopération, peuvent servir de levier de données. Prudence toutefois : il s'agit d'un préprint non évalué par les pairs, sans test annoncé sur robot en production. Ce travail s'inscrit dans la course entre VLA (Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure) et modèles monde-action, qui exploitent la génération vidéo pour la planification. Il prolonge aussi la tendance à exploiter les données égocentriques humaines pour pallier la rareté des démonstrations robot. Le résumé ne cite ni équipe, ni plateforme robotique, ni calendrier de publication du code ou des poids. Il faudra donc attendre le texte complet pour juger du protocole, de la comparaison avec les références et de la validation sur matériel réel.

RecherchePaper
1 source
OpenWAM : un cadre ouvert pour des modèles monde-action composables
4arXiv cs.RO 

OpenWAM : un cadre ouvert pour des modèles monde-action composables

OpenWAM est un cadre open source de modèles monde-action (WAM, world-action models), ces systèmes qui couplent la prédiction vidéo du futur au contrôle d'un robot. Les auteurs partent de Wan2.2-5B, un modèle de génération vidéo de 5 milliards de paramètres, qu'ils pré-entraînent de façon causale sur plus de 10 000 heures de vidéo robotique. Ils y greffent un « expert d'action » via une architecture Mixture-of-Transformers partagée. Celle-ci permet quatre modes de génération : conjointe, vidéo puis action, action puis vidéo, et découplée. Sur les quatre suites du benchmark de simulation LIBERO, le système obtient des taux de réussite élevés, de même que sur des tâches bimanuelles réelles dont l'abstract ne détaille ni le nombre ni les conditions. L'adaptation causale conjuguée à l'entraînement sur vidéo robotique fait passer le taux de réussite en mode vidéo puis action sur LIBERO-Long de 68,4 % à 97,8 %. L'apport principal tient à la méthode plus qu'à un score. Les WAM existants changent simultanément de backbone vidéo, de structure d'interaction, de supervision et de procédure d'inférence, ce qui empêche d'attribuer un gain à un choix de conception précis. OpenWAM fournit un banc d'essai commun où l'on ne modifie qu'un paramètre à la fois. Les résultats sur la dynamique sont les plus intéressants pour les équipes qui cherchent à réduire leur dépendance aux démonstrations coûteuses. Quand seul le prédicteur vidéo est adapté à une nouvelle tâche, un modèle de dynamique inverse gelé, à contexte local, entraîné sur des transitions contrefactuelles et des démonstrations, atteint 84,0 % de réussite moyenne sur quatre tâches LIBERO-90 jamais vues. Le même modèle entraîné sur les seules démonstrations plafonne à 21,5 %, et une version à contexte complet atteint 47,0 %. En dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et fait passer l'identification du bon résultat de 21,1 % à 71,3 % parmi 16 issues partant du même état. Ces chiffres viennent de LIBERO, un benchmark simulé et saturé, et d'un article non encore évalué par des pairs : ils ne disent rien du fossé entre démonstration et déploiement industriel. Ce travail s'inscrit dans la montée des politiques fondées sur la vidéo, qui font concurrence aux modèles vision-langage-action (VLA) classiques comme Pi-0 ou GR00T. Leur promesse est de tirer parti de la grande quantité de vidéo disponible, au-delà des seules démonstrations réussies. Wan2.2 sert ici de socle, ce qui illustre la réutilisation des modèles vidéo génératifs ouverts en robotique. Le cadre est publié sous le numéro arXiv 2610.07922, en version 1, et l'abstract ne mentionne aucun pilote industriel ni calendrier de déploiement. La suite logique serait une validation sur davantage de tâches réelles, avec des comparaisons à poids de calcul équivalent contre les VLA établis.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source