Aller au contenu principal
RecherchearXiv cs.RO 

MiniWAM : apprendre des cibles futures compactes pour une modélisation monde-action efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent MiniWAM, un modèle « monde-action » (World Action Model, ou WAM) de 0,25 milliard de paramètres. Il prédit conjointement les actions d'un robot et une représentation compacte de l'état futur, au lieu des caractéristiques visuelles natives d'un encodeur pré-entraîné. Les WAM actuels prédisent généralement l'avenir dans l'espace de représentation de ces encodeurs, ce qui donne des cibles de grande dimension et coûteuses à entraîner. MiniWAM réduit le nombre de tokens de caractéristiques futures de 65 fois par rapport à une prédiction native, avec DINOv3 comme avec le VAE de WAN2.1. Les auteurs annoncent aussi un entraînement jusqu'à 8 fois plus rapide. Ces cibles compactes viennent d'un encodeur baptisé PRISM (Predictive Representations via Inverse Spatiotemporal Modeling). Il est appris sur des transitions privilégiées entre l'état courant et l'état futur. Il combine une supervision par dynamique inverse, qui cherche à retrouver l'action ayant produit la transition, et une reconstruction des caractéristiques. Une fois PRISM gelé, MiniWAM apprend à prédire ces cibles et les actions à partir des seules observations courantes. Les résultats sont donnés sur les benchmarks de simulation LIBERO, LIBERO-Plus et RoboTwin 2.0. Selon les auteurs, MiniWAM y surpasse systématiquement la prédiction de caractéristiques natives et reste compétitif face à des WAM nettement plus gros.

Pour les équipes qui entraînent des politiques robotiques, le résultat est surtout économique. L'hypothèse implicite de nombreux WAM veut que le co-entraînement par prédiction du futur exige de reconstruire ou prédire des représentations visuelles riches, donc de gros budgets de calcul. Ici, une cible bien choisie, qui retient l'information utile au contrôle plutôt que les détails de pixels ou de textures, donne de meilleurs résultats pour beaucoup moins de calcul. L'analyse des représentations va dans le même sens : PRISM apporterait une structure comportementale que la seule reconstruction de caractéristiques n'apporte pas. Une précaution s'impose. Toutes les évaluations citées sont en simulation, et rien n'indique de transfert sur robot réel, de temps de cycle ou de déploiement. Le taux de réussite sur des benchmarks déjà bien étudiés ne dit pas non plus comment la méthode se comporte en environnement non structuré. Le gain de 8 fois porte sur l'entraînement du modèle monde-action, pas sur la latence d'inférence.

Ces travaux s'inscrivent dans la montée des WAM, qui ont fait du modèle du monde un objectif de co-entraînement pour les politiques vision-langage-action (VLA). Cette approche concurrence les VLA purement réactifs, qui ne prédisent que l'action. Les WAM plus lourds restent la référence de comparaison, avec des dizaines de fois plus de paramètres. À 0,25B, MiniWAM vise un créneau plus accessible aux laboratoires universitaires et aux équipes à budget GPU limité. Le papier est une prépublication arXiv (v1), non relue par des pairs, et une page de projet accompagne le travail. La suite logique serait une validation sur matériel réel et une comparaison avec des politiques déjà déployées. Sans ces tests, l'efficacité observée en simulation ne garantit pas encore une valeur industrielle.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace
1arXiv cs.RO 

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace

Des chercheurs publient sur arXiv (2610.02120) SkeleWAM, un modèle « world action » (WAM) compact pour la manipulation robotique. Un WAM combine la génération d'actions du robot avec la prédiction d'états futurs. La plupart des WAM existants prédisent des vidéos ou des latents visuels appris. Le nouveau modèle représente plutôt la scène sous la forme d'un squelette 3D épars, composé des articulations du robot, des centres d'objets et de points d'interaction. Ce squelette est construit en ligne à partir des images RGB-D courantes et de la proprioception du robot. Il sert d'état géométrique unique pour générer les actions et prédire les squelettes futurs, ce qui apporte une supervision géométrique supplémentaire sans reconstruction visuelle. À l'inférence, le modèle produit les actions directement depuis le squelette courant et l'instruction en langage naturel. Une stratégie auxiliaire, Medoid Action Consensus (MAC), sélectionne parmi plusieurs échantillons d'actions stochastiques un consensus représentatif. Sur le benchmark LIBERO-Plus, SkeleWAM atteint 85,9 % de réussite globale avec 57,1 millions de paramètres, soit 3,7 points de plus que Cosmos-Policy. L'intérêt tient au compromis entre performance et taille. Les WAM fondés sur la vidéo ou sur des latents visuels portent des informations d'apparence sans rapport avec le contrôle et ne codent la géométrie d'interaction qu'implicitement. Avec 57,1 M de paramètres, SkeleWAM se situe très en dessous des modèles de fondation de type VLA, qui comptent en général plusieurs milliards de paramètres. Si l'approche tient hors benchmark, elle ouvre la voie à des politiques embarquables sur du calcul modeste, un point décisif pour les intégrateurs qui visent des cellules industrielles sans GPU lourd. Elle suggère aussi qu'un état structuré, centré sur les relations robot-objet, peut suffire à remplacer la prédiction de pixels. Des réserves s'imposent : LIBERO-Plus est un benchmark en simulation, qui évalue la robustesse à des perturbations, et l'écart de 3,7 points reste modeste. Aucun test sur robot réel n'est mentionné dans le résumé. Enfin, la construction du squelette suppose une perception RGB-D fiable, ce qui déplace une partie de la difficulté vers l'estimation des centres d'objets et des points d'interaction en conditions réelles. SkeleWAM s'inscrit dans la montée des world action models, qui cherchent à marier politique et modèle du monde, avec Cosmos-Policy comme référence directe de la comparaison. La tendance dominante a consisté à prédire des vidéos futures, coûteuses en calcul. Les travaux récents explorent des représentations plus sobres, géométriques ou latentes, pour réduire ce coût. Les auteurs publient une page de projet (skelewam-project.github.io). La suite logique serait une validation sur matériel réel, sur des tâches variées et dans des environnements encombrés, ainsi qu'une comparaison avec les grands VLA sur des benchmarks complémentaires. Il s'agit pour l'instant d'une préimpression, sans produit ni déploiement associé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
MoWAM : prédiction explicite du mouvement futur pour des modèles monde-action efficaces
2arXiv cs.RO 

MoWAM : prédiction explicite du mouvement futur pour des modèles monde-action efficaces

Un nouveau papier de recherche publié sur arXiv (référence 2609.20709v1) présente MoWAM, un modèle d'action du monde, ou World Action Model (WAM), destiné à l'apprentissage de politiques robotiques pour la manipulation. Contrairement aux WAM classiques qui génèrent explicitement des vidéos du futur pendant l'inférence pour anticiper la dynamique de l'environnement, ce qui alourdit considérablement le calcul, MoWAM remplace cette génération vidéo par une prédiction explicite du mouvement futur du robot. Le système repose sur une architecture Mixture-of-Transformer qui apprend la dynamique visuelle future pendant l'entraînement tout en prédisant conjointement mouvement et action, ce qui permet de supprimer entièrement la génération vidéo au moment de l'inférence tout en conservant une représentation explicite du futur. Les auteurs ont évalué le modèle sur les bancs d'essai de simulation LIBERO et LIBERO-Plus ainsi que sur des tâches de manipulation en conditions réelles. Le papier s'attaque à un compromis classique du secteur: retirer la génération vidéo future accélère l'inférence, mais risque de ne laisser la dynamique future qu'implicitement encodée dans les caractéristiques d'observation, ce qui fragilise les politiques face aux changements de distribution, un problème central pour tout intégrateur déployant un robot hors du cadre exact de son entraînement. En modélisant le mouvement comme une abstraction compacte du futur, MoWAM revendique une performance solide en distribution, une robustesse accrue hors distribution, et un taux de succès moyen supérieur en conditions réelles face à des WAM de référence. Point notable pour la mise à l'échelle au moment de l'inférence: la représentation compacte du mouvement permet d'échantillonner plusieurs candidats de paires mouvement-action et de les départager via un vérificateur de progression de tâche, avec des gains de performance croissants à mesure que davantage de candidats sont explorés, un signal que l'inférence-time scaling, déjà exploité pour les grands modèles de langage, commence à trouver une traduction concrète en robotique manipulatrice. MoWAM s'inscrit dans la lignée des World Action Models, qui enrichissent l'apprentissage de politiques robotiques d'une anticipation de la dynamique future, en complément des approches vision-langage-action plus directes. Il s'agit ici d'une contribution de recherche évaluée sur des bancs d'essai standards et un nombre limité de tâches réelles, sans acteur industriel, calendrier de déploiement, coûts ni volumes annoncés. L'argument central, à savoir qu'une modélisation explicite mais compacte du mouvement futur peut remplacer la coûteuse génération vidéo sans sacrifier la robustesse, mérite d'être suivi à mesure que des équipes tenteront de le reproduire sur des politiques robotiques destinées à la production plutôt qu'à la démonstration.

RechercheOpinion
1 source
OpenWAM : un cadre ouvert pour des modèles monde-action composables
3arXiv cs.RO 

OpenWAM : un cadre ouvert pour des modèles monde-action composables

OpenWAM est un cadre open source de modèles monde-action (WAM, world-action models), ces systèmes qui couplent la prédiction vidéo du futur au contrôle d'un robot. Les auteurs partent de Wan2.2-5B, un modèle de génération vidéo de 5 milliards de paramètres, qu'ils pré-entraînent de façon causale sur plus de 10 000 heures de vidéo robotique. Ils y greffent un « expert d'action » via une architecture Mixture-of-Transformers partagée. Celle-ci permet quatre modes de génération : conjointe, vidéo puis action, action puis vidéo, et découplée. Sur les quatre suites du benchmark de simulation LIBERO, le système obtient des taux de réussite élevés, de même que sur des tâches bimanuelles réelles dont l'abstract ne détaille ni le nombre ni les conditions. L'adaptation causale conjuguée à l'entraînement sur vidéo robotique fait passer le taux de réussite en mode vidéo puis action sur LIBERO-Long de 68,4 % à 97,8 %. L'apport principal tient à la méthode plus qu'à un score. Les WAM existants changent simultanément de backbone vidéo, de structure d'interaction, de supervision et de procédure d'inférence, ce qui empêche d'attribuer un gain à un choix de conception précis. OpenWAM fournit un banc d'essai commun où l'on ne modifie qu'un paramètre à la fois. Les résultats sur la dynamique sont les plus intéressants pour les équipes qui cherchent à réduire leur dépendance aux démonstrations coûteuses. Quand seul le prédicteur vidéo est adapté à une nouvelle tâche, un modèle de dynamique inverse gelé, à contexte local, entraîné sur des transitions contrefactuelles et des démonstrations, atteint 84,0 % de réussite moyenne sur quatre tâches LIBERO-90 jamais vues. Le même modèle entraîné sur les seules démonstrations plafonne à 21,5 %, et une version à contexte complet atteint 47,0 %. En dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et fait passer l'identification du bon résultat de 21,1 % à 71,3 % parmi 16 issues partant du même état. Ces chiffres viennent de LIBERO, un benchmark simulé et saturé, et d'un article non encore évalué par des pairs : ils ne disent rien du fossé entre démonstration et déploiement industriel. Ce travail s'inscrit dans la montée des politiques fondées sur la vidéo, qui font concurrence aux modèles vision-langage-action (VLA) classiques comme Pi-0 ou GR00T. Leur promesse est de tirer parti de la grande quantité de vidéo disponible, au-delà des seules démonstrations réussies. Wan2.2 sert ici de socle, ce qui illustre la réutilisation des modèles vidéo génératifs ouverts en robotique. Le cadre est publié sous le numéro arXiv 2610.07922, en version 1, et l'abstract ne mentionne aucun pilote industriel ni calendrier de déploiement. La suite logique serait une validation sur davantage de tâches réelles, avec des comparaisons à poids de calcul équivalent contre les VLA établis.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
4arXiv cs.RO 

WAM-Cache : réutilisation du cache KV à obsolescence bornée pour des modèles du monde et d'action efficaces

Des chercheurs publient WAM-Cache, un cadre d'accélération sans entraînement pour les World Action Models (WAMs). Ces modèles de manipulation généraliste conditionnent un « action expert » sur les représentations d'un Diffusion Transformer (DiT) vidéo préentraîné. En boucle fermée, ce DiT vidéo s'exécute à chaque « chunk » d'actions. Il encode l'observation courante en paires clé-valeur (KV) par couche, que l'action expert interroge ensuite. Ce préremplissage (prefill) domine le coût de calcul par chunk, et les accélérations existantes sans entraînement le laissent entièrement dense. WAM-Cache conserve les représentations KV d'un chunk à l'autre et ne recalcule qu'un sous-ensemble épars de tokens. Sur Fast-WAM, le prefill du DiT vidéo perd 32 à 42 % de FLOPs sur RoboTwin 2.0, LIBERO et en expérimentation réelle. La perte reste de 0,7 à 1,8 point de pourcentage par rapport à la politique dense en simulation, et de 2,5 points sur robot réel. Il s'agit d'un résultat de recherche (preprint arXiv), sans produit ni déploiement industriel associé. L'enjeu tient à la méthode de sélection autant qu'au gain de calcul. Les auteurs montrent que l'heuristique intuitive, qui rafraîchit les tokens ayant visuellement bougé, plafonne nettement sous la politique dense, même avec un oracle qui prédirait la dérive réelle des KV. La précision des actions dépend de l'endroit où l'action expert porte son attention, pas de ce qui a changé dans l'image. Cela compte pour quiconque cherche à faire tourner des politiques fondées sur la vidéo en temps réel sur du matériel embarqué, où la latence et la consommation limitent le déploiement. Un gain de 32 à 42 % sur la partie dominante du coût est utile, mais il reste modeste et ne fait pas à lui seul passer ces modèles à l'échelle industrielle. Les chiffres portent sur Fast-WAM et sur des benchmarks de simulation, plus une évaluation réelle dont l'ampleur n'est pas précisée dans le résumé. Le coût de 2,5 points en réel est plus élevé qu'en simulation et mérite d'être vérifié sur des tâches plus variées. WAM-Cache sélectionne l'ensemble de rafraîchissement en combinant la cross-attention de l'action expert et la « surprise latente » visuelle. Une borne stricte d'âge limite l'accumulation d'erreurs : un token ne peut pas rester périmé au-delà d'un seuil. Le travail s'inscrit dans la tendance des WAMs, qui exploitent les priors de dynamique des modèles vidéo pour piloter la manipulation, face aux VLA plus classiques comme Pi-0 ou GR00T. Il prolonge aussi les techniques de cache KV et de réutilisation de calcul connues pour les LLM et les DiT, ici adaptées à un contrôle en boucle fermée. Comme la méthode ne demande aucun réentraînement, elle peut en principe s'appliquer à d'autres WAMs. Cela reste à démontrer, car les résultats publiés ne concernent que Fast-WAM. Aucune date de code ou de publication de modèle n'est mentionnée.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source