Aller au contenu principal
RecherchearXiv cs.RO 

GlanceWAM : imagination parcimonieuse au moment du test pour les modèles monde-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv GlanceWAM, une architecture de « world-action model » (WAM) qui sépare l'imagination visuelle du contrôle moteur sur un unique backbone vidéo de type DiT (Diffusion Transformer) partagé. Un module « proposeur » asynchrone tourne sur une horloge lente et génère en arrière-plan une seule image d'anticipation, projetée à quelques secondes dans le futur. En parallèle, une tête d'action décode des « chunks » d'actions au rythme du contrôle, soit 48 ms par chunk sur un seul GPU A100, entièrement dans l'espace latent et sans attendre la génération vidéo. Deux mécanismes rendent cela possible : un masque d'attention « non interférant » qui isole les représentations vidéo de celles de l'action, et un entraînement robuste à la péremption, qui prépare le modèle à exploiter une anticipation devenue légèrement ancienne. Entraîné uniquement sur démonstrations, le modèle atteint 72,2 % de réussite sur le benchmark RoboCasa (24 tâches de cuisine), contre 67,1 % pour Cosmos Policy en mode synchrone, et 99,0 % sur LIBERO. La latence par chunk est divisée par 24 par rapport aux WAM synchrones. En manipulation réelle, mono-bras et bimanuelle, il dépasse en moyenne π0.5 sans aucun pré-entraînement sur données robot. Le code est publié sur GitHub.

L'enjeu est un compromis que les WAM n'avaient pas résolu. Générer de la vidéo à la fréquence de contrôle est trop lent pour un robot réel, alors que supprimer l'imagination au moment de l'inférence coûte en taux de réussite. Ici, les deux gains arrivent ensemble : l'anticipation sert de signal de guidage sans se trouver sur le chemin critique. Pour un intégrateur, cela rend plausible l'usage de priors issus de modèles vidéo sur du matériel standard, sans grappe de GPU dédiée au contrôle. Le résultat contredit aussi l'idée que la prédiction visuelle fine, image par image, serait nécessaire : une seule image future, consommée en latent, suffit. Quelques réserves s'imposent toutefois. Les chiffres viennent de benchmarks de simulation, où l'écart de 5 points avec Cosmos Policy reste modeste, et LIBERO est quasi saturé. Les essais réels, dont la taille n'est pas précisée dans le résumé, n'ont pas été validés indépendamment. Il s'agit d'un travail académique, pas d'un produit déployé.

Ce travail s'inscrit dans la montée des modèles monde-action, qui réutilisent les modèles de génération vidéo pour doter les politiques robotiques d'une intuition physique. Cosmos Policy, de NVIDIA, en est la référence synchrone, et π0.5, de Physical Intelligence, représente la famille des VLA (vision-language-action) entraînés à grande échelle sur données robot. Le fait de battre π0.5 sans pré-entraînement robot suggère que les modèles vidéo pré-entraînés peuvent compenser en partie le manque de données de manipulation, un point sensible alors que ces corpus restent coûteux. La suite logique est de valider l'approche sur des tâches plus longues et sur d'autres plateformes, notamment les humanoïdes. Le code ouvert devrait permettre à d'autres équipes de reproduire et de contester ces résultats rapidement.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
1arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action
2arXiv cs.RO 

ActiveWAM : vision active tenant compte des preuves pour les modèles monde-action

Des chercheurs publient ActiveWAM, un modèle unifié « monde-action » (world-action model) destiné à la manipulation à vision active, c'est-à-dire des politiques qui pilotent à la fois les effecteurs et la caméra. Le système génère des actions bimanuelles et des mouvements pan/tilt, y compris des comportements de maintien du point de vue (« stay ») et de réacquisition, à partir d'un historique tenant compte des vues, puis met à jour son contexte avec les nouvelles images RGB mesurées. Il est entraîné par une « inversion au moment de l'entraînement » (training-time inversion), qui contraint un prior vidéo figé par les preuves visuelles de la tâche et les changements temporels visibles. Cela supprime l'inversion au test et le classement de candidats. La prédiction de vidéo future sert de signal de co-entraînement, mais la génération d'actions n'exige ni décodage vidéo futur ni annotation de point de vue optimal. L'équipe introduit aussi RoboTwin-AV, un benchmark de 50 tâches avec contrôle pan/tilt exécutable et démonstrations générées automatiquement. ActiveWAM gagne jusqu'à 17,0 points de pourcentage de réussite hors distribution sur TAVIS face aux meilleures références. Il devance Fast-WAM de 20,0 points sur RoboTwin-AV et de 26,7 points sur des tâches physiques de cuisine en conditions réelles. L'intérêt tient à la manière dont le travail formalise un problème souvent traité de façon empirique. Bouger la caméra pour acquérir une nouvelle vue peut écarter du champ des indices critiques pour la tâche, tandis que conserver la vue perd des observations potentiellement utiles. Poser ce compromis « garder ou acquérir » comme un problème de gestion des preuves, appris conjointement avec la manipulation, évite de recourir à des heuristiques de recherche de vue ou à du classement de candidats coûteux à l'exécution. Le fait que l'action se génère sans décoder la vidéo future réduit aussi la charge de calcul au déploiement, un point sensible pour les intégrateurs. Les gains réels de 26,7 points sont notables, mais ils portent sur des tâches de cuisine dont le nombre et la diversité ne sont pas précisés dans le résumé. Le benchmark étant introduit par les mêmes auteurs, la comparaison reste à confirmer par des évaluations indépendantes. Ce travail s'inscrit dans l'essor des modèles monde-action, qui exploitent des priors vidéo pré-entraînés pour guider le contrôle, avec Fast-WAM comme principale référence ici. La plupart des politiques de manipulation actuelles supposent une caméra fixe ou montée sur la tête, et ne contrôlent pas activement la vue. Le benchmark RoboTwin-AV prolonge l'écosystème RoboTwin en y ajoutant le contrôle de caméra, ce qui pourrait servir de base commune à d'autres équipes. Il s'agit d'une publication de recherche, sans produit, déploiement industriel ni calendrier commercial annoncés. Les prochaines étapes naturelles seraient des tests sur davantage de plateformes, des environnements moins structurés que la cuisine, et une intégration avec les grands modèles VLA du secteur.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Guidage sensible à l'achèvement pour les modèles du monde et d'action
3arXiv cs.RO 

Guidage sensible à l'achèvement pour les modèles du monde et d'action

Des chercheurs publient sur arXiv (2610.01559) une méthode baptisée Completion Aware Guidance (CAG), destinée aux World Action Models (WAMs). Ces modèles prédisent à la fois les futurs visuels et les actions du robot. Le travail cible un défaut précis, l'« imagination incomplète » : le modèle produit des prédictions plausibles et cohérentes avec les actions, mais qui omettent la transition nécessaire pour terminer la tâche. CAG est une méthode d'échantillonnage sans entraînement supplémentaire, qui oriente la génération vers l'achèvement de la tâche. Sur plusieurs WAMs représentatifs, le taux de succès passe de 64 % à 70 % sur un sous-ensemble de RoboTwin 2.0, et de 69 % à 75 % en simulation zéro-shot. La part d'imagination incomplète tombe de 79 % à 40 %. Les résultats portent sur des benchmarks simulés. L'article ne mentionne ni test sur robot réel, ni déploiement. L'intérêt tient d'abord au diagnostic. Selon les auteurs, l'échec ne vient pas de l'architecture du modèle du monde. Il apparaît quand ce modèle est adapté au contrôle par segments courts (short-chunk control). Dans ce régime, le modèle favorise de façon répétée des prolongements locaux plausibles plutôt que les transitions qui achèvent la tâche. Pour les équipes qui construisent des politiques VLA ou des WAMs, cela signale qu'une partie des échecs en manipulation vient de la procédure d'échantillonnage et d'adaptation, pas d'un manque de capacité du modèle de base. Corriger cela à l'inférence, sans réentraînement, est peu coûteux. Il faut toutefois relativiser : un gain de 6 points de succès reste modeste, et le chiffre le plus net, 79 % à 40 %, mesure un défaut défini par les auteurs eux-mêmes. Il ne se traduit pas directement en fiabilité industrielle. Ce travail s'inscrit dans l'essor des modèles qui apprennent à prédire l'avenir visuel pour guider l'action. L'approche est une alternative aux VLA purement réactifs, comme Pi-0 ou Helix. Elle est aussi un complément aux efforts de modèles du monde généralistes, tels que GR00T. RoboTwin 2.0 sert de banc d'essai standard pour la manipulation bimanuelle en simulation. Il reste donc à voir si le gain tient sur matériel réel, avec ses latences, son bruit de perception et ses contraintes de temps de cycle. Les auteurs n'annoncent pas de calendrier de validation physique. L'article n'évoque aucun acteur français ou européen.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
4arXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique. L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées. Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source