Aller au contenu principal
EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action
RecherchearXiv cs.RO 

EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent EVO-WAM, un cadre d'adaptation de « world action models » (WAM) à des tâches inédites, sans nouvelle démonstration d'expert et sans exécuter les actions candidates dans un environnement externe. Un WAM exploite des priors vidéo à grande échelle pour prédire conjointement les vidéos futures et les actions. Le système repose sur trois briques. D'abord, l'entraînement du WAM est enrichi d'une prédiction d'état et d'un contexte multi-images ancré, ce qui permet des déroulés autorégressifs complets sans retour d'exécution. Ensuite, un modèle vision-langage sélectionne les préfixes de trajectoires où la tâche est accomplie, puis un modèle de dynamique inverse vérifie la cohérence entre vidéo et actions. Enfin, le WAM est réentraîné de façon itérative sur ces préfixes vérifiés, et de nouveaux déroulés sont générés avec le modèle mis à jour. Sur sept tâches inédites de RoboTwin 2.0, le taux de succès moyen de Cosmos3 passe de 26,9 % à 68,0 % (environ 2,5 fois), et celui de DreamZero de 28,5 % à 46,4 % (environ 1,6 fois). Sur trois tâches composites à long horizon en conditions réelles, Cosmos3 passe de 20,0 % à 76,7 %, soit un gain de 56,7 points.

L'enjeu porte sur le goulot d'étranglement des démonstrations. Collecter des données d'experts par téléopération reste la principale dépense pour déployer une politique sur une nouvelle tâche. Ici, le modèle génère lui-même sa supervision, filtrée par deux vérificateurs indépendants. Le filtre par dynamique inverse cible un mode d'échec connu des WAM : une vidéo qui semble réussie peut être associée à des actions incompatibles avec elle, ce qui produit un échec à l'exécution. Le résultat suggère que l'auto-amélioration sans interaction avec l'environnement devient praticable pour ces modèles, ce qui réduirait le coût d'adaptation par tâche pour les intégrateurs. Il faut toutefois nuancer. Les gains simulés sont mesurés sur sept tâches. Le test réel ne compte que trois tâches, et le papier ne détaille pas ici le nombre d'essais, ce qui rend l'écart de 56,7 points sensible au bruit statistique. Le point de départ de 20 % en réel est aussi bas. Le papier est un preprint arXiv, non évalué par les pairs, sans déploiement industriel.

Ce travail s'inscrit dans la montée des modèles monde et des politiques vision-langage-action (VLA). Ces derniers prédisent des actions directement, tandis que les WAM ajoutent une prédiction vidéo issue de modèles génératifs pré-entraînés. Cosmos3 et DreamZero servent ici de bases, et la méthode s'applique donc à plusieurs architectures. Les approches concurrentes d'amélioration sans démonstration reposent surtout sur l'apprentissage par renforcement en environnement réel ou simulé, plus coûteux en temps robot ou en fidélité de simulation. Le benchmark RoboTwin 2.0, en simulation bimanuelle, sert de référence commune. Les prochaines étapes probables sont des tests sur davantage de tâches réelles, des embodiments variés et des vérificateurs plus fiables, car la qualité du modèle vision-langage et du modèle de dynamique inverse borne ce que la boucle peut apprendre. Une page projet est disponible, mais aucun calendrier de produit n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Faire évoluer un modèle vision-langage-action en agent capable d'utiliser des outils à la volée
1arXiv cs.RO 

Faire évoluer un modèle vision-langage-action en agent capable d'utiliser des outils à la volée

Des chercheurs présentent ART (Agentic Robot with Tool-use), un framework décrit dans un preprint arXiv (2608.14047v1) qui transforme un modèle Vision-Language-Action (VLA) existant en agent capable d'invoquer a la volée des modules outils prêts a l'emploi pour la vision bas niveau, l'estimation d'affordance haut niveau et l'adaptation a l'embodiment du robot. Plutot que de générer directement des actions continues sur tout l'espace de solutions comme le font les VLA classiques, ART réduit cet espace via l'usage d'outils, ce qui améliore la généralisation entre taches et limite la dépendance aux données. L'équipe a constitue un jeu de 30 000 trajectoires d'usage d'outils et de démonstrations, nettement plus réduit que les jeux de données des méthodes de référence, avec un protocole d'entrainement pour le raisonnement sur des trajectoires longues en environnements difficiles. Resultat: un taux de réussite supérieur de 20% aux baselines dominantes, en simulation comme sur des taches réelles de pick-and-place dans l'obscurité a des points de vue inédits. Ce résultat cible deux limites récurrentes des VLA de bout en bout: le besoin de volumes de données toujours plus massifs pour généraliser, et la fragilité des politiques continues face a des scènes inédites (éclairage, angle de vue). En montrant qu'une architecture modulaire, ou le modèle délégué certaines sous-taches a des outils spécialisés plutôt que de tout apprendre dans un seul réseau, réduit la taille du jeu de données nécessaire tout en améliorant la robustesse, ART alimente un débat clé pour les intégrateurs: continuer a scaler des VLA monolithiques comme Pi-0 ou GR00T N2, ou investir dans des couches agentiques orchestrant des outils existants pour un déploiement plus léger. ART s'inscrit dans une tendance qui importe en robotique les techniques de raisonnement agentique déjà éprouvées sur les grands modèles de langage, ou un agent alterne planification et appels d'outils externes plutôt que de tout résoudre en un seul passage. Le travail reste a ce stade un preprint de recherche: aucune date de mise en production, aucun partenaire industriel ni volume de déploiement n'est communique par les auteurs. Il s'ajoute aux efforts de laboratoires développant Pi-0, GR00T ou Helix, qui cherchent tous a rendre les VLA plus généralistes sans multiplier indéfiniment les données d'entrainement, un enjeu suivi de près par les intégrateurs européens du secteur logistique et industriel.

UEAucun acteur ni déploiement européen n'est impliqué, mais la piste intéresse les intégrateurs logistiques et industriels européens qui cherchent des VLA moins gourmands en données.

RechercheActu
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
2arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
3arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source
DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
4arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source