Aller au contenu principal
RecherchearXiv cs.RO 

ACG-WAM : modélisation monde-action par prédiction latente géométrique conditionnée par l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'équipe RoboOpus publient ACG-WAM, un modèle « monde-action » (World Action Model, WAM) qui apprend conjointement la prédiction visuelle et les actions du robot. Le travail ajoute un objectif auxiliaire baptisé ACG-JEPA (Action-Conditioned Geometric Joint-Embedding Predictive Architecture). À partir de l'observation courante et des actions intermédiaires, il prédit des caractéristiques géométriques à plusieurs horizons temporels. La cible vient d'un encodeur VGGT gelé, dont on utilise le « slot futur » pour chaque paire d'images courante et future. La supervision s'applique aux caméras tête et poignet, sur un embedding visuel partagé placé avant le mélange temporel. Le teacher et les modules auxiliaires sont retirés à l'inférence, donc le coût d'exécution ne change pas. Sur 50 tâches RoboTwin 2.0, ACG-WAM atteint 93,46 % de succès en scènes propres. Il obtient le meilleur score en scènes randomisées (92,68 %) et la meilleure moyenne sur les deux réglages (93,07 %) parmi les méthodes comparées. Sur robot réel, avec trois tâches, il atteint 85,00 % de succès et 91,67 % de score de complétion partielle. Il dépasse Motus de 10,00 et 9,17 points de pourcentage. Le code et un site de projet sont publiés.

Les WAM entraînent leurs pertes vidéo et action sans cible explicite pour les conséquences géométriques d'une séquence d'actions démontrée. Le modèle peut donc prédire des pixels plausibles sans bien représenter ce que le geste a changé dans l'espace 3D. Les auteurs relèvent aussi un défaut de conception : les features visuelles prises après l'attention temporelle peuvent contenir des informations sur le futur. Elles ne conviennent donc pas comme seule entrée visuelle courante d'un prédicteur auxiliaire. Le choix de supervision avant le mélange temporel répond à cette fuite. L'intérêt pratique est que la supervision géométrique n'est utilisée qu'à l'entraînement et n'alourdit pas le modèle déployé. Pour un intégrateur, cela suggère un gain de robustesse sans surcoût d'inférence. Il faut toutefois nuancer. Le banc d'essai principal est simulé. La validation réelle reste mince, avec trois tâches et un nombre d'essais non précisé dans le résumé. Un écart de 10 points face à Motus est encourageant mais statistiquement fragile à cette échelle. Le résultat ne dit pas non plus si le gain tient hors de la distribution d'entraînement.

Ce travail s'inscrit dans la montée des politiques qui combinent modélisation du monde et contrôle, avec Motus comme référence directe. Il reprend aussi l'idée JEPA, qui prédit dans un espace latent plutôt qu'en pixels, et s'appuie sur VGGT pour fournir une géométrie 3D de référence. RoboTwin 2.0 est devenu un banc d'essai bimanuel courant, ce qui rend les comparaisons possibles mais expose au risque de saturation, avec des scores déjà proches de 93 %. La prochaine étape à surveiller est une évaluation réelle plus large, avec plus de tâches et d'essais, puis une comparaison avec les grands VLA généralistes du marché. Aucun pilote industriel ni calendrier de déploiement n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

MVG-WAM : modélisation monde-action intégrant la géométrie multi-vues pour la manipulation robotique
1arXiv cs.RO 

MVG-WAM : modélisation monde-action intégrant la géométrie multi-vues pour la manipulation robotique

Des chercheurs publient MVG-WAM (Multi-View Geometry-Aware World-Action Model), un modèle monde-action pour la manipulation robotique, décrit dans le preprint arXiv 2609.37793. Il repose sur un modèle vidéo pré-entraîné qui prédit à la fois la dynamique visuelle et les actions. Le modèle atteint 99,1 % de réussite moyenne sur LIBERO et 92,07 % sur RoboTwin 2.0. En conditions réelles, il obtient 91,3 % de succès sur 150 essais répartis sur trois tâches, avec la plateforme bimanuelle Cobot Magic. Le résumé ne détaille ni les tâches, ni le nombre d'essais par tâche, ni la comparaison avec des modèles concurrents. Il ne s'agit ni d'un produit ni d'un déploiement, mais d'un résultat de recherche. Les World-Action Models (WAM) exploitent les connaissances visuelles des modèles vidéo pour piloter des bras robotiques. Leur point faible est l'interface multi-caméras. Les images synchronisées sont en général juxtaposées en mosaïque, ou leurs tokens sont concaténés. Les relations géométriques entre caméras restent donc implicites, ce qui complique le lien entre le contexte global de la scène et la géométrie locale nécessaire au contact. MVG-WAM traite les vues comme des projections d'un même monde physique. Il combine un état global contraint par la géométrie épipolaire avec des états géométriques propres à chaque vue. Un routage sensible aux caméras fournit à chaque région vidéo son contexte géométrique et l'état global partagé. Le modèle est aussi ancré à l'échelle métrique par une supervision de profondeur future à plusieurs horizons, sans décodage de profondeur pendant l'exécution des actions. Le coût d'inférence n'augmente donc pas. Ces résultats situent MVG-WAM dans la course aux politiques généralistes issues de modèles vidéo, face aux VLA (vision-langage-action) comme Pi-0 ou GR00T. Il faut relativiser les scores. LIBERO est quasi saturé, avec des performances proches de 99 % pour plusieurs méthodes, et il discrimine donc peu. RoboTwin 2.0 est un benchmark de simulation bimanuelle plus exigeant. Le test réel de 150 essais reste modeste, sur un seul robot, et sans détail sur les conditions ni les échecs. L'écart entre benchmark et terrain n'est donc pas mesuré. Pour les intégrateurs, l'intérêt est ailleurs. Les configurations multi-caméras sont la norme en atelier, et une représentation qui exploite explicitement la calibration pourrait améliorer la précision sans capteurs supplémentaires. Reste à savoir si le gain se confirme sur des scènes non vues et des cadences industrielles. Ce travail prolonge la vague des modèles monde-action, qui greffent la prédiction vidéo sur le contrôle robotique, en parallèle des VLA fondés sur des modèles vision-langage. Ces deux approches se disputent la position de fondation pour la manipulation. Le preprint n'annonce ni code, ni calendrier, ni pilote industriel, et n'a pas été relu par des pairs. La suite logique serait une évaluation sur d'autres plateformes, des tâches plus longues et des comparaisons directes avec les VLA et WAM de référence.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
2arXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public. L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception. GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

RecherchePaper
1 source
World-to-Wrist : modélisation prédictive du poignet conditionnée par la tâche pour une manipulation robotique fine
3arXiv cs.RO 

World-to-Wrist : modélisation prédictive du poignet conditionnée par la tâche pour une manipulation robotique fine

Un modèle de recherche (arXiv), pas d'annonce produit, j'adapte la structure aux codes d'un papier académique plutôt qu'à un communiqué d'entreprise. Une équipe de recherche présente W2-VLA (World-to-Wrist VLA), un modèle vision-langage-action conçu pour la manipulation robotique fine, décrit dans un article publié sur arXiv (2608.05369v1). Le constat de départ : les modèles VLA actuels traitent généralement la vue principale de la scène et la vue de la caméra au poignet comme deux flux visuels parallèles et équivalents, sans exploiter leur rôle distinct dans une tâche de manipulation. W2-VLA introduit à la place une modélisation prédictive conditionnée par la tâche : à partir des observations multi-vues et de l'instruction donnée, le modèle génère des tokens latents qui servent d'interface compacte entre le modèle vision-langage et un prédicteur dédié au poignet. Ce prédicteur anticipe l'évolution future des représentations latentes de la vue poignet, transformées ensuite en contexte pour la prédiction d'action. Les chercheurs ajoutent W2-CoT, un pipeline de synthèse qui génère des annotations structurées décrivant la progression de la tâche, les transitions physiques et les indices visuels locaux au poignet, utilisées comme supervision auxiliaire. Testé sur les benchmarks LIBERO et RoboTwin 2.0 ainsi que sur des tâches réelles, W2-VLA améliore la manipulation fine et sensible au contact, en configuration bras unique comme bimanuelle, tout en maintenant une fréquence de génération d'actions supérieure à 80 Hz. L'enjeu dépasse le simple gain de précision. La caméra de poignet est déjà largement utilisée dans les VLA récents, à la manière de Pi-0 ou GR00T N2, pour compenser les angles morts de la vue globale lors de tâches de contact fin comme l'insertion ou la manipulation d'objets déformables. Mais peu de travaux exploitaient son potentiel prédictif plutôt que descriptif. En anticipant explicitement ce que la scène au poignet devrait montrer si la tâche progresse correctement, W2-VLA se rapproche d'une forme de modèle du monde localisé plutôt que d'un simple encodeur d'image supplémentaire. Pour les intégrateurs qui évaluent des architectures VLA pour des applications industrielles exigeantes en précision, assemblage ou insertion de connecteurs, le signal est clair : ajouter une caméra de poignet ne suffit pas, c'est la structuration temporelle et prédictive de cette information qui compte. Ces résultats restent toutefois ceux rapportés par les auteurs sur leurs propres benchmarks, sans validation indépendante ni déploiement en production. Ce travail s'inscrit dans la course actuelle à des VLA capables de manipulation fine et de haute fréquence, un axe où des systèmes comme Helix chez Figure ou GR00T N2 chez NVIDIA misent déjà sur la vitesse d'inférence et le multi-vues. La contribution de W2-VLA, le couplage entre tokens latents conditionnés par la tâche et prédiction du futur local au poignet, vise à réduire l'écart entre démonstrations vidéo impressionnantes et robustesse réelle sur des tâches de contact fin, un problème récurrent du secteur. L'article ne mentionne aucun calendrier de déploiement ni partenariat industriel : il s'agit d'une contribution de recherche destinée à être reprise et comparée par d'autres équipes, avec LIBERO et RoboTwin 2.0 comme terrains d'évaluation communs pour de futurs travaux.

RechercheOpinion
1 source
SG-WAM : modélisation du monde auto-guidée dans un espace de politiques géométriquement conscient
4arXiv cs.RO 

SG-WAM : modélisation du monde auto-guidée dans un espace de politiques géométriquement conscient

Traduction et synthèse de l'article, en français, prêt à publier : SG-WAM (Self-Guided World Modeling in Geometry-Aware Policy Space) est un nouveau framework de recherche en robotique, publié sur arXiv (référence 2608.01397v1), qui s'attaque aux modèles World Action (WAM), ces systèmes qui couplent génération d'actions et prédiction des états futurs de la scène. La méthode introduit des "dynamics tokens" apprenables et un module appelé Self-Guided World Predictor, chargé de prévoir l'état latent futur de ces tokens en fonction des actions du robot. La supervision provient d'une copie à moyenne mobile exponentielle (EMA) du même réseau de politique, ce qui garantit une cohérence avec l'espace de représentation utilisé par le module de génération d'actions. Une supervision géométrique additionnelle structure les tokens d'image de la politique, apportant un ancrage spatial aux dynamics tokens. L'ensemble, prédiction latente, ancrage géométrique et génération d'actions par flow matching, est optimisé conjointement de bout en bout. Construit sur un modèle de seulement 0,9 milliard de paramètres, sans pré-entraînement embodied à grande échelle, SG-WAM atteint 98,5% de taux de réussite moyen sur le benchmark LIBERO et 73% sur LIBERO-Plus, tout en dépassant des baselines non précisément nommées dans l'abstract, aussi bien en conditions réelles similaires à l'entraînement qu'en généralisation hors distribution. L'enjeu identifié est concret: les WAM existants modélisent la dynamique future soit dans un espace d'observation brut, coûteux en calcul et peu aligné avec l'action, soit dans un espace latent auxiliaire non structuré pour la géométrie. En unifiant les deux dans l'espace même de la politique, SG-WAM évite ce compromis. Le résultat le plus notable reste la performance obtenue avec un modèle compact et sans pré-entraînement massif, ce qui questionne l'hypothèse dominante selon laquelle les modèles VLA nécessitent systématiquement une échelle de données et de paramètres considérable pour généraliser en conditions réelles. Le travail s'inscrit dans une lignée de recherche académique sur les world models appliqués à la manipulation robotique, où la prédiction d'état futur vient de plus en plus compléter les architectures de politique conditionnées par le langage. Il s'agit ici d'une contribution de recherche publiée en preprint, non d'un système déployé, et les baselines comparées ne sont pas explicitement identifiées dans le résumé, un point à vérifier dans le papier complet avant toute reprise de ces chiffres.

RecherchePaper
1 source