ACG-WAM : modélisation monde-action par prédiction latente géométrique conditionnée par l'action
Des chercheurs de l'équipe RoboOpus publient ACG-WAM, un modèle « monde-action » (World Action Model, WAM) qui apprend conjointement la prédiction visuelle et les actions du robot. Le travail ajoute un objectif auxiliaire baptisé ACG-JEPA (Action-Conditioned Geometric Joint-Embedding Predictive Architecture). À partir de l'observation courante et des actions intermédiaires, il prédit des caractéristiques géométriques à plusieurs horizons temporels. La cible vient d'un encodeur VGGT gelé, dont on utilise le « slot futur » pour chaque paire d'images courante et future. La supervision s'applique aux caméras tête et poignet, sur un embedding visuel partagé placé avant le mélange temporel. Le teacher et les modules auxiliaires sont retirés à l'inférence, donc le coût d'exécution ne change pas. Sur 50 tâches RoboTwin 2.0, ACG-WAM atteint 93,46 % de succès en scènes propres. Il obtient le meilleur score en scènes randomisées (92,68 %) et la meilleure moyenne sur les deux réglages (93,07 %) parmi les méthodes comparées. Sur robot réel, avec trois tâches, il atteint 85,00 % de succès et 91,67 % de score de complétion partielle. Il dépasse Motus de 10,00 et 9,17 points de pourcentage. Le code et un site de projet sont publiés.
Les WAM entraînent leurs pertes vidéo et action sans cible explicite pour les conséquences géométriques d'une séquence d'actions démontrée. Le modèle peut donc prédire des pixels plausibles sans bien représenter ce que le geste a changé dans l'espace 3D. Les auteurs relèvent aussi un défaut de conception : les features visuelles prises après l'attention temporelle peuvent contenir des informations sur le futur. Elles ne conviennent donc pas comme seule entrée visuelle courante d'un prédicteur auxiliaire. Le choix de supervision avant le mélange temporel répond à cette fuite. L'intérêt pratique est que la supervision géométrique n'est utilisée qu'à l'entraînement et n'alourdit pas le modèle déployé. Pour un intégrateur, cela suggère un gain de robustesse sans surcoût d'inférence. Il faut toutefois nuancer. Le banc d'essai principal est simulé. La validation réelle reste mince, avec trois tâches et un nombre d'essais non précisé dans le résumé. Un écart de 10 points face à Motus est encourageant mais statistiquement fragile à cette échelle. Le résultat ne dit pas non plus si le gain tient hors de la distribution d'entraînement.
Ce travail s'inscrit dans la montée des politiques qui combinent modélisation du monde et contrôle, avec Motus comme référence directe. Il reprend aussi l'idée JEPA, qui prédit dans un espace latent plutôt qu'en pixels, et s'appuie sur VGGT pour fournir une géométrie 3D de référence. RoboTwin 2.0 est devenu un banc d'essai bimanuel courant, ce qui rend les comparaisons possibles mais expose au risque de saturation, avec des scores déjà proches de 93 %. La prochaine étape à surveiller est une évaluation réelle plus large, avec plus de tâches et d'essais, puis une comparaison avec les grands VLA généralistes du marché. Aucun pilote industriel ni calendrier de déploiement n'est annoncé.
Pas d\'impact direct sur la France/UE




