AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique
Un article déposé le 22 septembre 2026 sur arXiv (2609.23578) présente AR-WAM, un modèle de manipulation robotique qui remplace les instructions en langage naturel par deux signaux visuels : une boîte englobante désignant l'objet cible et un jeton d'opération appris précisant la compétence à exécuter. Compact avec 0,5 milliard de paramètres et un encodeur visuel figé, sans encodeur de langage, il prédit l'évolution de la scène en espace latent tout en décodant les actions. Une couche de compatibilité à trois primitives, détecter, exécuter, interroger, permet à un VLM local ou une API d'agent de piloter la politique. Testé sur RoboTwin 2.0, RMBench et un robot réel bi-bras Astribot S1, il atteint 87,2% de succès en manipulation standard, gagne 5,9 points sur les tâches à mémoire et 36,7 points sur les tâches longues réelles, avec la latence la plus basse du comparatif, 14,1 millisecondes.
Le choix cible un problème identifié par les auteurs : les VLA et les world action models dominants spécifient encore les tâches en langage naturel, une interface jugée ambiguë sur les références, imprécise spatialement et redondante avec la compréhension déjà portée par l'agent. En séparant le « quoi », décidé par l'agent, du « comment », exécuté par le robot via un grounding visuel explicite, AR-WAM offre une interface standardisée qui intéresse les intégrateurs cherchant à connecter des piles agentiques à des flottes de robots hétérogènes plutôt qu'à des prompts textuels ad hoc. Le bond de 36,7 points sur les tâches longues en conditions réelles suggère surtout que la faiblesse chronique des VLA sur l'horizon long peut être atténuée en délégant mémoire et récupération d'erreur à la couche agent, plutôt qu'en la faisant porter entièrement par un modèle d'action monolithique.
Ces résultats restent ceux d'un article de recherche récent, validé en simulation et sur une seule plateforme robotique réelle, sans annonce de déploiement commercial ni de partenariat industriel. Astribot, dont le bras bi-bras S1 sert de banc d'essai réel, est une entreprise chinoise de manipulation robotique ; RoboTwin 2.0 et RMBench comptent parmi les bancs d'essai standards du secteur pour comparer des politiques de manipulation en simulation. L'article ne fournit ni échéancier de déploiement ni partenaire industriel identifié ; il se positionne comme une contribution méthodologique destinée à la prochaine génération de systèmes agent-robot, dans un secteur où l'exécution fiable de tâches longues sans supervision humaine reste l'un des principaux verrous avant une adoption industrielle à grande échelle.
Dans nos dossiers




