HarnessWAM : concilier prédiction et délibération dans les modèles vision-action du monde
HarnessWAM, un framework agentique décrit dans un preprint publié sur arXiv (identifiant 2608.09516), vise à combler ce que ses auteurs nomment le « prédiction-délibération gap » des World Action Models (WAM), ces modèles qui apprennent conjointement la dynamique de l'environnement et la génération d'actions robotiques. Le système ajoute un Task Manager basé sur un modèle vision-langage, chargé de maintenir une croyance de scène ancrée dans l'observation et un graphe de tâches, ainsi qu'une projection des plans en séquences de compétences atomiques compatibles avec les capacités du WAM sous-jacent. Une boucle de rétroaction à deux échelles temporelles associe un estimateur de progression haute fréquence à une délibération aux jalons clés, capable de réviser le plan ou de déclencher une récupération locale après l'échec d'une sous-tâche. Sur le benchmark RoboMemArena, HarnessWAM atteint 59,6% de réussite sur les tâches complètes, 69,9% sur les sous-tâches, et 23,7% sur RoboCerebra Ideal, des résultats présentés comme l'état de l'art.
Ce travail cible un point de friction connu du secteur : les WAM actuels, entraînés à prédire et agir sur un horizon court, échouent sur des tâches longues exigeant planification globale, maintien d'état entre étapes et récupération après échec, soit le profil typique attendu d'un robot humanoïde en usine ou en entrepôt. En montrant qu'une couche de gestion d'état externe au modèle, couplée à une décision en boucle fermée, prolonge les capacités de contrôle local des WAM vers une exécution vérifiable et récupérable, l'étude suggère que le goulot d'étranglement des architectures VLA/WAM tient autant à l'orchestration cognitive qu'à la génération d'actions elle-même. Les gains restent toutefois mesurés sur des bancs d'essai spécifiques, sans validation annoncée sur robot physique en environnement industriel réel.
HarnessWAM s'inscrit dans la lignée des modèles fondation pour la robotique de type VLA ou WAM, à l'image de GR00T N2, Pi-0 ou Helix, qui génèrent des actions à partir d'observations visuelles et de consignes en langage naturel mais restent structurellement limités à des horizons de prédiction courts. Le framework se présente comme une couche agentique complémentaire plutôt qu'un nouveau backbone, en principe transposable à d'autres WAM sous-jacents. La publication ne mentionne ni partenariat industriel, ni pilote de déploiement, ni acteur européen : il s'agit à ce stade d'une contribution académique évaluée en benchmark, dont la suite logique serait une validation sur plateformes robotiques réelles.
Dans nos dossiers




