CogWAM : aligner la cognition sémantique et la modélisation du monde et de l'action via des interfaces événementielles
CogWAM, un modèle « monde-action » (world-action model) guidé par la cognition, est décrit dans un preprint arXiv (2609.37721v1). Son principe est de placer entre le raisonnement sur la tâche et l'apprentissage monde-action une interface sémantique explicite, appelée Semantic State. Cet état persistant mémorise les événements de la tâche déjà accomplis et la sous-tâche active. Il n'est mis à jour que lorsque les observations signalent une transition sémantique, si bien que le contexte de tâche survit à plusieurs séquences d'actions (action chunks). Deux familles de requêtes conditionnées par la progression, WORLD et ACTION, extraient l'information utile à la prédiction du futur et à la génération des commandes. À l'entraînement, le Semantic State fournit un contexte de progression commun aux deux branches. À l'inférence, la branche de prédiction est supprimée et les actions sont produites directement à partir des observations et de l'état maintenu. Sans pré-entraînement supplémentaire sur des actions de robot, le modèle atteint 15,56 de score et 11,70 % de taux de succès sur RoboDojo, et revendique l'état de l'art sur BiCoord. Les essais réels portent sur de la manipulation bimanuelle en boucle fermée, avec 16,4 régénérations du Semantic State en moins qu'une mise à jour à chaque pas de temps. Le texte ne précise ni la base de comparaison de ce chiffre, ni le nombre d'essais, ni les tâches réelles.
L'intérêt tient à un problème connu des politiques robotiques récentes : additionner raisonnement sémantique et prédiction du monde futur ne garantit pas que les prédictions locales et les actions restent cohérentes avec l'avancement de la tâche. En rendant la progression explicite et en ne la recalculant que sur événements, CogWAM vise aussi le coût de calcul, puisque retirer la branche de prédiction à l'inférence allège le déploiement. Pour un intégrateur, la persistance du contexte sur des tâches longues à deux bras est le vrai sujet, plus que le score. Il faut cependant relativiser. Un taux de succès de 11,70 % sur RoboDojo reste très bas en valeur absolue, et ce type de benchmark simulé ne dit rien de la fiabilité en production. Aucun temps de cycle, aucune plateforme matérielle ni aucun taux de succès réel ne sont fournis. On reste au stade de la recherche académique, pas d'un produit ni d'un déploiement.
Ce travail s'inscrit dans la convergence entre modèles vision-langage-action (VLA), tels que Pi-0, GR00T ou Helix, et modèles du monde qui prédisent les observations futures. Le premier ensemble apporte la généralisation sémantique. Le second apporte une représentation de la dynamique physique. La difficulté est de les faire coopérer sur des horizons longs. CogWAM propose une réponse par une mémoire d'événements structurée, là où d'autres approches s'appuient sur des planificateurs hiérarchiques ou sur des contextes visuels longs. Le preprint ne mentionne aucun pilote, aucune diffusion de code ni aucun calendrier. Les prochaines étapes à surveiller sont une évaluation sur davantage de tâches réelles, des comparaisons directes avec les VLA de référence et une éventuelle publication des poids.
Dans nos dossiers




