Aller au contenu principal
RecherchearXiv cs.RO 

CogWAM : aligner la cognition sémantique et la modélisation du monde et de l'action via des interfaces événementielles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CogWAM, un modèle « monde-action » (world-action model) guidé par la cognition, est décrit dans un preprint arXiv (2609.37721v1). Son principe est de placer entre le raisonnement sur la tâche et l'apprentissage monde-action une interface sémantique explicite, appelée Semantic State. Cet état persistant mémorise les événements de la tâche déjà accomplis et la sous-tâche active. Il n'est mis à jour que lorsque les observations signalent une transition sémantique, si bien que le contexte de tâche survit à plusieurs séquences d'actions (action chunks). Deux familles de requêtes conditionnées par la progression, WORLD et ACTION, extraient l'information utile à la prédiction du futur et à la génération des commandes. À l'entraînement, le Semantic State fournit un contexte de progression commun aux deux branches. À l'inférence, la branche de prédiction est supprimée et les actions sont produites directement à partir des observations et de l'état maintenu. Sans pré-entraînement supplémentaire sur des actions de robot, le modèle atteint 15,56 de score et 11,70 % de taux de succès sur RoboDojo, et revendique l'état de l'art sur BiCoord. Les essais réels portent sur de la manipulation bimanuelle en boucle fermée, avec 16,4 régénérations du Semantic State en moins qu'une mise à jour à chaque pas de temps. Le texte ne précise ni la base de comparaison de ce chiffre, ni le nombre d'essais, ni les tâches réelles.

L'intérêt tient à un problème connu des politiques robotiques récentes : additionner raisonnement sémantique et prédiction du monde futur ne garantit pas que les prédictions locales et les actions restent cohérentes avec l'avancement de la tâche. En rendant la progression explicite et en ne la recalculant que sur événements, CogWAM vise aussi le coût de calcul, puisque retirer la branche de prédiction à l'inférence allège le déploiement. Pour un intégrateur, la persistance du contexte sur des tâches longues à deux bras est le vrai sujet, plus que le score. Il faut cependant relativiser. Un taux de succès de 11,70 % sur RoboDojo reste très bas en valeur absolue, et ce type de benchmark simulé ne dit rien de la fiabilité en production. Aucun temps de cycle, aucune plateforme matérielle ni aucun taux de succès réel ne sont fournis. On reste au stade de la recherche académique, pas d'un produit ni d'un déploiement.

Ce travail s'inscrit dans la convergence entre modèles vision-langage-action (VLA), tels que Pi-0, GR00T ou Helix, et modèles du monde qui prédisent les observations futures. Le premier ensemble apporte la généralisation sémantique. Le second apporte une représentation de la dynamique physique. La difficulté est de les faire coopérer sur des horizons longs. CogWAM propose une réponse par une mémoire d'événements structurée, là où d'autres approches s'appuient sur des planificateurs hiérarchiques ou sur des contextes visuels longs. Le preprint ne mentionne aucun pilote, aucune diffusion de code ni aucun calendrier. Les prochaines étapes à surveiller sont une évaluation sur davantage de tâches réelles, des comparaisons directes avec les VLA de référence et une éventuelle publication des poids.

À lire aussi

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint
1arXiv cs.RO 

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint

JEPA-WAM, un nouveau modèle de monde latent (world action model, WAM) pour le contrôle robotique, est présenté dans un article publié le 11 août 2026 sur arXiv (2608.09381v1). Le système s'appuie sur l'espace latent pré-entraîné V-JEPA, l'architecture d'auto-supervision vidéo développée par Meta AI, et couple prédiction de transition et génération d'action continue via un prédicteur partagé, plutôt que de générer explicitement des vidéos futures comme le font les WAM à base vidéo, coûteux à déployer. Sur le benchmark LIBERO-Plus, JEPA-WAM atteint 79,2 % de réussite, le meilleur score parmi les méthodes sans pré-entraînement à grande échelle sur des politiques robotiques. Instancié sur le modèle pi0.5 déjà pré-entraîné, il grimpe à 86,3 %, la meilleure performance globale rapportée dans l'article. Des expériences complémentaires sur le simulateur RoboTwin 2.0 et sur des tâches de manipulation bimanuelle en conditions réelles confirment une bonne généralisation face aux variations visuelles et spatiales. Ce travail s'attaque à un compromis central dans l'apprentissage de politiques vision-langage-action (VLA) : les modèles de monde générant explicitement des vidéos futures sont coûteux en calcul et en latence, tandis que les approches latentes existantes sacrifient souvent la richesse de la représentation prédictive ou la séparent du chemin utilisé pour générer l'action. En démontrant qu'un même prédicteur partagé peut porter à la fois la supervision de transition et la prédiction d'action sans déconnecter représentation et politique, JEPA-WAM fournit un argument empirique en faveur de l'unification des deux tâches dans une même colonne vertébrale visuelle. Pour les équipes de recherche et les intégrateurs en robotique, l'intérêt pratique tient au fait que la méthode s'applique aussi à des politiques VLA déjà pré-entraînées, comme pi0.5, sans modifier leurs chemins de perception et d'action d'origine, ce qui laisse entrevoir un gain applicable à des systèmes existants plutôt qu'une architecture entièrement nouvelle à réentraîner. Il s'agit d'un article de recherche publié sur arXiv, sans annonce de produit ni de déploiement commercial : les résultats reposent sur des benchmarks de simulation (LIBERO-Plus, RoboTwin 2.0) complétés par des essais réels limités en manipulation bimanuelle, sans précision sur le nombre de robots ou les sites concernés. JEPA-WAM s'inscrit dans la lignée des architectures d'apprentissage par prédiction latente issues de V-JEPA, et se positionne face à l'écosystème grandissant des politiques VLA telles que pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Les auteurs ne précisent aucun calendrier de suite, pilote industriel ou partenariat, ce qui situe cette publication au stade de la recherche fondamentale plutôt qu'à une étape de déploiement à court terme.

RechercheActu
1 source
Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques
2arXiv cs.RO 

Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques

Des chercheurs présentent SR-WM (Semantically Rich World Model), un modèle du monde conditionné par la tâche pour la planification d'interactions physiques en robotique de manipulation, détaillé dans un article publié sur arXiv sous la référence 2608.22294v1. Plutôt que de se limiter à prédire des observations futures ou des caractéristiques latentes, comme le font les modèles du monde classiques, SR-WM structure sa représentation autour de cinq rôles fonctionnels explicites: gripper, cible, but, relation et phase. Un encodeur d'entités visuelles extrait des hypothèses d'entités à partir de caractéristiques de patchs pré-entraînées, les masques de segmentation servant d'indices optionnels plutôt que d'entrées obligatoires. Un module de liaison de rôles associe ensuite ces hypothèses aux rôles spécifiques à la tâche, tandis qu'un modèle de dynamique conditionné par l'action prédit les transitions de rôles ainsi que des éléments fins: contact, établissement de relations entre objets, préservation de ces relations et changement de phase. L'ensemble est évalué sur les quatre suites de simulation LIBERO, avec des tests de transfert inter-suites, des diagnostics de perception et une analyse de sensibilité aux actions. Pour l'industrie de la manipulation robotique et les équipes travaillant sur des architectures vision-langage-action (VLA), ce travail cible un écart précis: un modèle qui prédit correctement des pixels ou des embeddings futurs ne garantit pas qu'il comprenne si une action préserve les relations nécessaires à la réussite d'une tâche, comme ne pas rompre une prise ou déplacer un objet hors de sa zone cible. En rendant explicites des rôles fonctionnels plutôt que de s'appuyer sur des slots d'objets indifférenciés ou un état monolithique, SR-WM propose une interface sémantique reliant dynamique visuelle et décision de planification, utilisée pour générer plusieurs candidats d'action, les reclasser selon l'étape de la tâche, et rechantillonner en cas de violation détectée. C'est une piste concrète pour fiabiliser la sélection d'actions issues de politiques apprises, plutôt que de juger leur qualité sur des démonstrations sélectionnées ou des taux de réussite bruts en simulation. Ce travail s'inscrit dans la lignée des recherches sur les représentations centrées objets pour les modèles du monde, qui cherchent depuis plusieurs années à dépasser les limites des slots d'instances indifférenciés en robotique par apprentissage. LIBERO, le benchmark utilisé pour l'évaluation, est devenu une référence standard pour tester la généralisation des politiques de manipulation entre familles de tâches. L'article ne fait état d'aucun déploiement matériel, partenariat industriel ou test sur robot réel: il s'agit d'une contribution académique évaluée exclusivement en simulation. Les suites naturelles pour ce type d'approche, transfert sim-to-real et intégration à des pipelines VLA existants, ne sont ni annoncées ni datées dans l'article.

RecherchePaper
1 source
GaussianWAM : distiller la géométrie et la sémantique des champs gaussiens 3D en modèles monde-action
3arXiv cs.RO 

GaussianWAM : distiller la géométrie et la sémantique des champs gaussiens 3D en modèles monde-action

Un article publié sur arXiv (2608.24714) présente GaussianWAM, une méthode d'entraînement qui renforce les World-Action Models (WAM), des architectures qui apprennent conjointement à prédire les images futures et à générer des actions robotiques à partir de la dynamique vidéo. À partir d'observations multi-vues synchronisées, des modèles de fondation gelés fournissent profondeur, paramètres de caméra et caractéristiques sémantiques denses, reliés à des primitives de champ Gaussien 3D communes puis distillés dans les représentations du WAM ; tous les composants auxiliaires sont retirés après l'entraînement, sans changement du chemin d'inférence. Sur le benchmark LIBERO-Plus, GaussianWAM fait passer le taux de réussite de FastWAM de 52,05% à 71,29%, et celui de Cosmos Policy de 71,52% à 77,30%. Une base combinant distillation CLIP et VGGT atteint déjà 69,37%, portée à 71,29% par l'unification via champ Gaussien. Des gains sont aussi rapportés sur LIBERO standard, avec des tendances de transfert positives sur RoboTwin et en manipulation réelle. Ce résultat cible une limite connue des WAM : leurs représentations vidéo, optimisées pour la prédiction visuelle, ne captent pas explicitement la structure géométrique inter-vues ni la sémantique localisée des objets manipulés, ce qui plafonne la précision en manipulation fine. Un gain de près de 20 points sur FastWAM sans modifier l'architecture de déploiement ni ajouter de calcul à l'inférence suggère que l'écart entre politiques généralistes de type VLA et politiques spécialisées peut se combler par un enrichissement de la supervision à l'entraînement plutôt que par des modèles plus lourds au runtime, un point clé pour les intégrateurs évaluant des systèmes comme Pi-0, GR00T N2 ou Helix sur des tâches industrielles à budget de calcul limité. GaussianWAM s'inscrit dans les travaux récents combinant modèles de fondation en vision (CLIP, VGGT) et représentations 3D explicites pour améliorer l'apprentissage de politiques robotiques, face aux World-Action Models comme Cosmos et aux architectures FastWAM utilisées ici comme références. L'évaluation combine des benchmarks de simulation établis (LIBERO, LIBERO-Plus, RoboTwin) avec de premiers essais en manipulation réelle, une combinaison encore rare dans la littérature que les auteurs avancent pour appuyer la généralité de la méthode au-delà de la simulation. Le papier ne mentionne aucun partenariat industriel ni plan de commercialisation : il s'agit à ce stade d'une contribution de recherche, sans indication de code source ouvert ni de calendrier de suite.

RecherchePaper
1 source
J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés
4arXiv cs.RO 

J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés

Un préprint publié sur arXiv (identifiant 2606.28712) introduit J-LAW (Joint Localization and Actionable World Modeling), une architecture qui fusionne le SLAM classique et les modèles de monde conditionnés par l'action dans un unique graphe de facteurs probabilistes. L'objectif MAP (Maximum A Posteriori) commun optimise simultanément les poses métriques des objets, les états latents du monde et les embeddings latents de landmarks. Le pont entre ces deux formulations est un encodeur latent conditionné par la pose et un facteur de couplage pose-latent appris. Les expériences portent sur deux benchmarks : PushT, une tâche de manipulation planaire, et WildGS, un environnement de reconstruction 3D gaussienne. Les résultats montrent que la correction par graphe couplé réduit l'erreur quadratique moyenne de prédiction latente et la dérive de point final par rapport au rollout en boucle ouverte, tandis que la fermeture de boucle latente améliore la cohérence globale de trajectoire. L'enjeu est structurant pour la robotique de manipulation : les systèmes actuels souffrent d'une dichotomie entre localisation précise et planification prédictive. Le SLAM produit des cartes métriques que les planificateurs ne savent pas exploiter directement ; les modèles de monde appris prédisent l'effet des actions mais perdent la cohérence spatiale sur des horizons longs, limitant leur utilité en déploiement réel. J-LAW démontre qu'en couplant ces deux estimations, chaque composante améliore l'autre : une meilleure localisation stabilise la prédiction latente, et réciproquement. C'est une réponse partielle à la dérive en open-loop, problème concret dans les pipelines de manipulation autonome. Pour les équipes travaillant sur des systèmes VLA ou de navigation, ce cadre suggère une représentation unifiée, métrique et actionnable, sans orchestrer deux pipelines distincts. La séparation entre SLAM et modèles de monde appris est historiquement ancrée : le SLAM probabiliste date des années 2000, tandis que les modèles de monde deep (RSSM, DreamerV3) sont apparus dans la décennie suivante. Plusieurs travaux récents tentent ce rapprochement dans le champ des VLA, où la cohérence spatiale devient un enjeu croissant. J-LAW se positionne comme une contribution théorique structurée via la formalisation en graphe de facteurs, et non comme un système prêt au déploiement. Limite à noter : les expériences restent sur des benchmarks standardisés, sans validation sur robot physique réel en scène dynamique. Aucun partenariat industriel ni timeline de transfert n'est mentionné dans ce préprint.

RechercheOpinion
1 source