
WLA³ : modélisation d'action latente du monde pour la sémantique, la dynamique et la cinématique
Des chercheurs ont publié le 15 septembre 2026 sur arXiv (2609.15870) WLA³, pour World Latent Action Modeling for Semantics, Dynamics, and Kinematics, un cadre pour entraîner des politiques robotiques généralistes à partir de données hétérogènes. Son cœur, le WLAM (World Latent Action Model), apprend comment l'état du monde évolue sur un court intervalle en encodant des vues caméra synchronisées et les variations d'état du robot en une action latente locale compacte de 32 dimensions, associée à une représentation de transition plus riche. Cette représentation alimente trois usages : un agrégat latent sémantique supervise le modèle vision-langage, les actions latentes nourrissent la modélisation de la dynamique physique, et un expert d'action prédit conjointement ces actions et les commandes robotiques propres à chaque plateforme. Sur le benchmark LARYBench, l'action latente 32D atteint 67,89% de précision moyenne de classification, et sur six tâches réelles, WLA³ obtient 81,9% de réussite moyenne, contre 66,2% pour le modèle concurrent π_0.5.
Cette méthode cible un goulot d'étranglement des modèles vision-langage-action (VLA) : le manque d'annotations d'actions fiables, alors que les vidéos égocentriques humaines abondent mais sont rarement étiquetées avec précision. En dérivant la supervision directement des transitions observées entre images plutôt que d'annotations manuelles de gestes, WLA³ transforme la vidéo humaine brute en source d'apprentissage à grande échelle, tout en ancrant la représentation partagée dans des commandes exécutables grâce aux trajectoires robotiques réelles. Les auteurs montrent que les performances progressent avec le volume de données de pré-entraînement et que les vidéos humaines permettent un transfert humain-vers-robot, un argument en faveur de l'hypothèse que la vidéo à grande échelle peut compenser la pénurie de données de téléopération, un point de friction récurrent pour les intégrateurs robotiques.
WLA³ prolonge une lignée de travaux sur les actions latentes apprises par vidéo et se positionne explicitement face à π_0.5, la politique généraliste de Physical Intelligence, utilisée comme référence de comparaison. Le papier ne précise ni affiliation institutionnelle ni partenariat industriel : il s'agit d'une publication de recherche accompagnée d'une page de projet (wla-3.github.io), sans déploiement commercial annoncé. Les résultats, limités à six tâches réelles et à un seul benchmark de classification, restent à confirmer sur davantage d'embodiments et à plus grande échelle.
Dans nos dossiers




