Modèles du monde fondation pour la robotique multi-embodiment, fondés sur des actions latentes
Des chercheurs proposent LAC-WM (Latent Action-Conditioned Robot World Model), un modèle du monde robotique qui fonctionne dans un espace d'actions latent unifié, appris et partagé entre embodiments très différents. Il est comparé à une variante de référence, EAC-WM (Explicit Action-Conditioned World Model), conditionnée par des étiquettes de mouvement explicites propres à chaque robot. Les deux modèles sont évalués sur des tâches de manipulation dextre et sur une version modifiée du benchmark LIBERO. Lors de l'adaptation à des robots absents du pré-entraînement, LAC-WM améliore la performance aval jusqu'à 46,7 % sur la manipulation dextre et 11,7 % sur LIBERO. Le travail, publié sur arXiv (2610.10846v1), s'accompagne d'un site de projet (lacwm.github.io). Le résumé ne précise ni les robots testés, ni la taille des modèles, ni les volumes de données de pré-entraînement.
Le résultat le plus significatif concerne le passage à l'échelle. La performance de LAC-WM augmente avec le nombre d'embodiments vus au pré-entraînement. À l'inverse, celle d'EAC-WM diminue quand ce nombre croît. Selon les auteurs, des étiquettes d'action explicites produisent des représentations disjointes d'un robot à l'autre, et ajouter des plateformes crée alors de l'interférence plutôt que du transfert. Pour les équipes qui construisent des modèles fondations robotiques, cela remet en cause l'idée qu'agréger davantage de données hétérogènes améliore mécaniquement la généralisation. L'espace d'action serait un goulot d'étranglement central, et pas seulement le volume de données. Pour un intégrateur, l'enjeu est concret : si ce principe se confirme, un modèle du monde pré-entraîné pourrait être adapté à une nouvelle plateforme avec moins de données propriétaires. Les gains annoncés sont toutefois mesurés sur des benchmarks, dont un LIBERO modifié, et non sur des déploiements industriels. Le gain de 11,7 % sur LIBERO est modeste, et l'écart de 46,7 % dépend de la base de comparaison choisie par les auteurs. On parle ici de résultats de recherche, pas d'un produit livré.
Ce travail s'inscrit dans la course aux modèles généralistes cross-embodiment, où les approches VLA (vision-langage-action) comme Pi-0 ou GR00T se heurtent à la diversité des espaces d'action, entre bras à 6 ou 7 DOF, mains dextres et humanoïdes. Les modèles du monde, qui prédisent l'évolution de la scène en fonction des actions, sont devenus un axe parallèle pour la planification et l'évaluation des politiques. Les actions latentes, apprises à partir des seules transitions visuelles, offrent une voie pour exploiter de grandes quantités de vidéos sans étiquettes d'action. Le papier est une prépublication v1, sans relecture par les pairs. Il faudra surveiller la publication du code et des poids, des tests sur du matériel réel, ainsi que des comparaisons directes avec d'autres modèles du monde cross-embodiment pour savoir si l'effet de passage à l'échelle se maintient avec des dizaines de plateformes.
Dans nos dossiers


