
L'ancrage physique de l'état est-il indispensable aux modèles du monde JEPA au-delà de la prédiction ?
Une équipe de recherche a publié sur arXiv en août 2026 (référence 2608.06799) un article décrivant PSG-JEPA, un modèle du monde pour la robotique fondé sur l'architecture JEPA (Joint Embedding Predictive Architecture). Les modèles JEPA existants apprennent une dynamique latente conditionnée par l'action à partir de séquences d'observations, mais rien ne garantit que cet espace latent encode fidèlement l'état physique du robot. PSG-JEPA ajoute deux objectifs d'entraînement complémentaires : ancrer chaque latent individuel dans l'état proprioceptif du robot, et ancrer les paires de latents dans les variations d'angles articulaires sur plusieurs horizons temporels, sans changer l'architecture ni le coût de calcul à l'inférence. Les auteurs testent la méthode à trois niveaux (identifiabilité par sondage, planification sur latents figés, apprentissage de politiques en simulation et sur robot réel) et rapportent une amélioration constante face aux modèles de référence, sans détailler de chiffres précis ni la plateforme robotique utilisée.
Ce travail s'attaque à une limite connue des modèles du monde de type JEPA, popularisés par Yann LeCun et Meta AI comme alternative à la prédiction pixel par pixel : un objectif de prédiction pure n'oblige pas la représentation latente à rester interprétable en termes d'état physique, ce qui peut dégrader la planification et le contrôle appris en aval. En montrant qu'un ancrage explicite sur la proprioception et les angles articulaires améliore à la fois l'identifiabilité, la planification et l'apprentissage de politiques sans surcoût à l'inférence, PSG-JEPA apporte un argument concret pour les équipes développant des piles de contrôle fondées sur des modèles du monde plutôt que sur l'apprentissage par renforcement pur, validé en simulation comme sur robot physique.
PSG-JEPA s'inscrit dans la lignée des recherches sur les architectures JEPA appliquées à la robotique, un courant qui cherche à remplacer les modèles du monde génératifs coûteux en pixels par des représentations latentes compactes, dans un paysage où coexistent des approches vision-langage-action comme Pi-0 ou GR00T N2. Publié comme simple soumission arXiv non encore relue par les pairs, le travail reste une contribution académique dont l'impact dépendra de sa reproduction par d'autres équipes et de son adoption dans des piles de contrôle réelles.
Dans nos dossiers




