
RoboJEPA : passage à l'échelle des modèles du monde latents pour la robotique
RoboJEPA, un modèle du monde latent publié sur arXiv (2610.10515), repose sur l'architecture JEPA (Joint Embedding Predictive Architecture) et compte 8 milliards de paramètres. Ses auteurs le présentent comme le plus grand prédicteur JEPA entraîné à ce jour. Il a été entraîné sur un jeu de données à grande échelle couvrant 12 embodiments robotiques différents, issu de données de robots réels. Le résultat central est que l'« imagination error », c'est-à-dire l'erreur accumulée par les déroulés (rollouts) du modèle dans l'espace latent, suit une loi de puissance de second ordre en fonction du calcul. Cette loi permet de prédire la qualité du modèle bien au-delà de l'échelle sur laquelle elle a été ajustée. Les performances de planification en aval progressent elles aussi de façon prévisible avec le calcul. Enfin, le modèle a été déployé en zero-shot sur du matériel réel : il planifie vers une unique image-but pour résoudre des tâches à horizon long. Les checkpoints, le code d'entraînement et le code de déploiement sont publiés.
L'intérêt tient moins à la performance brute qu'à la méthode. Jusqu'ici, les lois d'échelle étaient bien établies pour les modèles de langage, mais pas pour les modèles du monde robotiques, ce qui obligeait les équipes à investir à l'aveugle en paramètres, données et GPU. Si l'imagination error est effectivement corrélée de façon forte à la réussite de la planification, elle devient un indicateur peu coûteux pour évaluer un modèle sans passer par des essais sur robot réel, longs et difficiles à reproduire. Pour les intégrateurs et les décideurs B2B, cela rapproche la robotique d'une logique d'ingénierie où l'on chiffre à l'avance le gain attendu d'un budget de calcul. Il faut cependant rester prudent : il s'agit d'un preprint sans relecture par les pairs, les tâches réelles ne sont pas détaillées dans le résumé (taux de réussite, durée, diversité des scènes), et une extrapolation de loi d'échelle ne garantit pas la robustesse en environnement industriel ouvert.
Ce travail s'inscrit dans la lignée des approches JEPA promues par Yann LeCun et Meta, qui privilégient la prédiction dans un espace de représentation abstrait plutôt qu'au niveau du pixel, en opposition aux modèles génératifs vidéo et aux politiques VLA (vision-langage-action) entraînées par imitation. Il se positionne face aux modèles du monde de type Cosmos de NVIDIA et aux modèles génératifs de Google DeepMind, ainsi qu'à V-JEPA 2 de Meta, qui avait déjà montré une planification robotique à partir d'une image-but. La publication ouverte des poids et du code laisse attendre des reproductions et des extensions par d'autres laboratoires. Les prochaines étapes à surveiller sont la validation des lois d'échelle à des tailles supérieures à 8 milliards de paramètres, leur confirmation par des équipes indépendantes, et une évaluation sur des tâches industrielles réelles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




