
Préserver les modes instables grâce à la dynamique inverse dans les modèles du monde JEPA
Une équipe de chercheurs publie sur arXiv (2610.07540) une étude sur un défaut discret des modèles du monde de type JEPA (Joint-Embedding Predictive Architecture) utilisés pour piloter des robots à partir d'images. Les systèmes robotiques présentent souvent des modes instables, c'est-à-dire des directions de l'état le long desquelles une petite perturbation croît sans limite si aucun retour d'état ne la corrige. Les auteurs montrent qu'un entraînement fondé sur la prédiction de l'étape suivante, associé à une régularisation anti-effondrement, ne garantit pas la conservation de ces modes contrôlables : la fonction de perte peut être minimisée alors que ces directions sont écrasées dans la représentation, ce qui rend toute stabilisation impossible. Le remède proposé ajoute un objectif de reconstruction de l'action (une perte de dynamique inverse). Les auteurs démontrent qu'une reconstruction exacte rend l'encodeur injectif sur le sous-espace atteignable en H pas, et que, lorsque H augmente, l'espace propre dominant du gramien de contrôlabilité à horizon fini converge vers le sous-espace instable contrôlable. Les preuves portent sur des systèmes linéaires. Les tests empiriques, sur CartPole, Walker2D et PointMaze, visent à montrer que le résultat se prolonge au cas non linéaire visuel.
L'intérêt est surtout diagnostique. Il met en évidence un mode de défaillance silencieux : une perte d'entraînement basse ne prouve pas que la représentation soit exploitable pour le contrôle. Pour les équipes qui construisent des politiques ou des planificateurs sur des modèles du monde latents, c'est un argument pour ajouter des signaux sensibles à l'action plutôt que de se fier à la seule qualité de prédiction. Ce travail ne contredit pas les approches existantes, il en précise une limite théorique.
Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par les pairs, sans déploiement ni robot physique. Les benchmarks sont des environnements simulés simples, loin de la manipulation à grand nombre de degrés de liberté. Le résultat s'inscrit dans la lignée des JEPA, popularisées par l'équipe de Yann LeCun, et des modèles du monde appris pour le contrôle, face à des approches de type VLA qui apprennent directement les actions. Aucune suite ni calendrier n'est annoncé. L'étape suivante logique serait un passage à l'échelle sur des tâches visuelles plus riches, puis sur du matériel réel.
Dans nos dossiers




