Juno : dompter les latents prédictifs des modèles vision-langage-action (VLA)
Des chercheurs publient sur arXiv (2610.09940) Juno, un cadre unifié qui exploite les « latents prédictifs » d'une architecture JEPA (Joint-Embedding Predictive Architecture) pour améliorer les modèles vision-langage-action (VLA). Une JEPA prédit des observations masquées ou futures dans un espace de représentation plutôt qu'en pixels. Juno s'appuie sur une seule JEPA conditionnée par l'action, qui joue trois rôles : backbone de représentation aligné sur le contrôle, enseignant prédictif et modèle de dynamique adaptable. En pré-entraînement, elle est entraînée sur des trajectoires issues de la même morphologie que le robot cible. Une perte « dynamic CLS » transfère la dynamique des patches, pondérée par le mouvement, vers un état global compact. En apprentissage de politique, les patches JEPA de l'image courante sont fusionnés dans la perception du VLA. Une branche de raisonnement découplée, avec ses propres paramètres de transformation, distille les états latents futurs pour générer les actions. Au déploiement, le modèle du monde est adapté sur toutes les transitions observées, échecs compris. L'enseignant adapté est ensuite gelé, et la politique est réalignée sur les exécutions vérifiées via des adaptateurs LoRA et une tête d'action entraînable, sans corrections d'expert ni récompenses de tâche.
Sur le benchmark de simulation SimplerEnv, Juno fait passer le taux de réussite moyen de 60,9 % à 68,5 % face à Qwen3GR00T, la meilleure référence testée. L'adaptation au moment du test porte ce score à 72,7 %. Sur robot réel, la politique conserve 70 à 75 % de réussite quand le fond, la hauteur ou les objets changent, alors que la politique de base tombe à 0 %. Ces chiffres viennent des auteurs, et le papier est une prépublication sans relecture par les pairs. Le nombre d'essais réels, les tâches et la plateforme robotique ne figurent pas dans le résumé, ce qui limite la portée de l'effondrement à 0 % de la référence, un résultat dépendant du protocole.
L'enjeu dépasse le gain de 7,6 points en simulation. Le papier s'attaque à un point faible des VLA déployés : la fragilité face aux décalages de distribution (décor, hauteur de table, objets inédits), qui sépare la démo en laboratoire du fonctionnement en production. Deux idées intéressent les intégrateurs. D'abord, apprendre aussi des échecs, sans opérateur humain ni fonction de récompense. Cela réduirait le coût de réglage sur site, aujourd'hui l'un des principaux freins au déploiement. Ensuite, utiliser un enseignant prédictif figé pour éviter la dérive pendant l'adaptation. Cela dit, une adaptation en ligne exige du calcul embarqué ou un cycle de réentraînement, et la robustesse annoncée reste à confirmer hors du dispositif des auteurs.
Le travail s'inscrit dans la convergence entre les modèles du monde et les VLA. La lignée JEPA, portée par Yann LeCun et Meta avec V-JEPA, sert ici de source de représentations pour l'action. La comparaison avec Qwen3GR00T, un VLA dérivé de la famille GR00T de NVIDIA et adossé à Qwen3, le situe face aux politiques généralistes actuelles, aux côtés de Pi-0 de Physical Intelligence. Aucun déploiement industriel ni code ou calendrier de diffusion n'est annoncé dans le résumé. La suite dépendra de la publication du code, d'évaluations sur d'autres morphologies et d'une reproduction indépendante.
Dans nos dossiers




