
Superviser ce qui décide du succès : pertes auxiliaires alignées sur le critère pour la planification avec un modèle du monde latent
Des chercheurs proposent une méthode d'entraînement qui force les modèles du monde latents à conserver dans leur état interne les grandeurs physiques réellement utilisées pour juger la réussite d'une tâche. Le travail, publié sur arXiv (2610.01224), part d'un constat mesuré sur quatre modèles du monde latents : la position de l'effecteur terminal y est encodée avec une erreur supérieure à la tolérance du critère de succès. Dans ces conditions, l'état latent ne permet pas de distinguer un candidat réussi d'un candidat qui échoue. La correction est une perte auxiliaire : pendant l'entraînement, une tête linéaire branchée sur les sorties de l'encodeur et du prédicteur régresse les grandeurs du critère de succès, et l'erreur de régression s'ajoute à la perte d'apprentissage. La tête est supprimée ensuite, si bien que le modèle, son coût de calcul et ses entrées restent inchangés à l'inférence. Seule cette perte fait gagner 3,5 points de taux de succès (en absolu) sur PushT et 3,4 points sur la tâche du cube, deux écarts que les auteurs jugent statistiquement significatifs.
L'intérêt tient à la nature du défaut identifié. Les modèles du monde latents planifient en notant des séquences d'actions candidates par des distances dans l'espace latent, alors que le succès se juge en grandeurs physiques, comme une position à quelques millimètres près. Si le latent écrase ces grandeurs, le planificateur optimise un proxy mal aligné avec l'objectif réel, quelle que soit la qualité de la prédiction dynamique. Pour les équipes qui déploient ou évaluent ces modèles en manipulation, cela déplace la question : l'enjeu n'est pas seulement l'échelle ou l'architecture, mais ce que la représentation conserve. Le coût d'intégration est quasi nul, puisque rien ne change à l'inférence. Les gains restent toutefois modestes (environ 3 points) et mesurés sur des benchmarks de simulation relativement simples. Rien n'indique à ce stade qu'ils se transposent à des robots réels ou à des tâches à longue portée.
Le contexte est celui de la montée des modèles du monde latents de type JEPA, entraînés à prédire l'évolution d'un état compact plutôt que des pixels, et utilisés pour la planification par échantillonnage. Ces approches se positionnent face aux politiques VLA entraînées par imitation, comme Pi-0 ou GR00T, et aux modèles génératifs de vidéo. Leur promesse est un calcul plus léger à l'exécution, mais leur fiabilité dépend de la fidélité de l'espace latent. Les auteurs formulent ce principe de façon générale : le critère de succès définit ce que le modèle doit retenir. La suite logique serait de tester d'autres grandeurs de critère, d'autres tâches et des plateformes physiques. L'article est pour l'instant une prépublication, sans validation par les pairs ni déploiement annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




