CF-JEPA : renforcer la robustesse des modèles du monde JEPA grâce à la factorisation de la contrôlabilité
Des chercheurs proposent CF-JEPA (Controllability Factorized JEPA), un modèle du monde latent de type JEPA publié en preprint sur arXiv (2610.00727v1). Son principe est de scinder l'espace latent en deux sous-espaces: l'un contrôlable, l'autre non contrôlable. Les informations parasites, comme un arrière-plan changeant ou des éléments visuels sans lien avec la tâche, sont censées se loger dans la partie non contrôlable. La politique de commande n'exploite que la partie contrôlable. Les auteurs annoncent des performances comparables aux méthodes existantes sur des tâches de contrôle 2D et 3D en conditions nominales, et supérieures en présence de distracteurs. CF-JEPA serait le seul modèle testé à ne pas subir d'effondrement latent (latent collapse) dans ce cas. Une validation est aussi présentée sur une tâche de robot simulé. Le résumé ne donne aucun chiffre, ni taux de réussite, ni benchmark nommé, ni comparaison chiffrée avec des modèles concurrents.
L'enjeu est la robustesse de la perception pour le contrôle visuel, un point faible connu des modèles du monde. Les architectures JEPA évitent la reconstruction au niveau du pixel, ce qui devrait les protéger du bruit visuel. Les auteurs montrent que ce n'est pas suffisant: ces modèles restent sensibles aux distracteurs et peuvent s'effondrer, c'est-à-dire produire des représentations dégénérées. Pour un intégrateur, c'est un écart familier entre démonstration en laboratoire et atelier réel, où l'éclairage varie, où des opérateurs passent en arrière-plan et où la scène change. Une séparation explicite entre ce que l'agent peut influencer et ce qu'il ne peut pas influencer est une piste crédible. Les réserves sont claires: les expériences sont en simulation, et rien n'indique encore que l'approche tienne sur du matériel physique ou à l'échelle des politiques VLA actuelles.
Ce travail s'inscrit dans la montée des modèles du monde latents, popularisés par la famille JEPA défendue par Yann LeCun, qui s'oppose aux approches génératives reconstruisant les images. Il concurrence indirectement les modèles du monde génératifs et les méthodes de représentation robustes aux distracteurs, sans que le résumé les nomme. Aucune suite n'est annoncée. Les prochaines étapes logiques sont des benchmarks chiffrés publiés, une validation sur robot réel et des tests face à des distracteurs plus réalistes. Il s'agit d'une contribution de recherche, pas d'un produit ni d'un déploiement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




