Aller au contenu principal
RecherchearXiv cs.RO 

AVL-JEPA : éviter l'effondrement de l'information sur la dynamique causale dans les modèles du monde à architecture prédictive à plongement conjoint

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent AVL-JEPA (action-grounded vision-invariance latent), une méthode d'entraînement destinée aux world models de type JEPA (joint embedding prédictive architecture), publiée sur arXiv sous la référence 2610.03587v1. Les JEPA prédisent les représentations latentes futures sans reconstruire les observations, ce qui leur permet de se concentrer sur la dynamique sémantique de haut niveau. Les auteurs décrivent toutefois un défaut qu'ils nomment « causal dynamics information collapse » : le modèle conserve beaucoup d'information visuelle tout en perdant celle qui relie une action à ses conséquences physiques. Pour y remédier, AVL utilise d'abord l'action exécutée comme ancre auxiliaire de dynamique, afin d'obliger le modèle à préserver cette information. Une seconde voie, dite d'invariance visuelle, aligne ensuite les prédictions latentes issues d'observations perturbées et propres, sans sacrifier cette information. La validation porte sur quatre tâches de contrôle robotique : TwoRoom, PushT, OGBench Cube et Reacher. Selon les auteurs, les taux de succès progressent nettement sous perturbations visuelles, sans dégrader les performances en environnement propre. Le résumé ne donne aucun chiffre précis, ni de gain, ni de taille de modèle.

L'enjeu concerne la robustesse des world models, un point faible fréquent dans le passage du laboratoire au terrain. Un modèle qui planifie dans l'espace latent peut paraître performant en démonstration, puis échouer quand l'éclairage, le bruit de capteur ou les reflets changent, ce qui est courant en usine ou en entrepôt. L'article désigne un mécanisme concret : un JEPA entraîné sans contrainte explicite peut bien reconstruire l'apparence de la scène tout en ignorant ce qui compte pour la planification. Les auteurs ajoutent des diagnostics au-delà du taux de succès : alignement des conséquences physiques, cohérence de la dynamique entre entrées propres et bruitées, et effacement ciblé du sous-espace de transition pour mesurer son effet causal. Cette approche est plus informative qu'un simple score. Pour un intégrateur ou un responsable R&D, ces tests montrent comment vérifier si un modèle comprend vraiment la dynamique avant de le déployer. Il faut cependant relativiser : les quatre tâches sont des benchmarks de recherche, en simulation ou en environnement simplifié, loin de la variabilité industrielle. Il s'agit d'un résultat académique préliminaire (v1), sans validation sur robot réel annoncée.

Ce travail s'inscrit dans le courant des world models prédictifs en espace latent, popularisé par les architectures JEPA, et dans la recherche de planification à partir de représentations apprises. Les benchmarks choisis (PushT, OGBench Cube, Reacher) sont des références courantes pour la manipulation et le contrôle, mais restent modestes face aux modèles de fondation robotiques développés par des acteurs industriels. Le résumé ne cite ni comparaison avec des baselines nommées, ni pilote, ni calendrier de transfert. La suite logique serait de tester la méthode sur des plateformes physiques, avec des perturbations réalistes et des tâches plus longues, avant d'envisager toute intégration dans des pipelines de production.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde
1arXiv cs.RO 

Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde

Une équipe de recherche a soumis le 12 mai 2026 sur arXiv (référence 2605.07514) une étude ciblant un angle mort des World Action Models (WAMs) : la cohérence dynamique entre les actions prédites et les transitions d'état qu'elles sont supposées engendrer. Les WAMs sont des modèles capables de générer des "rollouts" imaginés, c'est-à-dire des séquences futures simulées d'observations et d'actions, pour guider la prise de décision d'un agent robotique. Les auteurs montrent, à travers une étude systématique de modèles de joint-prediction et d'inverse-dynamics, que ces futurs imaginés peuvent être visuellement plausibles tout en étant dynamiquement incompatibles avec la séquence d'actions associée. Ils définissent formellement l'action-state consistency comme l'alignement entre les actions prédites et les transitions d'état induites, et établissent empiriquement que cette métrique distingue fiablement les rollouts réussis des rollouts échoués sur une large variété de tâches. En s'appuyant sur ces résultats, ils proposent une stratégie dite "value-free consensus" pour la sélection à l'inférence : les candidats rollouts sont classés par accord entre futurs prédits, sans recours à un modèle de récompense ni à un entraînement supplémentaire. Cette stratégie améliore les taux de succès sur les benchmarks RoboCasa et RoboTwin 2.0. L'enjeu pratique est direct pour les équipes qui déploient des politiques basées sur des world models : une inconsistance action-état non détectée peut propager des erreurs tout au long d'une séquence planifiée, rendant les rollouts trompeurs même lorsqu'ils semblent visuellement convaincants. Le fait que la métrique suive des tendances similaires aux estimations de valeur apprises suggère qu'elle capture une structure pertinente pour la décision, au-delà du réalisme perceptif. La stratégie consensus sans valeur est notable car elle élimine le besoin d'un reward model, souvent coûteux à entraîner et fragile à distribuer, ce qui la rend directement utilisable dans des pipelines de déploiement existants. Les WAMs s'inscrivent dans le courant plus large des VLAs (Vision-Language-Action models) et des approches de planification par world model, où des systèmes comme DreamerV3 ou des dérivés de modèles de diffusion cherchent à faire planifier un agent dans un espace latent imaginé. Les benchmarks utilisés, RoboCasa et RoboTwin 2.0, sont des environnements de manipulation simulée de référence dans la communauté. Les auteurs identifient également un phénomène limite qu'ils nomment "background collapse" : les trajectoires échouées à faible dynamique peuvent paraître artificiellement cohérentes car prédire un futur statique est plus facile, ce qui constitue un biais à surveiller lors de l'utilisation de cette métrique. Les prochaines étapes naturelles seraient de valider la stratégie consensus sur des plateformes physiques et d'étendre l'analyse à des modèles de type diffusion policy.

RechercheActu
1 source
Cohérence sélective entre points de vue pour les modèles d'action du monde, sans information caméra au test
2arXiv cs.RO 

Cohérence sélective entre points de vue pour les modèles d'action du monde, sans information caméra au test

Des chercheurs publient un article arXiv (2608.21402v1) consacré aux modèles monde-action (World Action Models, WAM), ces architectures qui débruitent conjointement les futures images vidéo et les actions du robot à partir d'un même signal prédictif. Le papier pose une question précise : lors de l'entraînement avec des paires d'images de même état capturées sous des points de vue caméra différents, sur quelles sorties faut-il imposer une contrainte de cohérence entre vues ? Les auteurs montrent que la cible de débruitage d'un WAM mélange des coordonnées covariantes au point de vue (la scène future prédite) et des coordonnées invariantes (le segment d'actions, la proprioception future, la valeur). Appliquer une cohérence sur le bloc covariant s'avère mathématiquement néfaste : elle réduit le contenu spécifique à la vue à une fraction 1/(1+4λ) de sa valeur réelle, un effet vérifié expérimentalement. Leur méthode, la cohérence croisée sélective (SCVC), ne contraint que le bloc invariant, sans nécessiter d'étiquettes caméra, de paramètres extrinsèques, de profondeur ou de synthèse de vue, ni à l'entraînement ni au déploiement. Sur le protocole d'évaluation LIBERO-Plus, avec des points de vue orbitaux tenus à l'écart de l'enveloppe d'entraînement, SCVC améliore le taux de succès en boucle fermée de 12,2 points par rapport à un contrôle apparié (intervalle de confiance à 95 % [7,4 ; 17,0]), et de 15,5 points sur une seconde graine aléatoire indépendante, un gain répliqué sur deux autres axes caméra. Cette avancée cible un point faible connu des modèles vision-langage-action déployés en usine ou en environnement réel : la sensibilité au positionnement exact de la caméra, qui oblige souvent à recalibrer ou réentraîner lorsqu'un intégrateur change de configuration matérielle. En démontrant qu'un simple choix de coordonnées de perte peut faire la différence entre un gain réel d'extrapolation et une simple mémorisation des vues d'entraînement, l'étude questionne aussi la fiabilité de chiffres de robustesse déjà publiés par d'autres équipes, en révélant qu'ils sont souvent biaisés par la stabilité de pose des caméras poignet plutôt que par une réelle généralisation du modèle. Le travail s'inscrit dans la lignée des modèles de fondation robotiques combinant prédiction vidéo et politique d'action, une famille en expansion rapide où la robustesse au changement de point de vue reste un angle mort récurrent entre démonstrations en laboratoire et déploiement terrain. En isolant l'effet de la cohérence croisée de celui de la simple exposition à des paires de vues via un contrôle apparié, et en séparant un plafond intra-distribution d'une véritable extrapolation vers des vues inédites, les auteurs proposent un protocole d'évaluation, le carve-and-hold-out, potentiellement réutilisable par d'autres laboratoires pour auditer leurs propres modèles avant tout déploiement industriel.

UECette contribution méthodologique sur la robustesse des modèles action-monde aux changements de camera pourrait intéresser les intégrateurs robotiques européens sans impliquer directement d'acteur France/UE identifie.

RechercheOpinion
1 source
DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde
3arXiv cs.RO 

DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde

Une équipe de recherche publie DIDO (arXiv 2609.15570, septembre 2026), une méthode de distillation pour les World Action Models (WAM), ces systèmes qui utilisent des modèles de génération vidéo pour prédire la dynamique visuelle future et piloter la manipulation robotique. Le problème de départ est la latence : le débruitage itératif de ces modèles vidéo est incompatible avec un contrôle en boucle fermée. Les auteurs montrent empiriquement que le contenu visuel converge à des vitesses différentes durant le débruitage : le fond statique de la scène se forme dès les premières étapes, tandis que la pince du robot et l'objet manipulé restent flous, leur dynamique d'interaction n'émergeant que lors des étapes suivantes. Tronquer naïvement un modèle multi-étapes à une seule étape préserve donc la structure de la scène mais perd l'information d'interaction, la plus critique pour la manipulation. DIDO combine une distillation par appariement de distribution avec un guidage centré sur l'interaction : des tokens de raisonnement visuel supervisés par boîtes englobantes modélisent la pince, l'objet et leur interaction, et les représentations de l'objet cible sont alignées, sur plusieurs couches, avec les caractéristiques d'un encodeur DINOv3 préentraîné. Résultat : 99,0% de réussite sur LIBERO, 76,6% sur LIBERO-Plus et 92,0% sur RoboTwin, en une seule étape de débruitage. Pour les intégrateurs et chercheurs en robotique, l'enjeu est concret : les modèles vidéo-génératifs produisent des prédictions visuelles de qualité, mais leur coût de calcul itératif les rend souvent inadaptés au temps réel. En ramenant le débruitage à une seule étape sans sacrifier la dynamique gripper-objet, DIDO s'attaque à un des obstacles qui séparent les démonstrations de manipulation en simulation d'un déploiement réactif. Le travail met aussi en garde contre la distillation naïve des WAM : réduire le nombre d'étapes sans traitement spécifique dégrade précisément l'information la plus utile à la tâche. DIDO s'inscrit dans la lignée des World Action Models, qui détournent des générateurs vidéo pour servir de moteur de prédiction à des politiques de manipulation, en s'appuyant sur des encodeurs visuels auto-supervisés comme DINOv3 de Meta, utilisé ici comme signal d'enseignement. Les résultats restent validés sur des benchmarks de simulation standards du secteur (LIBERO, LIBERO-Plus, RoboTwin), complétés par des essais réels sur des tâches longues et des scénarios de généralisation. Aucun partenariat industriel ni date de disponibilité n'est mentionné : il s'agit à ce stade d'une publication de recherche, pas d'un produit livré.

RecherchePaper
1 source
JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique
4arXiv cs.RO 

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique

Des chercheurs présentent JEPA-WAM (arXiv:2608.10780), qui ajoute a un World-Action Model fonde sur Motus un module Stage-JEPA, un prédicteur Joint-Embedding Predictive Architecture conditionne par objectif. L'architecture distingue un futur physique court terme, capturant l'évolution locale de la scene pour l'exécution du geste, d'un futur sémantique au niveau de l'étape, qui représente la progression de la tache d'une phase a la suivante. Stage-JEPA s'appuie sur un encodeur V-JEPA2 gelé pour extraire l'état courant a partir de l'observation et de l'instruction, puis prédit la cible latente de l'étape suivante inférée. Sur 50 taches du benchmark de simulation RoboTwin 2.0, en environnements propres et randomises, le système atteint 90,25 % de réussite globale et réduit de 5,97 % le nombre moyen d'étapes d'exécution dans les épisodes réussis par rapport a la meilleure base de comparaison testée. Ce travail cible une limite connue des politiques vision-langage-action généralistes : la plupart représentent le futur comme un court segment vidéo-action fixe, ce qui capture la dynamique locale mais ignore la progression d'une tache a plusieurs étapes. En séparant prédiction court terme et planification sémantique par étape, JEPA-WAM propose une piste pour réduire l'écart entre réactivité immédiate et raisonnement a plus long horizon, un enjeu partage par des architectures comme Pi-0, GR00T N2 ou Helix qui visent la généralisation entre taches. Le gain de 5,97 % en nombre d'étapes suggère une meilleure efficacité d'exécution sans perte de taux de réussite, un signal utile pour des intégrateurs cherchant a raccourcir les cycles, même si ces résultats restent obtenus en simulation et non en déploiement réel. L'approche s'inscrit dans la lignée des architectures Joint-Embedding Predictive popularisées par V-JEPA et V-JEPA2, des modèles du monde auto-supervises entraines sur vidéo et repris ici comme encodeur gelé plutôt que reentraine. Le choix d'un WAM fonde sur Motus situe la contribution dans la famille grandissante des modèles combinant prédiction du monde et génération d'action, en concurrence avec les approches VLA de Physical Intelligence (Pi-0), Nvidia (GR00T N2) ou Figure (Helix) ; aucun acteur européen n'apparait dans cette publication. L'article, publie sur arXiv sous la référence 2608.10780, ne fixe aucun calendrier de transfert vers des robots physiques ni de partenariat industriel, l'étape suivante habituelle pour ce type de recherche étant la validation hors simulation avant toute intégration commerciale.

RecherchePaper
1 source