Aller au contenu principal
Préserver les modes instables grâce à la dynamique inverse dans les modèles du monde JEPA
RecherchearXiv cs.RO 

Préserver les modes instables grâce à la dynamique inverse dans les modèles du monde JEPA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2610.07540) une étude sur un défaut discret des modèles du monde de type JEPA (Joint-Embedding Predictive Architecture) utilisés pour piloter des robots à partir d'images. Les systèmes robotiques présentent souvent des modes instables, c'est-à-dire des directions de l'état le long desquelles une petite perturbation croît sans limite si aucun retour d'état ne la corrige. Les auteurs montrent qu'un entraînement fondé sur la prédiction de l'étape suivante, associé à une régularisation anti-effondrement, ne garantit pas la conservation de ces modes contrôlables : la fonction de perte peut être minimisée alors que ces directions sont écrasées dans la représentation, ce qui rend toute stabilisation impossible. Le remède proposé ajoute un objectif de reconstruction de l'action (une perte de dynamique inverse). Les auteurs démontrent qu'une reconstruction exacte rend l'encodeur injectif sur le sous-espace atteignable en H pas, et que, lorsque H augmente, l'espace propre dominant du gramien de contrôlabilité à horizon fini converge vers le sous-espace instable contrôlable. Les preuves portent sur des systèmes linéaires. Les tests empiriques, sur CartPole, Walker2D et PointMaze, visent à montrer que le résultat se prolonge au cas non linéaire visuel.

L'intérêt est surtout diagnostique. Il met en évidence un mode de défaillance silencieux : une perte d'entraînement basse ne prouve pas que la représentation soit exploitable pour le contrôle. Pour les équipes qui construisent des politiques ou des planificateurs sur des modèles du monde latents, c'est un argument pour ajouter des signaux sensibles à l'action plutôt que de se fier à la seule qualité de prédiction. Ce travail ne contredit pas les approches existantes, il en précise une limite théorique.

Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par les pairs, sans déploiement ni robot physique. Les benchmarks sont des environnements simulés simples, loin de la manipulation à grand nombre de degrés de liberté. Le résultat s'inscrit dans la lignée des JEPA, popularisées par l'équipe de Yann LeCun, et des modèles du monde appris pour le contrôle, face à des approches de type VLA qui apprennent directement les actions. Aucune suite ni calendrier n'est annoncé. L'étape suivante logique serait un passage à l'échelle sur des tâches visuelles plus riches, puis sur du matériel réel.

Dans nos dossiers

À lire aussi

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
1arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source
AVL-JEPA : éviter l'effondrement de l'information sur la dynamique causale dans les modèles du monde à architecture prédictive à plongement conjoint
2arXiv cs.RO 

AVL-JEPA : éviter l'effondrement de l'information sur la dynamique causale dans les modèles du monde à architecture prédictive à plongement conjoint

Des chercheurs proposent AVL-JEPA (action-grounded vision-invariance latent), une méthode d'entraînement destinée aux world models de type JEPA (joint embedding prédictive architecture), publiée sur arXiv sous la référence 2610.03587v1. Les JEPA prédisent les représentations latentes futures sans reconstruire les observations, ce qui leur permet de se concentrer sur la dynamique sémantique de haut niveau. Les auteurs décrivent toutefois un défaut qu'ils nomment « causal dynamics information collapse » : le modèle conserve beaucoup d'information visuelle tout en perdant celle qui relie une action à ses conséquences physiques. Pour y remédier, AVL utilise d'abord l'action exécutée comme ancre auxiliaire de dynamique, afin d'obliger le modèle à préserver cette information. Une seconde voie, dite d'invariance visuelle, aligne ensuite les prédictions latentes issues d'observations perturbées et propres, sans sacrifier cette information. La validation porte sur quatre tâches de contrôle robotique : TwoRoom, PushT, OGBench Cube et Reacher. Selon les auteurs, les taux de succès progressent nettement sous perturbations visuelles, sans dégrader les performances en environnement propre. Le résumé ne donne aucun chiffre précis, ni de gain, ni de taille de modèle. L'enjeu concerne la robustesse des world models, un point faible fréquent dans le passage du laboratoire au terrain. Un modèle qui planifie dans l'espace latent peut paraître performant en démonstration, puis échouer quand l'éclairage, le bruit de capteur ou les reflets changent, ce qui est courant en usine ou en entrepôt. L'article désigne un mécanisme concret : un JEPA entraîné sans contrainte explicite peut bien reconstruire l'apparence de la scène tout en ignorant ce qui compte pour la planification. Les auteurs ajoutent des diagnostics au-delà du taux de succès : alignement des conséquences physiques, cohérence de la dynamique entre entrées propres et bruitées, et effacement ciblé du sous-espace de transition pour mesurer son effet causal. Cette approche est plus informative qu'un simple score. Pour un intégrateur ou un responsable R&D, ces tests montrent comment vérifier si un modèle comprend vraiment la dynamique avant de le déployer. Il faut cependant relativiser : les quatre tâches sont des benchmarks de recherche, en simulation ou en environnement simplifié, loin de la variabilité industrielle. Il s'agit d'un résultat académique préliminaire (v1), sans validation sur robot réel annoncée. Ce travail s'inscrit dans le courant des world models prédictifs en espace latent, popularisé par les architectures JEPA, et dans la recherche de planification à partir de représentations apprises. Les benchmarks choisis (PushT, OGBench Cube, Reacher) sont des références courantes pour la manipulation et le contrôle, mais restent modestes face aux modèles de fondation robotiques développés par des acteurs industriels. Le résumé ne cite ni comparaison avec des baselines nommées, ni pilote, ni calendrier de transfert. La suite logique serait de tester la méthode sur des plateformes physiques, avec des perturbations réalistes et des tâches plus longues, avant d'envisager toute intégration dans des pipelines de production.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde
3arXiv cs.RO 

Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde

Une équipe de recherche a soumis le 12 mai 2026 sur arXiv (référence 2605.07514) une étude ciblant un angle mort des World Action Models (WAMs) : la cohérence dynamique entre les actions prédites et les transitions d'état qu'elles sont supposées engendrer. Les WAMs sont des modèles capables de générer des "rollouts" imaginés, c'est-à-dire des séquences futures simulées d'observations et d'actions, pour guider la prise de décision d'un agent robotique. Les auteurs montrent, à travers une étude systématique de modèles de joint-prediction et d'inverse-dynamics, que ces futurs imaginés peuvent être visuellement plausibles tout en étant dynamiquement incompatibles avec la séquence d'actions associée. Ils définissent formellement l'action-state consistency comme l'alignement entre les actions prédites et les transitions d'état induites, et établissent empiriquement que cette métrique distingue fiablement les rollouts réussis des rollouts échoués sur une large variété de tâches. En s'appuyant sur ces résultats, ils proposent une stratégie dite "value-free consensus" pour la sélection à l'inférence : les candidats rollouts sont classés par accord entre futurs prédits, sans recours à un modèle de récompense ni à un entraînement supplémentaire. Cette stratégie améliore les taux de succès sur les benchmarks RoboCasa et RoboTwin 2.0. L'enjeu pratique est direct pour les équipes qui déploient des politiques basées sur des world models : une inconsistance action-état non détectée peut propager des erreurs tout au long d'une séquence planifiée, rendant les rollouts trompeurs même lorsqu'ils semblent visuellement convaincants. Le fait que la métrique suive des tendances similaires aux estimations de valeur apprises suggère qu'elle capture une structure pertinente pour la décision, au-delà du réalisme perceptif. La stratégie consensus sans valeur est notable car elle élimine le besoin d'un reward model, souvent coûteux à entraîner et fragile à distribuer, ce qui la rend directement utilisable dans des pipelines de déploiement existants. Les WAMs s'inscrivent dans le courant plus large des VLAs (Vision-Language-Action models) et des approches de planification par world model, où des systèmes comme DreamerV3 ou des dérivés de modèles de diffusion cherchent à faire planifier un agent dans un espace latent imaginé. Les benchmarks utilisés, RoboCasa et RoboTwin 2.0, sont des environnements de manipulation simulée de référence dans la communauté. Les auteurs identifient également un phénomène limite qu'ils nomment "background collapse" : les trajectoires échouées à faible dynamique peuvent paraître artificiellement cohérentes car prédire un futur statique est plus facile, ce qui constitue un biais à surveiller lors de l'utilisation de cette métrique. Les prochaines étapes naturelles seraient de valider la stratégie consensus sur des plateformes physiques et d'étendre l'analyse à des modèles de type diffusion policy.

RechercheActu
1 source
Insertion robotique généralisable grâce aux modèles du monde
4arXiv cs.RO 

Insertion robotique généralisable grâce aux modèles du monde

Une équipe de recherche décrit, dans un article publié sur arXiv en septembre 2026 sous le titre "Generalizable Robotic Insertion with World Models" (identifiant 2609.28258v1), un système d'insertion robotique généraliste construit autour d'un modèle du monde (world model) entraîné sur un seul réseau couvrant jusqu'à 90 tâches d'insertion différentes, portant sur des pièces aux géométries variées. Le modèle combine les données proprioceptives du bras robotique avec les images brutes issues d'une caméra montée sur le poignet. Sur des objets totalement inédits, dont la géométrie n'a jamais été vue pendant l'entraînement, le système atteint un taux de réussite de 56% en zero-shot, contre seulement 7% pour une base de référence model-free entraînée dans les mêmes conditions. Les chercheurs montrent aussi que la performance progresse à mesure que le nombre d'objets inclus dans le jeu d'entraînement augmente, signe d'une bonne scalabilité. Un fine-tuning du modèle généraliste sur des objets exclus de l'entraînement initial améliore par ailleurs nettement l'efficacité en données par rapport à un entraînement from scratch, et dépasse parfois ses performances asymptotiques. Ce résultat s'attaque à un goulot d'étranglement connu de l'assemblage robotique en forte mixité de références: les approches actuelles, même très performantes, reposent sur des politiques spécialisées entraînées pièce par pièce, ce qui rend le déploiement sur une nouvelle référence lent et coûteux en ingénierie. Un système capable de généraliser à des pièces jamais vues changerait potentiellement l'équation pour les intégrateurs et les lignes à forte variabilité, en réduisant le travail de reprogrammation à chaque changement de produit. Les auteurs présentent leur travail comme le premier système capable d'assembler des objets inédits de façon entièrement pilotée par les données, sans modélisation géométrique explicite préalable, ce qui alimente le débat sur la capacité réelle des architectures génériques à tenir la charge en manipulation fine, un terrain où l'écart entre démonstration et fiabilité industrielle reste habituellement large. Ce travail s'inscrit dans la tendance de fond de la robotique de manipulation, où la recherche cherche à remplacer les politiques spécialisées task-specific par des modèles généralistes transférables d'un objet ou d'une tâche à l'autre, dans la lignée des efforts en cours autour des architectures vision-langage-action. Il reste à ce stade un résultat de recherche publié en preprint, sans partenaire industriel cité, ni site de déploiement, ni calendrier de commercialisation: les auteurs parlent d'une étape significative vers des systèmes d'assemblage généralisables et scalables, formulation à lire comme un jalon scientifique plutôt qu'une annonce produit. Les suites attendues pour ce type d'approche sont l'extension à davantage de tâches et de géométries, ainsi qu'une validation en conditions de production réelles, où robustesse et temps de cycle devront être mesurés au-delà des benchmarks de laboratoire.

RecherchePaper
1 source