Aller au contenu principal
Les facteurs de succès en planification physique avec des modèles du monde prédictifs à embedding joint
RecherchearXiv cs.RO 

Les facteurs de succès en planification physique avec des modèles du monde prédictifs à embedding joint

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de Meta AI (FAIR) ont publié une étude systématique des modèles du monde à architecture prédictive par plongement conjoint, désignés sous l'acronyme JEPA-WM (Joint-Embedding Predictive Architecture World Models), appliqués à la planification physique d'agents autonomes. L'équipe a analysé trois dimensions techniques critiques : architecture du modèle, objectif d'entraînement et algorithme de planification, sur des environnements simulés et sur des données robotiques réelles, pour des tâches de navigation et de manipulation. Au terme de cette ablation, ils proposent une configuration qui surpasse deux baselines de référence, DINO-WM et V-JEPA-2-AC. Le code, les checkpoints et les données sont accessibles publiquement sur GitHub (facebookresearch/jepa-wms).

L'originalité des JEPA-WM tient à leur mode de planification : plutôt que d'opérer dans l'espace d'entrée brut (pixels, vecteurs d'état), ces modèles planifient dans l'espace de représentation appris, ce qui permet d'abstraire les détails visuels non pertinents et d'accélérer la recherche de trajectoires. La contribution principale de ce travail n'est pas une nouvelle architecture, mais un guide empirique des choix qui font réellement la différence. Pour un intégrateur ou une équipe R&D robotique, cela comble un vide récurrent dans la littérature : savoir quelles décisions d'implémentation ont de l'impact, et lesquelles n'en ont pas. Le fait que les expériences couvrent des données réelles, et pas uniquement de la simulation, renforce la crédibilité des conclusions et réduit partiellement le problème classique du gap sim-to-real qui fragilise beaucoup de travaux sur les world models pour la manipulation.

Les JEPA (Joint-Embedding Predictive Architectures) constituent une famille de modèles portée par Yann LeCun et FAIR comme alternative aux architectures génératives classiques (diffusion, autorégressif) pour modéliser le monde physique. V-JEPA-2, sorti début 2025, en représentait une étape clé ; V-JEPA-2-AC, l'une des baselines ici surpassées, en est la variante avec conditionnement par actions. DINO-WM, l'autre référence, combine des features DINO avec une planification par modèle du monde. Cette étude s'inscrit dans un contexte de forte compétition autour des modèles fondationnels pour la robotique, où Physical Intelligence (pi.), Google DeepMind, et des acteurs européens comme Enchanted Tools ou Wandercraft développent leurs propres pipelines de planification et de contrôle. Les prochaines étapes naturelles incluraient une mise à l'échelle des données d'entraînement et une extension à des morphologies robotiques plus variées, notamment humanoïdes.

Impact France/UE

Les guidelines empiriques et checkpoints open-source de FAIR pourraient bénéficier directement aux équipes R&D européennes (Enchanted Tools, Wandercraft) développant leurs propres pipelines de planification physique sur world models.

À lire aussi

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique
1arXiv cs.RO 

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique

Des chercheurs présentent JEPA-WAM (arXiv:2608.10780), qui ajoute a un World-Action Model fonde sur Motus un module Stage-JEPA, un prédicteur Joint-Embedding Predictive Architecture conditionne par objectif. L'architecture distingue un futur physique court terme, capturant l'évolution locale de la scene pour l'exécution du geste, d'un futur sémantique au niveau de l'étape, qui représente la progression de la tache d'une phase a la suivante. Stage-JEPA s'appuie sur un encodeur V-JEPA2 gelé pour extraire l'état courant a partir de l'observation et de l'instruction, puis prédit la cible latente de l'étape suivante inférée. Sur 50 taches du benchmark de simulation RoboTwin 2.0, en environnements propres et randomises, le système atteint 90,25 % de réussite globale et réduit de 5,97 % le nombre moyen d'étapes d'exécution dans les épisodes réussis par rapport a la meilleure base de comparaison testée. Ce travail cible une limite connue des politiques vision-langage-action généralistes : la plupart représentent le futur comme un court segment vidéo-action fixe, ce qui capture la dynamique locale mais ignore la progression d'une tache a plusieurs étapes. En séparant prédiction court terme et planification sémantique par étape, JEPA-WAM propose une piste pour réduire l'écart entre réactivité immédiate et raisonnement a plus long horizon, un enjeu partage par des architectures comme Pi-0, GR00T N2 ou Helix qui visent la généralisation entre taches. Le gain de 5,97 % en nombre d'étapes suggère une meilleure efficacité d'exécution sans perte de taux de réussite, un signal utile pour des intégrateurs cherchant a raccourcir les cycles, même si ces résultats restent obtenus en simulation et non en déploiement réel. L'approche s'inscrit dans la lignée des architectures Joint-Embedding Predictive popularisées par V-JEPA et V-JEPA2, des modèles du monde auto-supervises entraines sur vidéo et repris ici comme encodeur gelé plutôt que reentraine. Le choix d'un WAM fonde sur Motus situe la contribution dans la famille grandissante des modèles combinant prédiction du monde et génération d'action, en concurrence avec les approches VLA de Physical Intelligence (Pi-0), Nvidia (GR00T N2) ou Figure (Helix) ; aucun acteur européen n'apparait dans cette publication. L'article, publie sur arXiv sous la référence 2608.10780, ne fixe aucun calendrier de transfert vers des robots physiques ni de partenariat industriel, l'étape suivante habituelle pour ce type de recherche étant la validation hors simulation avant toute intégration commerciale.

RecherchePaper
1 source
Chemin de planification dans des modèles du monde physiquement viables
2arXiv cs.RO 

Chemin de planification dans des modèles du monde physiquement viables

Des chercheurs présentent un nouveau modèle de monde "physiquement viable" destiné à la planification de trajectoires pour robots évoluant en extérieur, dans des environnements non structurés. Le constat de départ est simple : les opérateurs ne peuvent pas recartographier un site vaste ou isolé avant chaque mission, si bien que les robots planifient leurs déplacements à partir de reconstructions de scène collectées à l'avance, en supposant à tort que le terrain reste inchangé. Le système décrit dans l'article, publié sur arXiv (2607.00673v1), enrichit des scènes reconstruites en 3D Gaussian splatting avec une simulation physique capable de générer des versions modifiées de l'environnement (inondation, déformation, obstacles nouveaux) sans avoir à recollecter de données capteurs ni à reconstruire la carte. Un planificateur sensible au terrain exploite ensuite ces versions simulées pour évaluer si un itinéraire prévu reste praticable avant que le robot ne s'y engage. Les tests ont été menés sur un site extérieur réel du centre du Texas, avec plusieurs niveaux de sévérité de crue simulée. L'enjeu est celui de la fiabilité des robots autonomes déployés loin de toute supervision humaine constante, en logistique, agriculture, secours ou surveillance de sites. Aujourd'hui, la plupart des systèmes planifient sur une carte figée et découvrent les changements de terrain en cours de route, parfois trop tard pour faire demi-tour, notamment dans les environnements contraints où le repli devient impossible une fois les conditions dégradées. En montrant que des échecs d'itinéraire à long horizon et des besoins de recalcul de trajectoire n'apparaissent que lorsque le terrain futur est simulé, et pas sur la reconstruction d'origine, les auteurs pointent une limite concrète des pipelines de planification actuels, encore trop dépendants de cartes statiques. Ce travail s'inscrit dans la tendance récente d'utilisation du 3D Gaussian splatting pour la reconstruction de scènes robotiques, combinée ici à la simulation physique pour anticiper l'évolution d'un environnement plutôt que se contenter de le capturer une fois pour toutes. Il s'agit pour l'instant d'un résultat de recherche évalué sur un unique site de test avec un scénario d'inondation, sans indication de déploiement industriel ni de comparaison directe avec des solutions commerciales existantes. Les auteurs évoquent la généralisation à d'autres types de changements de terrain comme prolongement naturel de ces travaux.

RecherchePaper
1 source
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
3arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source
Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques
4arXiv cs.RO 

Au-delà des emplacements d'instances : des modèles du monde sémantiquement riches pour la planification d'interactions physiques

Des chercheurs présentent SR-WM (Semantically Rich World Model), un modèle du monde conditionné par la tâche pour la planification d'interactions physiques en robotique de manipulation, détaillé dans un article publié sur arXiv sous la référence 2608.22294v1. Plutôt que de se limiter à prédire des observations futures ou des caractéristiques latentes, comme le font les modèles du monde classiques, SR-WM structure sa représentation autour de cinq rôles fonctionnels explicites: gripper, cible, but, relation et phase. Un encodeur d'entités visuelles extrait des hypothèses d'entités à partir de caractéristiques de patchs pré-entraînées, les masques de segmentation servant d'indices optionnels plutôt que d'entrées obligatoires. Un module de liaison de rôles associe ensuite ces hypothèses aux rôles spécifiques à la tâche, tandis qu'un modèle de dynamique conditionné par l'action prédit les transitions de rôles ainsi que des éléments fins: contact, établissement de relations entre objets, préservation de ces relations et changement de phase. L'ensemble est évalué sur les quatre suites de simulation LIBERO, avec des tests de transfert inter-suites, des diagnostics de perception et une analyse de sensibilité aux actions. Pour l'industrie de la manipulation robotique et les équipes travaillant sur des architectures vision-langage-action (VLA), ce travail cible un écart précis: un modèle qui prédit correctement des pixels ou des embeddings futurs ne garantit pas qu'il comprenne si une action préserve les relations nécessaires à la réussite d'une tâche, comme ne pas rompre une prise ou déplacer un objet hors de sa zone cible. En rendant explicites des rôles fonctionnels plutôt que de s'appuyer sur des slots d'objets indifférenciés ou un état monolithique, SR-WM propose une interface sémantique reliant dynamique visuelle et décision de planification, utilisée pour générer plusieurs candidats d'action, les reclasser selon l'étape de la tâche, et rechantillonner en cas de violation détectée. C'est une piste concrète pour fiabiliser la sélection d'actions issues de politiques apprises, plutôt que de juger leur qualité sur des démonstrations sélectionnées ou des taux de réussite bruts en simulation. Ce travail s'inscrit dans la lignée des recherches sur les représentations centrées objets pour les modèles du monde, qui cherchent depuis plusieurs années à dépasser les limites des slots d'instances indifférenciés en robotique par apprentissage. LIBERO, le benchmark utilisé pour l'évaluation, est devenu une référence standard pour tester la généralisation des politiques de manipulation entre familles de tâches. L'article ne fait état d'aucun déploiement matériel, partenariat industriel ou test sur robot réel: il s'agit d'une contribution académique évaluée exclusivement en simulation. Les suites naturelles pour ce type d'approche, transfert sim-to-real et intégration à des pipelines VLA existants, ne sont ni annoncées ni datées dans l'article.

RecherchePaper
1 source