Aller au contenu principal
Les trajectoires imaginées sont cinématiques, pas dynamiques : diagnostic d'un échec des modèles du monde à long horizon
RecherchearXiv cs.RO 

Les trajectoires imaginées sont cinématiques, pas dynamiques : diagnostic d'un échec des modèles du monde à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un nouveau diagnostic pour expliquer pourquoi les modèles du monde (world models) utilises en apprentissage par renforcement échouent sur les longs horizons de prédiction. Publie sur arXiv (2607.05966v1), le papier avance que l'explication habituelle, l'erreur qui s'accumule au fil des pas de simulation, est trop générique et ne dit rien sur la nature de cette erreur. Les auteurs proposent une distinction cinématique versus dynamique: un modèle du monde peut imaginer des trajectoires qui restent plausibles au niveau des positions et vitesses (cinématique) sans respecter les forces, frottements et contraintes physiques réelles (dynamique). Pour le mesurer, ils introduisent l'iKCE (imagined Kinematic-Consistency Error), un indicateur pas-a-pas qui compare une trajectoire imaginée a une référence cinématique en forme close, complète par un protocole de perturbation testant si l'iKCE réagit quand les conditions physiques franchissent une frontière de régime. Applique a un checkpoint public de DreamerV3 entraine sur la tache walker-walk du DeepMind Control Suite, l'iKCE des trajectoires imaginées est environ cent fois supérieur a celui de trajectoires réelles équivalentes.

Le résultat le plus parlant vient d'un balayage du coefficient de friction traversant la frontière ou la marche du robot s'effondre: la récompense de la politique entraînée chute brutalement dans cette zone, mais l'iKCE du modèle reste statistiquement plat, preuve que le modèle n'a jamais vraiment intègre la dynamique physique sous-jacente et se contente d'extrapoler des formes de mouvement. Pour l'industrie qui mise sur les modèles du monde pour la planification robotique ou l'apprentissage par simulation, ce travail fournit un outil concret pour distinguer un modèle qui "a compris la physique" d'un modèle qui reproduit des motifs de surface, une nuance cruciale avant tout transfert vers du contrôle réel.

Le papier s'inscrit dans la lignée des travaux sur les world models (PlaNet, Dreamer, DreamerV3) largement utilises en RL base sur modèle, ou la fiabilité des rollouts imagines conditionne directement la qualité des politiques apprises. Les auteurs précisent que leur diagnostic est surtout discriminant aux horizons dépassant la période de marche de l'agent, ouvrant la voie a des benchmarks de robustesse dynamique applicables a d'autres architectures et environnements que DMC walker-walk.

Dans nos dossiers

À lire aussi

Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde
1arXiv cs.RO 

Le futur est-il compatible ? Diagnostic de la cohérence dynamique dans les modèles d'action du monde

Une équipe de recherche a soumis le 12 mai 2026 sur arXiv (référence 2605.07514) une étude ciblant un angle mort des World Action Models (WAMs) : la cohérence dynamique entre les actions prédites et les transitions d'état qu'elles sont supposées engendrer. Les WAMs sont des modèles capables de générer des "rollouts" imaginés, c'est-à-dire des séquences futures simulées d'observations et d'actions, pour guider la prise de décision d'un agent robotique. Les auteurs montrent, à travers une étude systématique de modèles de joint-prediction et d'inverse-dynamics, que ces futurs imaginés peuvent être visuellement plausibles tout en étant dynamiquement incompatibles avec la séquence d'actions associée. Ils définissent formellement l'action-state consistency comme l'alignement entre les actions prédites et les transitions d'état induites, et établissent empiriquement que cette métrique distingue fiablement les rollouts réussis des rollouts échoués sur une large variété de tâches. En s'appuyant sur ces résultats, ils proposent une stratégie dite "value-free consensus" pour la sélection à l'inférence : les candidats rollouts sont classés par accord entre futurs prédits, sans recours à un modèle de récompense ni à un entraînement supplémentaire. Cette stratégie améliore les taux de succès sur les benchmarks RoboCasa et RoboTwin 2.0. L'enjeu pratique est direct pour les équipes qui déploient des politiques basées sur des world models : une inconsistance action-état non détectée peut propager des erreurs tout au long d'une séquence planifiée, rendant les rollouts trompeurs même lorsqu'ils semblent visuellement convaincants. Le fait que la métrique suive des tendances similaires aux estimations de valeur apprises suggère qu'elle capture une structure pertinente pour la décision, au-delà du réalisme perceptif. La stratégie consensus sans valeur est notable car elle élimine le besoin d'un reward model, souvent coûteux à entraîner et fragile à distribuer, ce qui la rend directement utilisable dans des pipelines de déploiement existants. Les WAMs s'inscrivent dans le courant plus large des VLAs (Vision-Language-Action models) et des approches de planification par world model, où des systèmes comme DreamerV3 ou des dérivés de modèles de diffusion cherchent à faire planifier un agent dans un espace latent imaginé. Les benchmarks utilisés, RoboCasa et RoboTwin 2.0, sont des environnements de manipulation simulée de référence dans la communauté. Les auteurs identifient également un phénomène limite qu'ils nomment "background collapse" : les trajectoires échouées à faible dynamique peuvent paraître artificiellement cohérentes car prédire un futur statique est plus facile, ce qui constitue un biais à surveiller lors de l'utilisation de cette métrique. Les prochaines étapes naturelles seraient de valider la stratégie consensus sur des plateformes physiques et d'étendre l'analyse à des modèles de type diffusion policy.

RechercheActu
1 source
Quand les instructions récupèrent des trajectoires : diagnostic et atténuation des échecs de généralisation des modèles VLA
2arXiv cs.RO 

Quand les instructions récupèrent des trajectoires : diagnostic et atténuation des échecs de généralisation des modèles VLA

Des chercheurs publient sur arXiv une analyse des échecs de généralisation des modèles vision-langage-action (VLA), accompagnée d'une méthode de correction baptisée Equivariant Counterfactual Training (ECT). Le constat de départ est que des VLA dépassent 90 % de réussite sur les tâches vues à l'entraînement et résistent aux changements parasites qui ne modifient pas l'action requise (éclairage, objets non pertinents). Ils échouent en revanche dès qu'une modification contrefactuelle impose une action différente, par exemple permuter la position de deux objets. Les auteurs nomment ce défaut « instruction-action binding » : la politique réagit au langage comme à la vision, mais ne les combine pas pour choisir l'action adaptée. Les analyses comportementales, menées sur des versions affinées de π0.5 et de GR00T-N1.7, montrent que les rollouts ratés répètent souvent le comportement de la tâche source ou basculent vers une autre tâche démontrée. Le langage n'est donc pas ignoré : il sert d'index vers une famille de trajectoires connues, et le retour visuel n'en ajuste que l'exécution. Sur le simulateur LIBERO-PRO, l'ECT complet fait passer le taux de réussite moyen de π0.5 en permutation de positions de 36 % à 59 %. Sur CALVIN, où les contreparties existent déjà dans les données, la seule fonction de perte ECT améliore l'enchaînement de cinq tâches sans nouvelle démonstration. Sur un bras UR5e réel, à budget de démonstrations constant, le succès sur positions inédites passe de 8 % à 88 %. Ces résultats portent sur un point central pour le déploiement industriel : un score de robustesse agrégé peut masquer une faiblesse structurelle. Un VLA qui encaisse les perturbations visuelles banales peut rester un récupérateur de trajectoires, incapable de reconfigurer son geste quand la même consigne exige un mouvement différent dans une scène modifiée. Pour un intégrateur, c'est le cas typique d'une cellule dont l'agencement change entre deux lots. Le travail suggère aussi qu'une partie du problème tient à la composition des données et à l'objectif d'imitation, et non à la taille du modèle : lorsque l'action reste conditionnellement étroite, une solution ancrée dans la scène et une solution indexée sur l'instruction sont indiscernables sur les démonstrations. Corriger cela par des paires contrefactuelles, plutôt que par plus de volume, est une piste peu coûteuse. Une réserve s'impose : le gain de 8 % à 88 % vient d'un seul robot et d'un protocole à budget fixe, et le gain en simulation (+23 points) est plus modeste. L'étude s'inscrit dans une série de travaux sur les limites de généralisation des VLA, alors que π0.5 de Physical Intelligence et la famille GR00T de NVIDIA servent de références ouvertes pour les politiques généralistes. Les benchmarks comme LIBERO-PRO et CALVIN ont été conçus pour mesurer cette généralisation, et les auteurs montrent que certains scores flatteurs reposent sur la mémorisation. Les suites probables sont des validations sur d'autres plateformes, des tâches plus longues et d'autres architectures de VLA. Il s'agit d'un préprint non évalué par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Diagnostic et filtrage dynamique des modèles du monde d'occupation pour la cartographie active
3arXiv cs.RO 

Diagnostic et filtrage dynamique des modèles du monde d'occupation pour la cartographie active

Les chercheurs ont figé le planificateur et fait varier uniquement l'occupation fournie, du sans-complétion à la vérité terrain complète en passant par des corrections partielles via un oracle (faux positifs supprimés, faux négatifs restaurés), pour un article déposé sur arXiv sous la référence 2609.06820 (version 2), qui diagnostique une faille méthodologique dans la cartographie active en robotique, où un robot choisit ses points de vue caméra pour reconstruire une scène 3D inconnue à l'aide de réseaux d'occupation préentraînés servant de modèles du monde. Il en ressort que corriger uniquement l'un ou l'autre type d'erreur n'améliore pas de façon fiable la couverture finale de la scène. Même l'occupation parfaite gagne surtout en efficacité du trajet, pas en couverture finale atteinte. Les auteurs proposent enfin un filtrage dynamique qui garde les prédictions en zone inexplorée mais supprime celles répétées sans confirmation, ce qui réoriente, selon des exemples préliminaires, le choix des points de vue vers des surfaces atteignables jusque-là négligées. Ce résultat fissure une hypothèse répandue dans le secteur : qu'améliorer la précision géométrique d'un modèle du monde par occupation suffit à améliorer l'exploration autonome. Pour les concepteurs de robots de cartographie active, drones d'inspection ou véhicules autonomes d'entrepôt (AMR) qui s'appuient sur ce type de perception prédictive, le message est clair : la qualité brute du réseau d'occupation n'est pas le principal goulot d'étranglement, le planificateur et l'accessibilité du terrain pesant au moins autant sur la performance finale. Cela pousse les intégrateurs à investir dans le traitement dynamique de la confiance accordée aux prédictions plutôt que dans la seule précision du réseau de complétion 3D. Le travail s'inscrit dans le champ de longue date de la cartographie active et de la sélection de la meilleure vue suivante, désormais recoupé par la généralisation des réseaux d'occupation appris comme modèles du monde, une tendance parallèle à celle des modèles vision-langage-action utilisés en manipulation. Publié en version 2 sur arXiv en septembre 2026, signe de la révision d'un travail antérieur, l'article reste une contribution académique testée en conditions contrôlées, sans partenaire industriel ni déploiement matériel mentionné. Les auteurs qualifient eux-mêmes leurs résultats de préliminaires : le filtrage dynamique reste à valider à plus grande échelle et à intégrer dans un pipeline complet, potentiellement sur robot réel.

RecherchePaper
1 source
EvolvingAgent : un agent à curriculum auto-évolutif avec modèle du monde continu pour les tâches à long horizon
4arXiv cs.RO 

EvolvingAgent : un agent à curriculum auto-évolutif avec modèle du monde continu pour les tâches à long horizon

Une équipe de chercheurs propose EvolvingAgent, un agent incarné conçu pour accomplir des tâches à horizon long (Long-Horizon, LH) dans des mondes ouverts, sans intervention humaine. Publié sur arXiv (2502.05907, version 3), le système repose sur trois modules en boucle fermée : un planificateur de tâches piloté par les expériences accumulées, qui utilise un LLM pour décomposer une tâche complexe en sous-tâches exécutables ; un contrôleur d'actions guidé par un World Model (WM) continu, chargé de générer les actions de bas niveau et de mettre à jour automatiquement la base d'expériences multimodales via un mécanisme de vérification interne ; et un réflecteur fondé sur l'apprentissage par curriculum (Curriculum Learning, CL) en deux étapes, qui sélectionne les expériences pertinentes pour adapter le WM à chaque nouvelle tâche. Les expériences ont été conduites principalement sur Minecraft, environnement de référence pour les agents incarnés. Résultats revendiqués : +111,74 % de taux de succès moyen par rapport aux approches existantes, réduction d'un facteur supérieur à 6 des actions inefficaces, et généralisation à l'environnement Atari avec des performances comparables au niveau humain. L'apport central d'EvolvingAgent est de s'attaquer simultanément à deux limitations bien documentées dans la littérature : la dépendance aux curricula et données créés par l'humain, et l'oubli catastrophique lors de l'exposition à de nouvelles tâches. La boucle planificateur-contrôleur-réflecteur permet une mise à jour autonome des connaissances du monde sans réentraînement explicite. Pour les chercheurs en IA incarnée et les équipes travaillant sur des agents opérationnels en environnement dynamique (robotique industrielle, systèmes autonomes), cela représente un pas vers une adaptabilité continue sans supervision humaine permanente. Le gain de +111,74 % est néanmoins à contextualiser : il s'appuie sur Minecraft, un sandbox 3D simulé, et les vidéos ou démonstrations n'ont pas été publiées en open access à ce stade. Les travaux sur les agents LH en monde ouvert ont connu une accélération notable depuis Voyager (2023, Microsoft/UT Austin, GPT-4), DEPS, et les approches basées sur des planificateurs symboliques. EvolvingAgent s'inscrit dans ce courant en remplaçant la supervision humaine par une boucle d'auto-amélioration multimodale. Côté concurrent, des systèmes comme GROOT (vidéo-conditionné) ou les agents Minecraft basés sur MineRL continuent de servir de baseline. L'article reste à ce stade un preprint arXiv (v3, sans revue par les pairs confirmée), et aucun déploiement industriel ni partenariat n'est annoncé. Les prochaines étapes naturelles seraient une validation sur des environnements physiques simulés (Isaac Sim, MuJoCo) ou des robots réels, pour mesurer le sim-to-real gap de l'approche.

RecherchePaper
1 source