Aller au contenu principal
Modèles du monde nativement physiques : perspective hamiltonienne pour la modélisation générative
RecherchearXiv cs.RO 

Modèles du monde nativement physiques : perspective hamiltonienne pour la modélisation générative

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a déposé début mai 2026 sur arXiv (référence 2605.00412v1) un article de position proposant un nouveau cadre théorique pour les modèles du monde en IA incarnée : les Hamiltonian World Models. L'idée centrale est d'encoder les observations d'un robot ou d'un agent autonome dans un espace de phase latent structuré, de faire évoluer cet état via une dynamique inspirée du formalisme hamiltonien de la mécanique classique (avec des termes de contrôle, de dissipation et des résidus appris), puis de décoder la trajectoire prédite en observations futures exploitables pour la planification. Il s'agit d'un preprint théorique sans résultats expérimentaux publiés à ce stade.

L'argument principal avancé est que le véritable goulot d'étranglement des modèles du monde n'est plus leur capacité à générer des futurs visuellement réalistes, mais à produire des prédictions physiquement cohérentes et exploitables pour la décision sur un horizon long. Les trois courants dominants actuels peinent chacun à garantir cette stabilité physique : les modèles vidéo génératifs 2D (à la Sora ou Genie), les modèles 3D centrés sur la reconstruction de scènes, et les modèles latents prédictifs de type JEPA (portés notamment par Yann LeCun chez Meta) progressent en silo sans répondre aux exigences du contrôle robotique réel. Pour les équipes de reinforcement learning basé sur modèles (MBRL) et les intégrateurs robotiques, cela se traduit concrètement par des politiques qui dérivent lors des rollouts simulés, fragilisant le transfert sim-to-real. Ancrer la dynamique latente dans le formalisme hamiltonien promettrait une meilleure interprétabilité des représentations internes, une moindre consommation de données d'entraînement et une stabilité accrue en inférence longue.

Les auteurs reconnaissent eux-mêmes les obstacles pratiques majeurs : friction, contacts discontinus, forces non-conservatives et objets déformables rendent l'application directe du hamiltonien aux scènes robotiques réelles particulièrement complexe. Ce travail s'inscrit dans un renouveau plus large des world models, porté par Dreamer (Google DeepMind), JEPA (Meta), Genie 2 (Google DeepMind) et les travaux de Physical Intelligence sur les Visual-Language-Action models, mais il se distingue par un ancrage explicite en physique analytique plutôt qu'en apprentissage purement statistique. Aucun déploiement ni partenariat industriel n'est annoncé : l'article reste pour l'instant une contribution théorique ouvrant une direction de recherche.

À lire aussi

PH-Dreamer : un modèle du monde piloté par la physique via la dynamique générative port-hamiltonienne
1arXiv cs.RO 

PH-Dreamer : un modèle du monde piloté par la physique via la dynamique générative port-hamiltonienne

Des chercheurs ont publié PH-Dreamer (arXiv:2605.18303, mai 2026), une architecture de modèle du monde intégrant un cadre Port-Hamiltonien dans les réseaux récurrents à espace d'état utilisés en apprentissage par renforcement basé sur des modèles. L'approche combine trois mécanismes couplés : des priors physiques dans les transitions latentes via un routage d'énergie contrôlé par flux et dissipation, un modèle d'énergie estimant le Hamiltonien et le bilan de puissance à partir d'observations proprioceptives, et un Actor-Critic guidé par énergie avec multiplicateurs de Lagrange pour régulariser l'optimisation de politique. Evaluée sur des benchmarks de contrôle visuel, l'architecture réduit le volume de l'espace de phase latent de 4,18 à 8,41 %, la consommation d'énergie simulée jusqu'à 7,80 %, et le jerk quadratique moyen (mesure de la brutalité des transitions de commande) jusqu'à 9,38 %, tout en améliorant les rendements asymptotiques. L'enjeu central est la fidélité physique des simulateurs internes : les modèles du monde conventionnels opèrent dans un espace latent non contraint, produisant des trajectoires qui violent la conservation d'énergie et les principes dissipatifs. Pour un ingénieur de contrôle ou un intégrateur robotique, un simulateur interne mieux calibré réduit l'écart sim-to-real et améliore la robustesse au transfert vers des systèmes physiques. La réduction de jerk est mécaniquement pertinente : des commandes plus lisses diminuent l'usure des actionneurs sur des robots réels. Le résultat le plus significatif reste la réduction de variance entre récompenses imaginées et réelles, indicateur de calibration du modèle plutôt que simple gain de tâche, ce qui constitue une contribution exploitable concrètement pour le transfert sim-to-real en robotique de manipulation. PH-Dreamer s'inscrit dans la lignée des travaux Dreamer de Google DeepMind (Hafner et al.), référence en RL basé sur modèle pour le contrôle visuel à faible nombre d'échantillons. L'intégration du formalisme Port-Hamiltonien dans les réseaux de neurones est un champ actif depuis les Hamiltonian Neural Networks de Greydanus et al. (2019) et les réseaux lagrangiens neuronaux. PH-Dreamer étend cette logique aux modèles récurrents génératifs complets, là où les travaux précédents se limitaient à des systèmes plus simples. Il s'agit d'un preprint de recherche fondamentale sans déploiement industriel annoncé. Les prochaines étapes naturelles incluent des validations sur robots physiques avec proprioception réelle et des comparaisons directes avec DreamerV3 et TD-MPC2 en conditions de transfert réel.

RecherchePaper
1 source
PileBelief : un état physique persistant pour la modélisation du monde pilotée par l'interaction
2arXiv cs.RO 

PileBelief : un état physique persistant pour la modélisation du monde pilotée par l'interaction

Des chercheurs présentent PileBelief, un modèle du monde pour l'excavation robotique, dans un article publié le 22 septembre 2026 sur arXiv (2609.22858v1). Le système cible un problème concret: à chaque coup de godet, le terrain change de forme et les observations locales ne suffisent plus à connaître l'état réel du sol, sa résistance ou son support sous la surface visible. PileBelief combine un a priori physique conditionné par l'observation avec une mémoire de déformation indexée dans l'espace et une mémoire de réponse physique, affinées par des lectures alignées sur l'action et des corrections résiduelles ciblées. Une fois les poids figés au déploiement, les interactions réellement exécutées mettent à jour une croyance mesurée sur le sol, tandis que les actions hypothétiques font évoluer un état imaginé distinct. Face à une base de référence limitée à l'observation courante, PileBelief réduit l'erreur de prédiction conjointe à cinq pas de temps de 10,8% et le regret de sélection d'action hors ligne de 65,5%, avec des gains confirmés en simulation physique Newton/MPM et sur des données d'excavation réelle, notamment pour la prédiction du volume de godet. Pour la robotique de chantier et le BTP autonome, ce travail cible un verrou concret: contrairement à la manipulation d'objets rigides, l'excavation transforme en continu l'environnement, ce qui rend aveugles les modèles du monde classiques limités à l'image courante face à ce qui a été creusé ou déplacé hors champ de vision. En conservant une mémoire persistante de l'état physique plutôt qu'en repartant de zéro à chaque observation, l'approche se rapproche du comportement d'un opérateur expérimenté qui se souvient de ce qu'il a déjà retiré. Le gain de 65,5% sur le regret de sélection d'action est le chiffre le plus parlant pour les intégrateurs, car il montre que le modèle choisit de meilleures actions candidates, pas seulement qu'il prédit mieux visuellement, ce qui alimente un débat plus large sur les modèles du monde en robotique: l'observation instantanée, même bien traitée, ne suffit pas dans les tâches où l'environnement est irréversiblement transformé par l'action du robot. L'article se positionne face aux modèles du monde instantanés qui dominent la recherche en manipulation robotique, généralement limités à une image ou un nuage de points par prédiction, sans mémoire à long terme sur l'état physique du terrain. En distinguant une croyance mesurée, mise à jour uniquement par des actions réellement exécutées, d'un état imaginé servant à évaluer des actions hypothétiques sans corrompre cette croyance, les auteurs proposent une architecture potentiellement réutilisable pour d'autres tâches de transformation continue de l'environnement, comme le terrassement ou la manutention de matériaux en vrac. Le papier reste au stade de prépublication de recherche, sans mention de déploiement industriel ni de partenaire commercial, et ouvre la voie à des travaux visant à valider l'approche sur davantage de types de sols et sur des engins d'excavation grandeur réelle.

RecherchePaper
1 source
Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle
3arXiv cs.RO 

Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle

Hydra-0, un nouveau modèle du monde généraliste pour la robotique, a été présenté dans un preprint publié sur arXiv le 19 août 2026 (arXiv:2608.18077). Le système repose sur un concept baptisé "action flow" : les actions du robot y sont représentées comme un flux de mouvement de pixels plutôt que comme des commandes articulaires classiques, ce qui crée une interface visuelle commune permettant d'apprendre les conséquences des actions à travers différents robots, tâches, environnements et architectures de génération vidéo. Dans sa meilleure configuration, Hydra-0 réduit l'erreur de mouvement du robot de 90,4% et l'erreur de mouvement des objets de 60,2% par rapport à une base de référence conditionnée par l'action classique. Sur le benchmark RoboLab, le modèle atteint une corrélation de Pearson de r=0,96 entre les taux de réussite rejoués en simulation et les taux de réussite de référence, un signal de fidélité élevé pour l'évaluation de politiques en boucle ouverte. Les auteurs décrivent aussi un mode inverse émergent : le modèle peut prédire un mouvement robotique compatible à partir d'un flux d'objet désiré transféré depuis une démonstration humaine, une "tête d'action" entraînée convertissant ensuite ces représentations latentes en actions exécutables sans démonstration robotique experte spécifique à la tâche. Pour l'industrie robotique, ce travail s'attaque directement à deux goulots d'étranglement connus des approches vision-language-action (VLA) : la dépendance à des démonstrations robotiques coûteuses par tâche, et la difficulté à faire généraliser un modèle entre embodiments et environnements hétérogènes. En transformant l'action en un signal visuel partagé, l'approche promet une adaptation plus économe en données et une composition zero-shot de comportements, deux propriétés recherchées par les intégrateurs qui veulent déployer un même modèle sur plusieurs plateformes matérielles sans réentraînement lourd. Il faut toutefois noter qu'il s'agit d'un résultat de recherche publié en preprint, évalué sur un benchmark interne (RoboLab) et non d'un système déployé en production ou en usine ; les gains annoncés restent à confirmer par une évaluation indépendante et par des essais sur robots physiques réels au-delà du cadre expérimental décrit. Ce travail s'inscrit dans la vague plus large des modèles du monde et des architectures VLA développés ces dernières années pour unifier perception, prédiction et contrôle robotique, un axe de recherche où plusieurs laboratoires cherchent à résoudre le fossé entre démonstrations en simulation et transfert vers le réel. La piste ouverte par le mode inverse d'Hydra-0, apprendre le contrôle à partir de vidéos humaines sans démonstration robotique dédiée, pourrait, si elle se confirme à plus grande échelle, réduire significativement le coût de collecte de données pour l'entraînement de politiques robotiques généralistes. L'article ne précise pas de calendrier de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
Modèles du monde vidéo pour la robotique : applications, défis de recherche et perspectives d'avenir
4arXiv cs.RO 

Modèles du monde vidéo pour la robotique : applications, défis de recherche et perspectives d'avenir

Une équipe de chercheurs affiliée au laboratoire IRoM de l'université de Princeton publie une revue de littérature sur les "video world models" (modèles de monde vidéo) appliqués à la robotique, mise à jour en version 2 sur arXiv sous l'identifiant 2601.07823. Le papier recense l'état de l'art sur l'usage de générateurs vidéo comme modèles de monde incarnés couvrant cinq usages principaux : la génération de données d'entraînement, l'apprentissage de politiques, la modélisation de la dynamique et des récompenses pour l'apprentissage par renforcement, l'évaluation de politiques et la planification visuelle. Les auteurs soulignent la capacité de ces modèles à produire des simulations de corps déformables photoréalistes et physiquement cohérentes sans les simplifications lourdes des simulateurs physiques classiques, tout en documentant des limites persistantes : mauvais suivi des instructions, hallucinations se traduisant par des violations des lois de la physique, génération de contenu non sûr, et coût de calcul et de données prohibitif. Une bibliographie organisée et ouverte à la communauté est mise à disposition sur GitHub, à l'adresse irom-princeton/awesome-robotics-vidéo-world-model-papers. Pour l'industrie robotique, ce travail synthétise un argument structurant : les modèles vidéo pourraient remplacer, ou compléter, les simulateurs physiques traditionnels comme brique de génération de données synthétiques et d'évaluation de politiques, réduisant la dépendance coûteuse à la collecte de données réelles ou au réglage fin d'environnements simulés, un enjeu direct pour l'entraînement des modèles vision-langage-action (VLA) dont le goulot d'étranglement reste la quantité et la diversité des démonstrations disponibles. Mais la revue tempère l'enthousiasme ambiant autour des "foundation world models" : les hallucinations physiques documentées par les auteurs montrent que ces générateurs, aussi impressionnants visuellement, ne garantissent pas encore la cohérence physique nécessaire à un usage fiable dans des boucles d'entraînement ou d'évaluation critiques pour la sécurité. Pour les intégrateurs et décideurs B2B, le message est de traiter ces outils comme prometteurs mais encore expérimentaux plutôt que comme des remplaçants prêts à l'emploi des pipelines de simulation existants. Cette synthèse s'inscrit dans la vague de recherche déclenchée par les progrès des modèles de diffusion et de génération vidéo appliqués hors du divertissement, où plusieurs laboratoires explorent, dans le sillage de l'essor des modèles vision-langage-action, leur usage comme substituts ou compléments aux moteurs physiques classiques pour la robotique. En consolidant la littérature existante sous forme de taxonomie des usages et de liste structurée de défis ouverts, les auteurs visent moins à annoncer un produit qu'à orienter les efforts de recherche à venir vers des solutions plus fiables pour les déploiements en environnements critiques pour la sécurité. Le projet reste académique, sans produit commercial ni partenariat industriel annoncé, mais la base bibliographique collaborative hébergée sur GitHub, ouverte aux contributions, indique que le sujet est appelé à structurer les prochains travaux sur les modèles de fondation en robotique.

UECette synthèse académique en libre accès sur GitHub peut orienter les laboratoires de recherche européens en robotique, sans impliquer d'acteur ou de régulation française ou européenne.

RecherchePaper
1 source