Aller au contenu principal
RecherchearXiv cs.RO 

DeltaWorld : simulateurs de monde interactifs physiquement cohérents par apprentissage d'incréments latents conditionnés par l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent DeltaWorld, un simulateur de monde interactif pour la manipulation robotique, décrit dans un preprint arXiv (2610.02691v1). Les modèles de monde actuels prédisent l'état latent suivant en entier, ce qui leur fait souvent manquer les changements subtils provoqués par les actions du robot. Le résultat peut être physiquement implausible : objets qui s'interpénètrent, déformations excessives. DeltaWorld change de paradigme avec un « Delta Latent Transition Model » (Delta-LTM). Celui-ci prédit uniquement la variation latente induite par l'action, puis l'ajoute à l'état courant pour obtenir l'état suivant. Un second module, l'« Interaction-aware Latent Alignment », construit des régions d'interaction contrefactuelles et supervise les changements latents liés au contact. Le modèle est évalué sur le benchmark de manipulation IWS et sur un jeu de données multi-robots collecté par les auteurs, couvrant plusieurs morphologies et tâches. Sur ce dernier, DeltaWorld réduit la FVD (Fréchet Video Distance) de 46,6 % et la LPIPS de 31,1 % par rapport à la baseline IWS.

L'enjeu dépasse la métrique vidéo. Un simulateur interactif fiable permettrait de planifier, d'entraîner des politiques et de les évaluer sans multiplier les essais physiques, ce qui coûte cher en temps, en matériel et en supervision. Or un modèle de monde qui laisse un objet traverser la pince produit des trajectoires inexploitables pour l'entraînement de politiques VLA (vision-langage-action) ou pour l'évaluation hors ligne. Prédire l'incrément plutôt que l'état complet est un choix d'architecture simple, et il cible le défaut principal des modèles actuels : la dérive physique sur les longs horizons. Il faut toutefois rester prudent. FVD et LPIPS mesurent la qualité perceptuelle, pas la justesse physique ; aucune mesure de taux de succès de politique ou de corrélation avec le monde réel n'est mentionnée dans le résumé. Le jeu de données multi-robots n'étant pas public à ce stade, les gains restent à confirmer indépendamment.

Ce travail s'inscrit dans la course aux « world models » pour la robotique, où les simulateurs appris sont présentés comme une alternative ou un complément à la simulation physique classique, et comme un moyen de réduire l'écart simulation-réel. Il se positionne contre IWS, la baseline de référence ici, et s'adresse au même terrain que les grands modèles de monde et de vidéo développés par les laboratoires industriels. Aucune implication d'entreprise, européenne ou autre, ni calendrier de déploiement ou de mise en open source n'est précisé dans le résumé. Il s'agit d'un preprint de recherche, non d'un produit livré. Les prochaines étapes à surveiller sont la publication du code et des données, des tests sur des horizons plus longs, et surtout la preuve que ces simulateurs améliorent concrètement l'entraînement et l'évaluation de politiques sur robot réel.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

PRICE des segments d'actions : attribution de crédit physique et relationnelle pour l'apprentissage par renforcement incarné
1arXiv cs.RO 

PRICE des segments d'actions : attribution de crédit physique et relationnelle pour l'apprentissage par renforcement incarné

Des chercheurs proposent PRICE (Physical Relations for Inferring Credit from Episodes), une méthode d'apprentissage par renforcement (RL) pour post-entraîner des politiques vision-langage-action (VLA) à partir du seul signal de succès ou d'échec en fin d'épisode. Le problème visé est connu : le RL basé sur le résultat attribue le même avantage à tous les « action chunks » (blocs d'actions) d'une trajectoire. Un épisode raté pénalise donc des gestes initiaux pourtant utiles, comme s'ils avaient causé l'échec. PRICE s'appuie sur deux composants : un graphe relationnel physique, qui regroupe les résultats d'épisodes courants et passés aux frontières de chunks correspondantes pour estimer des « potentiels de succès », et une attribution de crédit filtrée par un seuil de confiance, qui utilise les variations de ces potentiels pour affiner la supervision au niveau de la trajectoire. Les tests couvrent les benchmarks LIBERO et RoboTwin 2.0, ainsi que des robots réels. Les auteurs annoncent un taux de réussite supérieur aux références basées sur le résultat et un apprentissage plus rapide. L'article ne fournit pas, dans son résumé, de chiffres précis ni de détail sur les robots ou les tâches réels. L'enjeu est pratique : le RL de post-entraînement des VLA se heurte à la rareté du signal. Les approches existantes de granularité fine passent par des évaluateurs appris (modèles de récompense, critiques), qui exigent une supervision propre à chaque tâche ou un entraînement supplémentaire. PRICE vise à s'en passer, en exploitant l'idée que des rollouts atteignant des situations physiques comparables peuvent se servir mutuellement de référence. Si ce principe tient hors des benchmarks, il réduirait le coût d'adaptation d'une politique à un nouveau poste de travail, un point sensible pour les intégrateurs qui doivent affiner un VLA sur site avec peu d'ingénierie de récompense. Les auteurs ajoutent une analyse reliant les changements de potentiel « oracle » à l'objectif de succès terminal, avec une borne directionnelle à échantillon fini, et des tests de continuation indépendants montrant que les crédits retenus correspondent bien à une progression locale. Reste une réserve : LIBERO et RoboTwin 2.0 sont des environnements simulés, et la validation réelle, dont l'ampleur n'est pas précisée ici, est le vrai test de la robustesse du graphe de correspondance face au bruit physique. Ce travail s'inscrit dans la course au post-entraînement des VLA par RL, après les premières familles de modèles généralistes (Pi-0, GR00T, Helix), où le fine-tuning supervisé atteint ses limites et où le RL devient le levier de fiabilité. Les auteurs revendiquent une première, à leur connaissance, pour l'attribution de crédit au niveau des chunks sans évaluateur auxiliaire, une affirmation non vérifiée indépendamment à ce stade. Il s'agit d'une prépublication arXiv, sans produit ni déploiement industriel annoncé. Les prochaines étapes à surveiller sont la réplication par d'autres laboratoires, l'application à de plus grands modèles VLA et la démonstration sur des tâches longues, où le problème d'attribution de crédit est le plus aigu.

RecherchePaper
1 source
IMPLY : cohérence physiquement ancrée pour les simulations par modèle du monde
2arXiv cs.RO 

IMPLY : cohérence physiquement ancrée pour les simulations par modèle du monde

Un article déposé sur arXiv (2609.12441v1, mi-septembre 2026) présente IMPLY, une méthode pour vérifier si les modèles du monde robotiques comprennent réellement la physique des objets, plutôt que de simplement produire des prédictions cohérentes entre elles. Les contrôles actuels d'auto-cohérence vérifient seulement que les trajectoires prédites pour un objet poussé à plusieurs vitesses s'accordent entre elles, sans les confronter à la physique réelle. IMPLY inverse un simulateur pour extraire la masse et le frottement impliqués par chaque trajectoire, ancrés sur deux poussées de calibration déjà vues par le modèle. En test contrôlé, l'auto-cohérence donne un score parfait à un modèle qui ignore l'objet et prédit toujours une poussée "typique" (AUROC de seulement 0,70 pour repérer la triche), là où IMPLY le démasque parfaitement (AUROC de 1,00). Sur V-JEPA 2-AC, le modèle de Meta adapté à la scène testée, le système suit l'objet avec ses propres calibrations (corrélation de 0,91 avec la vérité terrain) mais tombe à 0,05 avec celles d'un autre objet; l'auto-cohérence ne distingue pas les deux cas (52% de bonnes préférences, niveau du hasard) quand IMPLY y parvient dans 73% des cas, à 0,003 près d'un oracle omniscient. Le résultat pointe un angle mort dans l'évaluation des modèles du monde et des architectures vision-langage-action (VLA) qui pilotent robots manipulateurs et humanoïdes: un modèle peut paraître fiable et cohérent avec lui-même sans avoir internalisé la moindre notion de masse ou de frottement, et dérailler face à un objet inconnu. Pour les intégrateurs qui évaluent des piles comme GR00T N2, Pi-0 ou Helix avant déploiement, les métriques de cohérence interne mises en avant dans les communiqués ne garantissent donc aucune compréhension physique transférable. Les modèles du monde conditionnés par l'action, tel V-JEPA 2-AC de Meta AI (FAIR), prédisent à partir de vidéo l'effet des actions d'un robot sans simulateur physique explicite, et servent de brique à plusieurs architectures VLA récentes de manipulation. Faute de vérité terrain disponible à l'inférence, la communauté s'appuyait jusqu'ici sur l'auto-cohérence entre trajectoires, une pratique qu'IMPLY montre insuffisante puisqu'elle peut être dupée par un modèle ignorant l'identité de l'objet manipulé. Il s'agit à ce stade d'une contribution de recherche testée en environnement contrôlé, sans calendrier de déploiement industriel annoncé.

RecherchePaper
1 source
ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
3arXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io. L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique. Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

RecherchePaper
1 source
Simulateur de monde interactif pour l'entraînement et l'évaluation des politiques de robots
4Robohub 

Simulateur de monde interactif pour l'entraînement et l'évaluation des politiques de robots

Une équipe de recherche présente un simulateur de monde interactif destiné à l'entraînement et à l'évaluation de politiques robotiques, conçu pour remplacer une partie du travail réalisé aujourd'hui sur robot réel. Il s'agit d'un modèle de prédiction vidéo conditionné par l'action, entraîné sans aucun moteur physique intégré : à partir d'une image et d'une séquence d'actions robotiques, le système prédit les frames suivantes directement en pixels. Concrètement, un opérateur peut brancher un dispositif de téléopération et piloter un bras robotique à travers ce modèle appris pendant plus de dix minutes, à 15 images par seconde, sur une seule carte graphique RTX 4090, tout en conservant une vidéo stable et physiquement plausible. Le modèle a été entraîné sur quatre tâches de manipulation aux régimes physiques très différents : le poussage d'un objet en T (contact rigide), le routage d'une corde dans un clip (interaction déformable-rigide), la préhension d'une tasse (dynamique fine de la pince) et le balayage de tas d'objets. L'architecture repose sur deux étapes : un autoencodeur compresse d'abord les images RGB en représentations latentes compactes, puis un modèle de dynamique conditionné par l'action, entraîné dans cet espace latent gelé, prédit les états latents futurs qui sont ensuite décodés en images, de manière autorégressive. L'enjeu dépasse la simple démonstration technique. La collecte de démonstrations et l'évaluation de politiques sur robot réel restent les deux goulots d'étranglement classiques de l'apprentissage robotique : matériel qui casse, éclairage qui varie, objets qui dérivent, chaque nouvelle tâche exigeant des heures de manipulation en laboratoire. Si un simulateur appris atteint un niveau de fidélité suffisant, il devient possible de générer des données d'entraînement à moindre coût directement dans le simulateur, et surtout d'évaluer plusieurs politiques dans des conditions rigoureusement identiques et reproductibles, ce qu'un banc de test physique ne permet pas. Les exemples montrés, comme la distinction correcte entre une corde effectivement insérée dans un clip et une corde qui le frôle sans contact, ou la simulation d'une tasse qui glisse hors de la pince, suggèrent que le modèle capture des dynamiques fines sans recourir à des a priori physiques codés en dur, un point que le secteur observe de près depuis l'essor des modèles VLA (vision-language-action). Cette approche s'inscrit dans une lignée de travaux sur les "world models" appliqués à la robotique, où l'ambition est de remplacer les simulateurs physiques classiques, coûteux à construire et souvent imparfaitement fidèles à la réalité, par des modèles vidéo appris directement à partir de données d'interaction. Le projet met à disposition une démonstration interactive en ligne, jouable au clavier depuis un navigateur, ce qui permet une vérification indépendante des affirmations avancées. Les prochaines étapes attendues par le secteur portent sur le passage à l'échelle vers davantage de tâches et de configurations matérielles, ainsi que sur la démonstration effective que des politiques entraînées dans ce simulateur transfèrent avec succès vers des robots réels, condition encore non confirmée à ce stade par l'article.

RecherchePaper
1 source