Aller au contenu principal
RecherchearXiv cs.RO 

Awomo-SimDataEngine : génération de mondes prêts pour la simulation à base d'agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Awomo-SimDataEngine, un système agentique décrit dans un preprint arXiv (2610.02274), relie la génération d'actifs et de scènes 3D à la synthèse de démonstrations robotiques. Il s'appuie sur des services d'actifs partagés fournissant des objets rigides et articulés, dont des pièces et articulations générées via ISArt. Deux voies de génération de scènes coexistent : Unravel reconstruit des scènes éditables à partir d'images, tandis que SimForge construit des environnements d'une ou plusieurs pièces à partir de texte. Un « harnais » en graphe orchestre construction, validation et réparation bornée : une défaillance est routée vers le module fautif sans perdre l'état des éléments intacts. PolicyForge associe ensuite les mondes validés à des tâches et à des morphologies de robot pour produire des démonstrations rejouables. Sur le benchmark LIBERO-Plus, basé sur MuJoCo, le co-entraînement avec des démonstrations générées sous Isaac Sim fait passer le taux de réussite global d'un World-Action Model (WAM) de 77,17 % à 89,43 %. Les gains atteignent 31,66 points sur les tâches de type « goal » et 6,25 points sur les tâches « spatial ». Les auteurs reconnaissent des progrès plus limités sur les tâches à long horizon.

L'intérêt tient moins au modèle qu'à la chaîne de production de données. Le goulot d'étranglement du apprentissage par imitation est de plus en plus la qualité des scènes : une image plausible ne suffit pas, il faut des objets manipulables, des placements physiquement valides et des tâches reproductibles. En intégrant validation et réparation automatiques, le système traite ce problème en amont plutôt que par filtrage manuel. Le résultat est aussi un signal pour le transfert inter-simulateurs : des données créées sous Isaac Sim améliorent une politique évaluée sous MuJoCo, ce qui suggère que le gain ne vient pas d'un simple recouvrement entre moteurs. Il faut toutefois relativiser : il s'agit d'un seul benchmark simulé, sans transfert vers un robot réel, et le faible gain sur les horizons longs montre que l'enchaînement de sous-tâches reste un point dur. Le chiffre global de 12,3 points est aussi à lire à la lumière d'une base WAM déjà élevée, et les auteurs ne détaillent pas dans le résumé le volume de données ajouté.

Ce travail s'inscrit dans la course à la génération de données synthétiques pour les modèles vision-langage-action (VLA) et les modèles de monde. Des approches comme la génération procédurale de scènes, les pipelines de type Isaac Sim/Omniverse de NVIDIA ou les jeux de données issus de la téléopération visent le même objectif : réduire la dépendance à la collecte coûteuse sur robot réel. Aucune entreprise, aucun produit commercial ni calendrier de déploiement n'est annoncé, et aucun acteur européen n'est cité dans ce résumé. Les prochaines étapes logiques seraient une validation sur matériel réel, une évaluation sur d'autres benchmarks et une amélioration de la génération de tâches longues, aujourd'hui le maillon faible.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation
1arXiv cs.RO 

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation

SceneSmith est un framework agentique hiérarchique, présenté dans un preprint arXiv (2602.09153v2), qui génère des environnements intérieurs prêts pour la simulation robotique à partir de prompts en langage naturel. Le pipeline décompose la génération en trois étapes successives : layout architectural, placement de meubles, peuplement d'objets de petite taille. Chaque étape est pilotée par un trio d'agents VLM (vision-language model) jouant les rôles de designer, critique et orchestrateur. Pour les objets statiques, SceneSmith utilise la synthèse texte-vers-3D ; pour les objets articulés (portes, tiroirs, armoires), il interroge des bases de données d'assets existantes et estime automatiquement les propriétés physiques. Les résultats mesurés : 3 à 6 fois plus d'objets que les méthodes concurrentes, moins de 2 % de collisions inter-objets, 96 % des objets stables sous simulation physique. Une étude utilisateur conduite auprès de 205 participants donne à SceneSmith 92 % de taux de victoire sur le réalisme et 91 % sur la fidélité aux prompts face aux baselines -- des chiffres à interpréter avec prudence, les études perceptuelles restant par nature subjectives. L'enjeu central est le sim-to-real gap : les environnements synthétiques actuels sont trop épars et trop ordonnés pour que les politiques apprises soient transférables dans un foyer réel. SceneSmith cible directement ce problème en générant des scènes denses et encombrées, avec des objets articulés et des propriétés physiques cohérentes. Si les métriques annoncées résistent à une évaluation indépendante, cela réduit significativement le coût de constitution de jeux de données de simulation pour l'entraînement de politiques de manipulation, qu'il s'agisse de VLA ou de diffusion policies -- un besoin direct d'équipes comme Physical Intelligence ou Skild AI. Les auteurs démontrent que le pipeline s'intègre dans une boucle d'évaluation automatique de politiques robotiques, ce qui est précisément l'étape manquante pour industrialiser le cycle entraînement-évaluation en simulation. La génération automatique d'environnements intérieurs pour la robotique repose depuis des années sur des datasets à annotation manuelle coûteuse comme AI2-THOR, iGibson ou BEHAVIOR-1K, ou sur la génération procédurale (ProcTHOR), dont les scènes manquent de réalisme et de densité. SceneSmith s'inscrit dans une tendance plus large d'orchestration par LLM et VLM pour la génération 3D, une voie également explorée par Holodeck (Allen Institute for AI) et RoomDreamer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans le papier, ce qui en fait pour l'instant une contribution de recherche, sans acteur français ou européen identifiable dans l'écosystème décrit. La connexion directe à l'évaluation de politiques signale néanmoins une ambition claire d'intégration dans des pipelines d'entraînement réels, à mesure que la course aux robots domestiques s'intensifie.

RecherchePaper
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
2arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique
3arXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats. L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets. DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

RecherchePaper
1 source
GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot
4arXiv cs.RO 

GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot

Un laboratoire de robotique universitaire (RCHI Lab) publie GenPHRI, une nouvelle version (arXiv:2604.08664v2, article de remplacement) d'un framework de simulation générative pour l'interaction physique humain-robot, ou pHRI. Le système transforme une simple description en langage naturel en scénario de simulation complet, comprenant une pièce meublée, une pose humaine adaptée à la tâche et un robot exécutant l'interaction demandée. L'architecture s'appuie sur des agents fondés sur des modèles vision-langage : un agent générateur et un agent critique itèrent sur chaque composant de la scène, pendant qu'un agent orchestrateur arbitre les décisions entre les différentes étapes de construction. Les auteurs ont généré 50 scénarios d'assistance distincts sans aucune intervention manuelle, puis déployé deux de ces tâches lors d'une étude impliquant 12 participants humains. Les politiques de vision entraînées sur ces données atteignent un taux de réussite zero-shot d'environ 80% en conditions réelles, contre environ 90% en simulation, avec des comportements jugés cohérents avec les consignes textuelles. Une seconde voie de déploiement, sans entraînement, permet aussi l'exécution directe des trajectoires générées, au prix d'une couverture de contact plus limitée. Le travail cible un goulot d'étranglement concret du secteur : construire des scènes et des mouvements de simulation adaptés à chaque tâche de pHRI reste coûteux et lent, ce qui freine l'entraînement de politiques robotiques capables d'interagir physiquement avec des humains, au delà des tâches de manipulation d'objets classiques. En automatisant entièrement la génération de scénarios à partir de texte, GenPHRI illustre une tendance plus large où des agents VLM remplacent l'ingénierie manuelle de scènes simulées. L'écart mesuré entre performance simulée et performance réelle, dix points de pourcentage, reste toutefois un signal utile à retenir pour quiconque évalue la fiabilité de politiques entraînées uniquement en simulation avant tout déploiement physique auprès d'humains. L'étude reste à ce stade un travail de recherche académique et non un produit commercialisé : la validation s'appuie sur une étude utilisateur restreinte à 12 participants et deux tâches déployées, pas sur un déploiement industriel. Les auteurs publient GenPHRI comme plateforme ouverte pour générer, entraîner et déployer des tâches de pHRI à partir de prompts textuels, avec davantage de détails sur le site du projet associé au laboratoire.

RecherchePaper
1 source