Aller au contenu principal
RecherchearXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats.

L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets.

DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

À lire aussi

DeformSmith : génération hiérarchique d'objets déformables guidée par harnais physique pour la manipulation robotique
1arXiv cs.RO 

DeformSmith : génération hiérarchique d'objets déformables guidée par harnais physique pour la manipulation robotique

Un framework baptisé DeformSmith, décrit dans un article publié sur arXiv en septembre 2026 (arXiv:2609.18620v1) avec une page projet dédiée, automatise la création d'objets déformables physiquement crédibles pour la manipulation robotique, à partir d'un texte ou d'une seule image. Le système combine une construction agentique hiérarchique et un harnais physique partagé : il construit, teste puis affine la géométrie, le modèle physique, le comportement des matériaux et l'interaction avec un bras robotique, jusqu'à obtenir un asset prêt pour la simulation. La boucle se referme via un retour d'interaction robotique, les essais générant des données rejouables qui corrigent l'objet. Les auteurs comparent leur méthode à trois références, PhysGen3D, PhysGM et PhysX-Omni, revendiquant une meilleure qualité visuelle et physique, sans chiffres précis à l'appui. L'enjeu dépasse la démonstration académique. La manipulation d'objets déformables (tissus, câbles, emballages souples, aliments) reste un angle mort des politiques de manipulation robotique actuelles, entraînées surtout sur des objets rigides faute d'assets simulés en nombre et en qualité suffisants. En automatisant leur génération et en bouclant la construction avec un retour d'interaction simulé, DeformSmith cible le goulot d'étranglement des données plus que celui des algorithmes. Pour les laboratoires et intégrateurs qui veulent entraîner des politiques capables de plier, saisir ou déformer des objets mous, un tel outil pourrait réduire la dépendance à la capture de données réelles, coûteuse et difficile à mettre à l'échelle, sans garantir pour autant un transfert direct au monde réel. Le travail s'inscrit dans une lignée de générateurs d'assets physiques pour la simulation robotique, dont PhysGen3D, PhysGM et PhysX-Omni sont les références directes de comparaison. Ces outils partagent le même constat : les moteurs de simulation modernes manquent moins de puissance de calcul que de contenu physiquement cohérent, surtout pour les corps mous. DeformSmith se distingue par son traitement couplé, plutôt que séquentiel, de la géométrie, de la physique et de l'interaction. À ce stade, il s'agit d'une publication de recherche sans déploiement industriel ni partenaire annoncé ; aucun calendrier de validation sur bras robotiques physiques n'est précisé, ce qui reste l'étape suivante logique pour confirmer l'intérêt de la méthode hors simulation.

RecherchePaper
1 source
Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique
2arXiv cs.RO 

Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique

Une équipe de recherche propose sur arXiv (2607.16920v1) une plateforme de simulation événementielle discrète, multi-agents et couplée au Building Information Modeling (BIM), pour la navigation et la planification d'opérations robotiques en intérieur. La méthode discrétise l'environnement en cellules de grille converties en nœuds de graphe, classés en trois catégories selon leur relation spatiale avec les éléments du bâtiment : nœuds cibles, nœuds obstacles et nœuds réguliers. Des coûts de traversée sont ensuite assignés aux arêtes reliant les nœuds voisins, ce qui permet à des algorithmes de théorie des graphes de calculer des trajectoires efficaces et sans collision. Les simulations confirment que cette représentation en graphe produit une navigation fonctionnelle, mais les auteurs identifient une limite concrète à discrétisation grossière : un chevauchement entre cellules occupées par une cible et cellules occupées par un obstacle, corrigé par un raffinement de la grille qui améliore la précision spatiale et la faisabilité des trajectoires. L'apport principal tient au type d'information mobilisée. La plupart des robots d'intérieur pour la maintenance de bâtiments (nettoyage, inspection) reposent sur des trajets prédéfinis ou du SLAM, qui ne fournissent qu'une compréhension géométrique limitée de l'environnement. Or des tâches plus complexes, comme localiser et réparer une fuite sur une canalisation, exigent d'accéder à des données que seul le BIM contient réellement : position, géométrie, matériau et attributs opérationnels des composants du bâtiment. En connectant ce gisement de données à un moteur de planification par graphe, la plateforme ouvre la voie à des robots capables de raisonner sur le bâtiment lui-même, et pas seulement de s'y déplacer, ce qui intéresse directement les intégrateurs en facility management et en maintenance industrielle. Il s'agit toutefois d'un travail de recherche à un stade de validation purement simulé, sans déploiement sur robot physique ni site pilote annoncé. Il se positionne dans un contexte plus large où l'exploitation du BIM en robotique reste marginale, la discipline étant dominée par les piles de navigation classiques (SLAM, ROS) et les simulateurs génériques. La plateforme sert de base pour évaluer virtuellement des opérations robotiques avant tout déploiement réel, les suites logiques étant l'extension à des tâches de maintenance plus complexes et une validation sur un déploiement physique.

RecherchePaper
1 source
Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents
3arXiv cs.RO 

Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents

Un article publié le 20 août 2026 sur arXiv (référence 2608.18227v1) revisite Push-T, benchmark de référence pour l'apprentissage de politiques de manipulation par démonstration humaine, dans lequel un robot doit pousser un bloc en forme de T jusqu'à une pose cible en n'utilisant qu'un seul point de contact. Les auteurs ont chargé un agent de codage LLM, Claude Code associé au modèle Fable 5, de produire une solution algorithmique sans aucune donnée de démonstration. L'agent a retrouvé de lui-même la simulation 2D Gym du benchmark en ligne, mené des expériences simulées pour apprendre la mécanique de poussée, puis optimisé itérativement son code jusqu'à atteindre 100% de réussite avec 46% d'étapes en moins que la meilleure politique de diffusion entraînée sur 200 démonstrations humaines. Il a ensuite étendu la tâche à tout l'alphabet, de Push-A à Push-Z, via un curriculum auto-généré, et produit des simulations 3D avec retour visuel pour les bras robotiques Franka et UR5. Vidéos, politiques et détails complets doivent encore être publiés en ligne. Ce résultat interroge une hypothèse centrale du secteur, selon laquelle la manipulation robotique fine passe nécessairement par l'apprentissage par imitation ou par des modèles vision-langage-action entraînés sur de vastes jeux de démonstrations, à l'image de Pi-0, GR00T N2 ou Helix. Ici, un agent de codage génère un contrôle explicite et interprétable qui surpasse une politique de diffusion apprise, sans collecte de données préalable, ce qui intéresse directement les intégrateurs et équipes de R&D cherchant à réduire le coût et le délai de déploiement sur des tâches bien spécifiées. Le succès reste toutefois circonscrit à un benchmark 2D très étudié : l'extension à des simulations 3D avec Franka et UR5 constitue un pas vers la généralisation, mais aucune validation sur robot physique réel n'est rapportée, ce qui limite la portée immédiate pour la production. Push-T tire son origine des travaux sur la Diffusion Policy, qui en avaient fait un banc d'essai standard pour comparer les politiques de manipulation apprises. Ce court article se positionne dans le champ émergent de la « robotique agentique », où des agents de codage basés sur des LLM, comme Claude Code, sont testés comme alternative aux pipelines d'apprentissage par imitation qui dominent aujourd'hui la robotique humanoïde et les bras manipulateurs. Aucun laboratoire ni entreprise autre qu'Anthropic, via son modèle Fable 5, n'est cité dans le résumé, et aucune date de publication des vidéos et politiques associées n'est encore précisée. L'étude reste à ce stade une preuve de concept en simulation, sans pilote industriel ni déploiement matériel confirmé.

RecherchePaper
1 source
SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation
4arXiv cs.RO 

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation

SceneSmith est un framework agentique hiérarchique, présenté dans un preprint arXiv (2602.09153v2), qui génère des environnements intérieurs prêts pour la simulation robotique à partir de prompts en langage naturel. Le pipeline décompose la génération en trois étapes successives : layout architectural, placement de meubles, peuplement d'objets de petite taille. Chaque étape est pilotée par un trio d'agents VLM (vision-language model) jouant les rôles de designer, critique et orchestrateur. Pour les objets statiques, SceneSmith utilise la synthèse texte-vers-3D ; pour les objets articulés (portes, tiroirs, armoires), il interroge des bases de données d'assets existantes et estime automatiquement les propriétés physiques. Les résultats mesurés : 3 à 6 fois plus d'objets que les méthodes concurrentes, moins de 2 % de collisions inter-objets, 96 % des objets stables sous simulation physique. Une étude utilisateur conduite auprès de 205 participants donne à SceneSmith 92 % de taux de victoire sur le réalisme et 91 % sur la fidélité aux prompts face aux baselines -- des chiffres à interpréter avec prudence, les études perceptuelles restant par nature subjectives. L'enjeu central est le sim-to-real gap : les environnements synthétiques actuels sont trop épars et trop ordonnés pour que les politiques apprises soient transférables dans un foyer réel. SceneSmith cible directement ce problème en générant des scènes denses et encombrées, avec des objets articulés et des propriétés physiques cohérentes. Si les métriques annoncées résistent à une évaluation indépendante, cela réduit significativement le coût de constitution de jeux de données de simulation pour l'entraînement de politiques de manipulation, qu'il s'agisse de VLA ou de diffusion policies -- un besoin direct d'équipes comme Physical Intelligence ou Skild AI. Les auteurs démontrent que le pipeline s'intègre dans une boucle d'évaluation automatique de politiques robotiques, ce qui est précisément l'étape manquante pour industrialiser le cycle entraînement-évaluation en simulation. La génération automatique d'environnements intérieurs pour la robotique repose depuis des années sur des datasets à annotation manuelle coûteuse comme AI2-THOR, iGibson ou BEHAVIOR-1K, ou sur la génération procédurale (ProcTHOR), dont les scènes manquent de réalisme et de densité. SceneSmith s'inscrit dans une tendance plus large d'orchestration par LLM et VLM pour la génération 3D, une voie également explorée par Holodeck (Allen Institute for AI) et RoomDreamer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans le papier, ce qui en fait pour l'instant une contribution de recherche, sans acteur français ou européen identifiable dans l'écosystème décrit. La connexion directe à l'évaluation de politiques signale néanmoins une ambition claire d'intégration dans des pipelines d'entraînement réels, à mesure que la course aux robots domestiques s'intensifie.

RecherchePaper
1 source