Aller au contenu principal
D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot
RecherchearXiv cs.RO 

D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

D3D-GEN est un système de génération de mondes 3D interactifs présenté dans un article publié sur arXiv (arXiv:2608.11876v1) et conçu pour l'entraînement et la validation de robots sociaux en navigation autonome. Développé pour résoudre le compromis entre réalisme et simulabilité, le système combine un agent de recherche de domaine avec un pipeline de génération augmentée par récupération (RAG) ancré dans ce domaine. À partir d'une simple description textuelle du domaine visé, l'agent collecte automatiquement des données publiques spécifiques et construit une base de connaissances persistante, sans dépendre d'une bibliothèque fixe de modèles 3D. Le pipeline RAG interroge ensuite dynamiquement une base sémantique fournie par l'utilisateur pour générer des plans d'étage et des placements d'objets plausibles. Les mondes produits sont pleinement interactifs et compatibles avec les simulateurs Isaac Sim et Gazebo, deux outils largement utilisés en robotique. Les chercheurs ont bâti des bases de données pour trois domaines courants (résidentiel, hospitalier, bureau) et généré des dizaines d'environnements distincts pour chacun, le tout accessible via une interface web locale.

Pour l'industrie robotique, cet outil s'attaque à un goulot d'étranglement concret : la pénurie d'environnements de simulation à la fois réalistes et diversifiés freine l'entraînement des politiques de navigation sociale, un maillon clé pour les robots amenés à opérer parmi des humains (hôpitaux, bureaux, domicile). En automatisant la collecte de connaissances de domaine et la synthèse de scènes plausibles sans base 3D préexistante, D3D-GEN pourrait réduire le travail manuel de conception d'environnements simulés, un frein connu à l'échelle du sim-to-real pour les intégrateurs et laboratoires de recherche en IA incarnée. Reste que la validation du réalisme et de la généralisation à d'autres domaines n'est démontrée que sur trois cas d'usage, ce qui limite pour l'instant la portée des conclusions.

Ce travail s'inscrit dans la lignée des efforts récents visant à combler l'écart entre simulation et réalité pour l'IA incarnée, où des bases de données de scènes 3D figées (comme celles utilisées historiquement avec Isaac Sim ou Gazebo) limitent la diversité des scénarios d'entraînement. En s'appuyant sur des agents de recherche et du RAG plutôt que sur des bibliothèques statiques, D3D-GEN se positionne face à d'autres approches de génération procédurale de scènes pour la robotique. L'article ne précise pas de partenariats industriels ni de calendrier de déploiement au-delà du prototype de recherche présenté avec son interface web locale.

À lire aussi

SAIN : navigation interactive tenant compte de la structure et ancrée dans le dialogue actif pour robot mobile
1arXiv cs.RO 

SAIN : navigation interactive tenant compte de la structure et ancrée dans le dialogue actif pour robot mobile

Des chercheurs ont publie en aout 2026 sur arXiv (2608.09196v1) SAIN (Structure-Aware Interactive Navigation), un framework permettant a un robot mobile de dialoguer avec un humain pour lever l'ambiguïté d'une instruction. La tache visée, l'Interactive Instance Goal Navigation, demande au robot de retrouver un objet précis derrière une consigne de catégorie, par exemple "la tasse" parmi plusieurs tasses. Plutot que de traiter les réponses obtenues comme un indice textuel jetable, SAIN les convertit en état persistant reparti dans quatre mémoires structurées (valeur, pièce, graphe, objet), exploitées par une politique unique pour explorer et approcher la cible. Sur le benchmark VL-LN IIGN, SAIN fait passer le taux de succès de 20,2 a 25,4 et le SPL de 13,07 a 14,17 face a la meilleure base dialoguée publiée, sans entrainement spécifique a la tache. Pour les équipes de navigation vision-langage et de robots de service, ce résultat esquisse une piste pour combler l'écart entre instructions humaines vagues et des benchmarks qui supposent des consignes complètes, en transformant le dialogue en état spatial structure plutôt qu'en contexte textuel jetable, ce qui évite un reentrainement couteux par tache. Le gain reste toutefois mesure (environ cinq points de SR, un point de SPL), obtenu sur un seul benchmark face a une seule base de comparaison, ce qui invite a la prudence avant d'extrapoler a des environnements réels non contrôles. Il s'agit d'une contribution de recherche publiée sur arXiv et non d'un produit déployé: l'article ne mentionne ni partenaire robotique ni mise en production. Le problème du dialogue actif en navigation s'inscrit dans la continuité des travaux de navigation vision-langage, qui visent a gérer le langage naturel impreci des humains; les méthodes dialoguées antérieures se limitaient a exploiter les réponses comme indices ponctuels sans mémoire persistante, ce qui dégradait leurs performances sur des trajets longs. SAIN se positionne comme une alternative zero-shot misant sur la structuration de la mémoire plutôt que sur un apprentissage supplémentaire. L'article ne fournit ni calendrier de suite ni partenariat industriel ni portage vers un robot physique au-delà des simulations du benchmark VL-LN IIGN.

RecherchePaper
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
2arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
AquaWorld : génération de mondes sous-marins structurellement cohérents pour la simulation robotique
3arXiv cs.RO 

AquaWorld : génération de mondes sous-marins structurellement cohérents pour la simulation robotique

Des chercheurs ont présenté AquaWorld, un framework de génération de mondes sous-marins pour la simulation robotique, détaillé dans un article publié sur arXiv (2609.22670v1). L'outil génère terrain 3D, placement d'assets, définition de tâches et champs de courants à partir d'un plan conditionné par le langage, tout en conservant la cohérence structurelle entre ces éléments grâce à une bibliothèque de plus de 10 000 assets compatibles milieu sous-marin et un modèle résiduel supervisé par CFD (mécanique des fluides numérique) qui prédit des champs de flux moyens réutilisables et conditionnés au terrain. Le système prend en charge aussi bien les véhicules sous-marins conventionnels que les robots-poissons bio-inspirés. Sur 24 paires de terrains testées, la randomisation structurée produit une consistance croisée nettement supérieure à une randomisation indépendante des facteurs, et dans une comparaison d'entraînement de politiques à budget égal, elle atteint un taux de succès en validation supérieur de 21%. En conditions physiques réelles, une politique de navigation visuelle entraînée uniquement en simulation réussit 95% des essais en bassin, sans mise à jour de ses modules de perception ou de contrôle. Pour l'industrie robotique sous-marine, ce résultat s'attaque à un goulot d'étranglement connu: contrairement aux robots terrestres ou aériens, les systèmes sous-marins doivent composer avec courants, visibilité dégradée et dynamique fluide complexe, ce qui limitait jusqu'ici la quantité de données synthétiques réellement exploitables pour l'entraînement. En montrant qu'une randomisation tenant compte de la structure du terrain améliore le transfert simulation-réalité jusqu'à un taux de réussite physique de 95% sans recalibrage, AquaWorld apporte une preuve empirique que le fossé sim-to-real, souvent pointé comme un obstacle majeur dans les publications robotiques, peut être réduit pour des tâches de navigation visuelle sous-marine. Pour les intégrateurs de véhicules sous-marins autonomes ou de robots d'inspection, cela ouvre une voie pour réduire coûts et risques des essais en mer en s'appuyant davantage sur l'entraînement simulé, à condition que les pipelines de génération respectent les contraintes physiques du domaine plutôt que de randomiser chaque facteur indépendamment. Ce travail s'inscrit dans une tendance plus large de la robotique où la génération procédurale de mondes à grande échelle est devenue un levier central de l'entraînement de politiques, un domaine longtemps dominé par les environnements terrestres et la manipulation. Le sous-marin restait en retard faute d'outils intégrant simultanément géométrie de terrain, dynamique des fluides et diversité d'assets de façon cohérente. À ce stade, il s'agit d'une contribution de recherche publiée sur arXiv, sans indication de produit commercial, de partenariat industriel ou de déploiement opérationnel annoncé, et les auteurs ne précisent ni affiliation ni feuille de route de diffusion publique du code ou des assets. Les suites attendues pour ce type de travaux passent généralement par l'extension du nombre de tâches et de robots supportés, ainsi que des essais en environnement réel au-delà du bassin contrôlé.

RecherchePaper
1 source
GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot
4arXiv cs.RO 

GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot

Un laboratoire de robotique universitaire (RCHI Lab) publie GenPHRI, une nouvelle version (arXiv:2604.08664v2, article de remplacement) d'un framework de simulation générative pour l'interaction physique humain-robot, ou pHRI. Le système transforme une simple description en langage naturel en scénario de simulation complet, comprenant une pièce meublée, une pose humaine adaptée à la tâche et un robot exécutant l'interaction demandée. L'architecture s'appuie sur des agents fondés sur des modèles vision-langage : un agent générateur et un agent critique itèrent sur chaque composant de la scène, pendant qu'un agent orchestrateur arbitre les décisions entre les différentes étapes de construction. Les auteurs ont généré 50 scénarios d'assistance distincts sans aucune intervention manuelle, puis déployé deux de ces tâches lors d'une étude impliquant 12 participants humains. Les politiques de vision entraînées sur ces données atteignent un taux de réussite zero-shot d'environ 80% en conditions réelles, contre environ 90% en simulation, avec des comportements jugés cohérents avec les consignes textuelles. Une seconde voie de déploiement, sans entraînement, permet aussi l'exécution directe des trajectoires générées, au prix d'une couverture de contact plus limitée. Le travail cible un goulot d'étranglement concret du secteur : construire des scènes et des mouvements de simulation adaptés à chaque tâche de pHRI reste coûteux et lent, ce qui freine l'entraînement de politiques robotiques capables d'interagir physiquement avec des humains, au delà des tâches de manipulation d'objets classiques. En automatisant entièrement la génération de scénarios à partir de texte, GenPHRI illustre une tendance plus large où des agents VLM remplacent l'ingénierie manuelle de scènes simulées. L'écart mesuré entre performance simulée et performance réelle, dix points de pourcentage, reste toutefois un signal utile à retenir pour quiconque évalue la fiabilité de politiques entraînées uniquement en simulation avant tout déploiement physique auprès d'humains. L'étude reste à ce stade un travail de recherche académique et non un produit commercialisé : la validation s'appuie sur une étude utilisateur restreinte à 12 participants et deux tâches déployées, pas sur un déploiement industriel. Les auteurs publient GenPHRI comme plateforme ouverte pour générer, entraîner et déployer des tâches de pHRI à partir de prompts textuels, avec davantage de détails sur le site du projet associé au laboratoire.

RecherchePaper
1 source