RecherchearXiv cs.RO 2 juin 2026

URDF-Anything+ : génération bout-en-bout d'actifs articulés prêts pour la simulation

1 source couvre ce sujet·Source originale ↗·

Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv en mars 2026 URDF-Anything+, un modèle de diffusion autorégressive générant des fichiers URDF (Unified Robot Description Format) à partir d'une seule image RGB. Le URDF est le format standard dans l'écosystème ROS et les simulateurs physiques (MuJoCo, Isaac Sim, Gazebo) pour décrire la géométrie et la cinématique des objets articulés. Le système opère dans un espace latent structuré et prédit séquentiellement chaque partie de l'objet avec ses paramètres de joint (type, axe, limites de mouvement), un token de terminaison déterminant dynamiquement le nombre de segments à générer. Évalué sur des benchmarks à grande échelle d'objets articulés, il surpasse les méthodes existantes en reconstruction géométrique, en précision des paramètres de joints et en "physical executability", soit la capacité des URDF produits à s'exécuter directement dans un simulateur sans post-traitement manuel.

L'enjeu pour les roboticiens et ingénieurs de simulation est direct : produire des digital twins d'objets articulés réels (tiroirs, portes, vannes, équipements industriels) reste un goulot d'étranglement dans les pipelines de sim-to-real. Les approches classiques imposent segmentation manuelle, retrieval depuis des bibliothèques 3D (PartNet, ShapeNet) ou des pipelines multi-étapes coûteux à maintenir. URDF-Anything+ compresse ce processus en une passe unique, sans retrieval ni post-traitement externe. Le résultat le plus significatif est le transfert zero-shot : des politiques de manipulation entraînées exclusivement en simulation sur des URDF générés ont été transférées dans des environnements réels sans fine-tuning supplémentaire, ce qui constitue une validation directe que le sim-to-real gap sur les objets articulés peut être partiellement absorbé par la fidélité du jumeau numérique.

La reconstruction d'objets articulés depuis des observations visuelles est un problème ouvert depuis plus d'une décennie. Des travaux antérieurs comme PARIS, ArticulatedFormer et NSM avaient progressé sur la segmentation et l'estimation cinématique, mais butaient sur la généralisation et l'utilisabilité directe en simulateur. URDF-Anything+ s'inscrit dans la tendance des modèles génératifs 3D orientés simulation, aux côtés des Gaussian Splattings dynamiques et des NeRF articulés. La recherche (arXiv:2603.14010) ne mentionne pas d'affiliation industrielle ni de plan de commercialisation : il s'agit d'un résultat purement académique. L'intégration naturelle serait dans les pipelines de génération de données synthétiques pour la manipulation robotique, domaine où Physical Intelligence, le Boston Dynamics AI Institute et les équipes Nvidia Isaac Lab investissent massivement en ce moment.

Impact France/UE

Les équipes académiques européennes en manipulation robotique (INRIA, DLR, TU Munich) pourraient intégrer cet outil dans leurs pipelines de données synthétiques, mais aucun acteur français ou européen n'est directement impliqué.

Dans nos dossiers

Boston Dynamics NVIDIA Isaac & Cosmos Physical Intelligence — π0 Manipulation robotique

À lire aussi

1arXiv cs.RO

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation

SceneSmith est un framework agentique hiérarchique, présenté dans un preprint arXiv (2602.09153v2), qui génère des environnements intérieurs prêts pour la simulation robotique à partir de prompts en langage naturel. Le pipeline décompose la génération en trois étapes successives : layout architectural, placement de meubles, peuplement d'objets de petite taille. Chaque étape est pilotée par un trio d'agents VLM (vision-language model) jouant les rôles de designer, critique et orchestrateur. Pour les objets statiques, SceneSmith utilise la synthèse texte-vers-3D ; pour les objets articulés (portes, tiroirs, armoires), il interroge des bases de données d'assets existantes et estime automatiquement les propriétés physiques. Les résultats mesurés : 3 à 6 fois plus d'objets que les méthodes concurrentes, moins de 2 % de collisions inter-objets, 96 % des objets stables sous simulation physique. Une étude utilisateur conduite auprès de 205 participants donne à SceneSmith 92 % de taux de victoire sur le réalisme et 91 % sur la fidélité aux prompts face aux baselines -- des chiffres à interpréter avec prudence, les études perceptuelles restant par nature subjectives. L'enjeu central est le sim-to-real gap : les environnements synthétiques actuels sont trop épars et trop ordonnés pour que les politiques apprises soient transférables dans un foyer réel. SceneSmith cible directement ce problème en générant des scènes denses et encombrées, avec des objets articulés et des propriétés physiques cohérentes. Si les métriques annoncées résistent à une évaluation indépendante, cela réduit significativement le coût de constitution de jeux de données de simulation pour l'entraînement de politiques de manipulation, qu'il s'agisse de VLA ou de diffusion policies -- un besoin direct d'équipes comme Physical Intelligence ou Skild AI. Les auteurs démontrent que le pipeline s'intègre dans une boucle d'évaluation automatique de politiques robotiques, ce qui est précisément l'étape manquante pour industrialiser le cycle entraînement-évaluation en simulation. La génération automatique d'environnements intérieurs pour la robotique repose depuis des années sur des datasets à annotation manuelle coûteuse comme AI2-THOR, iGibson ou BEHAVIOR-1K, ou sur la génération procédurale (ProcTHOR), dont les scènes manquent de réalisme et de densité. SceneSmith s'inscrit dans une tendance plus large d'orchestration par LLM et VLM pour la génération 3D, une voie également explorée par Holodeck (Allen Institute for AI) et RoomDreamer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans le papier, ce qui en fait pour l'instant une contribution de recherche, sans acteur français ou européen identifiable dans l'écosystème décrit. La connexion directe à l'évaluation de politiques signale néanmoins une ambition claire d'intégration dans des pipelines d'entraînement réels, à mesure que la course aux robots domestiques s'intensifie.

RecherchePaper

1 source

2arXiv cs.RO

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper

1 source

3arXiv cs.RO

Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse

Une étude de synthèse publiée sur arXiv (2604.26509) propose le premier panorama systématique de la génération 3D appliquée à l'IA incarnée (embodied AI) et à la simulation robotique. Les auteurs organisent la littérature autour de trois rôles que joue la génération 3D dans les pipelines robotiques : la production d'assets de simulation (objets articulés, déformables, physiquement contraints), la construction d'environnements interactifs orientés tâche (génération de scènes avec conscience structurelle et capacités agentiques), et le pont sim-to-real, soit la reconstruction de jumeaux numériques, l'augmentation de données synthétiques et la génération de démonstrations pour l'apprentissage robot. Cette taxonomie en trois pôles structure un corpus jusqu'ici dispersé dans plusieurs sous-domaines cloisonnés. Le constat central est que le domaine bascule d'un objectif de réalisme visuel vers ce que les auteurs nomment l'"interaction readiness", soit la capacité d'un asset 3D à être utilisable dans une boucle de contrôle robot. Un objet généré peut être visuellement convaincant tout en étant physiquement invalide : masse incorrecte, articulations sans cohérence cinématique, propriétés de contact inexploitables. Les auteurs identifient quatre goulots d'étranglement concrets : la rareté des annotations physiques dans les datasets existants, l'écart entre qualité géométrique et validité physique, la fragmentation des protocoles d'évaluation (absence de benchmarks standardisés), et un sim-to-real divide qui reste ouvert malgré les progrès récents en diffusion 3D et 3D Gaussian Splatting. Cette publication s'inscrit dans l'accélération des modèles génératifs 3D que la communauté robotique cherche à exploiter pour alimenter des simulateurs comme NVIDIA Isaac ou Genesis. Créer manuellement des assets physiquement valides reste coûteux et lent ; la génération automatique promet de lever ce verrou, mais les compromis sur la validité physique freinent encore l'adoption à l'échelle industrielle. Google DeepMind, MIT CSAIL, CMU et plusieurs laboratoires académiques travaillent activement sur ce pipeline. La page projet associée (3dgen4robot.github.io) centralise la bibliographie de référence. La prochaine étape structurante pour le secteur sera la définition de benchmarks unifiés couvrant simultanément qualité géométrique, cohérence physique et performance en transfert sim-to-real, condition nécessaire pour que la génération 3D devienne une brique fiable de l'intelligence incarnée.

RecherchePaper

1 source

4arXiv cs.RO

Améliorer automatiquement la physique de simulation des objets articulés

Une thèse publiée sur arXiv en mai 2026 (identifiant 2605.19136) propose une méthode automatisée pour corriger les propriétés physiques des objets articulés destinés aux simulateurs de robotique. L'approche introduit le concept d'"interaction-readiness", qui caractérise la capacité d'un objet à être simulé de façon fiable lors de tâches de manipulation. Le constat de départ est précis : les grands datasets 3D existants, comme PartNet-Mobility ou Objaverse, fournissent des représentations géométriques et cinématiques riches, mais omettent les paramètres physiques indispensables à une simulation stable (masse, friction, amortissement, limites d'articulations), contraignant les équipes à un travail manuel coûteux. La méthode proposée fusionne des informations géométriques, visuelles et sémantiques dans une boucle itérative avec le simulateur, qui affine ces propriétés automatiquement jusqu'à atteindre une cohérence physique suffisante pour des tâches de manipulation. L'enjeu est concret pour les équipes qui entraînent des politiques de contrôle robotique par apprentissage en simulation. Les expériences conduites sur des objets articulés variés montrent que la qualité des assets influe directement sur la stabilité de la simulation, le comportement lors des interactions, et les performances des politiques apprises, validant empiriquement ce que beaucoup d'équipes observaient sans pouvoir le quantifier. Construire manuellement un objet simulation-ready (tiroir, porte, boîte à couvercle) représente un effort d'ingénierie significatif qui freine la diversification des scénarios d'entraînement. Une pipeline automatisée réutilisant des assets géométriques existants pour y injecter des propriétés physiques réalistes pourrait débloquer la mise à l'échelle des données de simulation, un goulot d'étranglement reconnu dans la course aux VLA (Vision-Language-Action models) et aux politiques de manipulation généralistes. Cette problématique s'inscrit dans un effort collectif pour réduire le sim-to-real gap, domaine où NVIDIA (Isaac Lab) et Google DeepMind (MuJoCo) investissent massivement via la domain randomization et la génération procédurale d'environnements. Le cadre d'évaluation proposé, qui décompose l'"interaction-readiness" en composantes mesurables, constitue aussi une contribution méthodologique indépendante, potentiellement utile comme benchmark pour comparer des pipelines de génération d'assets. Aucune affiliation industrielle n'est précisée dans le préprint, et la méthode n'a pas encore été validée à l'échelle industrielle ; les prochaines étapes naturelles iraient vers des applications de bin-picking ou d'assemblage, où les objets articulés restent un défi ouvert pour les intégrateurs.

UEImpact indirect : les équipes de recherche françaises et européennes (INRIA, CEA-List) travaillant sur la manipulation robotique et les politiques VLA pourraient exploiter cette pipeline pour réduire le coût d'ingénierie lié à la création d'assets simulation-ready.

RecherchePaper

1 source