Aller au contenu principal
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
RecherchearXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR).

Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA).

Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

À lire aussi

Pelican-Sim 1.0 : un simulateur de modèle du monde généraliste pour l'IA incarnée
1arXiv cs.RO 

Pelican-Sim 1.0 : un simulateur de modèle du monde généraliste pour l'IA incarnée

Un rapport technique publié sur arXiv (2609.12036v1) présente Pelican-Sim 1.0, un simulateur de modèle du monde pour l'intelligence incarnée qui prédit les observations visuelles futures à partir d'une image et d'une action robotique. Son architecture combine un espace d'action unifié à 28 dimensions couvrant la plupart des morphologies robotiques, une injection action-vision par vidéos rendues via des modèles URDF (PSNR +0,904), des couches sparse mixture-of-experts réduisant les conflits entre modalités (FVD -6,530), et une distillation en quatre étapes accélérant la génération de 5,67x face à un modèle à 35 étapes. Entraîné sur environ un million de trajectoires réelles et simulées, il gagne +4,636 de PSNR sur AgiBotWorld Beta, +2,080 sur RoboMIND et +10,343 sur RoboTwin. Sur RoboTwin, ajouter 500 trajectoires générées à 50 démonstrations réelles par tâche fait passer le taux de réussite d'une politique de 70% à 93%, et l'évaluation de politiques atteint une corrélation de Pearson de 0,994 avec les résultats réels. Ces résultats ciblent le goulot d'étranglement de l'apprentissage robotique : le coût et la rareté des données réelles nécessaires pour entraîner des politiques vision-langage-action fiables. En démontrant qu'un modèle du monde unique peut générer des données synthétiques exploitables sur plusieurs morphologies de robots, servir de proxy d'évaluation sans essais physiques, et guider la sélection d'actions, avec des gains relatifs jusqu'à 47,7%, Pelican-Sim s'attaque à l'écart persistant entre démonstration en laboratoire et déploiement réel. Pour les intégrateurs, l'intérêt tient à l'échelle testée et à la vitesse de génération par distillation, qui rapproche ces simulateurs d'un usage en boucle d'entraînement plutôt que d'une démonstration académique. Le travail s'inscrit dans la vague de modèles du monde appliqués à la robotique, aux côtés d'efforts comme Cosmos de Nvidia ou Genie de Google DeepMind, sur fond de benchmarks robotiques ouverts comme AgiBotWorld, RoboMIND et RoboTwin. Il s'agit à ce stade d'un rapport technique, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement. Les auteurs avancent des résultats de généralisation qualitative sur des changements de trajectoire, de scène, d'objet, d'embodiment et de point de vue comme preuve de concept, la validation sur des tâches et des robots inédits restant l'étape suivante.

RecherchePaper
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
2arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse
3arXiv cs.RO 

Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse

Une étude de synthèse publiée sur arXiv (2604.26509) propose le premier panorama systématique de la génération 3D appliquée à l'IA incarnée (embodied AI) et à la simulation robotique. Les auteurs organisent la littérature autour de trois rôles que joue la génération 3D dans les pipelines robotiques : la production d'assets de simulation (objets articulés, déformables, physiquement contraints), la construction d'environnements interactifs orientés tâche (génération de scènes avec conscience structurelle et capacités agentiques), et le pont sim-to-real, soit la reconstruction de jumeaux numériques, l'augmentation de données synthétiques et la génération de démonstrations pour l'apprentissage robot. Cette taxonomie en trois pôles structure un corpus jusqu'ici dispersé dans plusieurs sous-domaines cloisonnés. Le constat central est que le domaine bascule d'un objectif de réalisme visuel vers ce que les auteurs nomment l'"interaction readiness", soit la capacité d'un asset 3D à être utilisable dans une boucle de contrôle robot. Un objet généré peut être visuellement convaincant tout en étant physiquement invalide : masse incorrecte, articulations sans cohérence cinématique, propriétés de contact inexploitables. Les auteurs identifient quatre goulots d'étranglement concrets : la rareté des annotations physiques dans les datasets existants, l'écart entre qualité géométrique et validité physique, la fragmentation des protocoles d'évaluation (absence de benchmarks standardisés), et un sim-to-real divide qui reste ouvert malgré les progrès récents en diffusion 3D et 3D Gaussian Splatting. Cette publication s'inscrit dans l'accélération des modèles génératifs 3D que la communauté robotique cherche à exploiter pour alimenter des simulateurs comme NVIDIA Isaac ou Genesis. Créer manuellement des assets physiquement valides reste coûteux et lent ; la génération automatique promet de lever ce verrou, mais les compromis sur la validité physique freinent encore l'adoption à l'échelle industrielle. Google DeepMind, MIT CSAIL, CMU et plusieurs laboratoires académiques travaillent activement sur ce pipeline. La page projet associée (3dgen4robot.github.io) centralise la bibliographie de référence. La prochaine étape structurante pour le secteur sera la définition de benchmarks unifiés couvrant simultanément qualité géométrique, cohérence physique et performance en transfert sim-to-real, condition nécessaire pour que la génération 3D devienne une brique fiable de l'intelligence incarnée.

RecherchePaper
1 source
Uranus : la nouvelle infrastructure de simulation pour l'IA incarnée
4arXiv cs.RO 

Uranus : la nouvelle infrastructure de simulation pour l'IA incarnée

Une équipe de recherche a publié sur arXiv (2609.24815, en ligne depuis le 22 septembre 2026) Uranus, un simulateur robotique piloté par les données, construit autour d'un modèle de diffusion autorégressif conditionné par des trajectoires articulaires. Le système reçoit en ligne les trajectoires futures de position articulaire et génère, sans horizon fixe, une image latente par pas de temps, équivalant à quatre images RGB, à 24 images par seconde après optimisation de l'inférence. Il propose aussi une interface unifiée pour une génération multi-vues synchronisée, compatible avec différentes morphologies de robots et configurations de caméras. Les auteurs publient le code et les poids du modèle après évaluation sur données en distribution et hors distribution. La simulation reste le principal goulot d'étranglement de l'entraînement des politiques robotiques: l'interaction réelle est coûteuse et lente, contre une construction manuelle coûteuse pour les simulateurs physiques classiques. En remplaçant la modélisation explicite de la physique par un modèle génératif appris sur des données, Uranus s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où la vidéo générée sert de proxy d'environnement pour entraîner et évaluer des politiques. Le débit de 24 images par seconde compte pour les intégrateurs, car un simulateur trop lent ne peut pas boucler avec une politique en cours d'apprentissage. Il s'agit toutefois d'une publication de recherche aux limites reconnues par ses auteurs, non d'un produit commercial. Ce travail rejoint un courant de recherche plus large sur les modèles de diffusion vidéo et les "world models" appliqués à l'IA incarnée, où plusieurs laboratoires explorent des approches génératives pour compléter les moteurs physiques classiques dans l'entraînement de politiques robotiques. Uranus ne s'accompagne d'aucune annonce de partenariat industriel ni de déploiement sur un robot commercial: il s'agit d'une prépublication arXiv assortie d'une mise à disposition ouverte du code et des poids, destinée à permettre à d'autres équipes de reproduire et d'étendre les résultats, sans pilote industriel ni calendrier produit à ce stade.

RecherchePaper
1 source