Aller au contenu principal
RecherchearXiv cs.RO 

Uranus : la nouvelle infrastructure de simulation pour l'IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié sur arXiv (2609.24815, en ligne depuis le 22 septembre 2026) Uranus, un simulateur robotique piloté par les données, construit autour d'un modèle de diffusion autorégressif conditionné par des trajectoires articulaires. Le système reçoit en ligne les trajectoires futures de position articulaire et génère, sans horizon fixe, une image latente par pas de temps, équivalant à quatre images RGB, à 24 images par seconde après optimisation de l'inférence. Il propose aussi une interface unifiée pour une génération multi-vues synchronisée, compatible avec différentes morphologies de robots et configurations de caméras. Les auteurs publient le code et les poids du modèle après évaluation sur données en distribution et hors distribution.

La simulation reste le principal goulot d'étranglement de l'entraînement des politiques robotiques: l'interaction réelle est coûteuse et lente, contre une construction manuelle coûteuse pour les simulateurs physiques classiques. En remplaçant la modélisation explicite de la physique par un modèle génératif appris sur des données, Uranus s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où la vidéo générée sert de proxy d'environnement pour entraîner et évaluer des politiques. Le débit de 24 images par seconde compte pour les intégrateurs, car un simulateur trop lent ne peut pas boucler avec une politique en cours d'apprentissage. Il s'agit toutefois d'une publication de recherche aux limites reconnues par ses auteurs, non d'un produit commercial.

Ce travail rejoint un courant de recherche plus large sur les modèles de diffusion vidéo et les "world models" appliqués à l'IA incarnée, où plusieurs laboratoires explorent des approches génératives pour compléter les moteurs physiques classiques dans l'entraînement de politiques robotiques. Uranus ne s'accompagne d'aucune annonce de partenariat industriel ni de déploiement sur un robot commercial: il s'agit d'une prépublication arXiv assortie d'une mise à disposition ouverte du code et des poids, destinée à permettre à d'autres équipes de reproduire et d'étendre les résultats, sans pilote industriel ni calendrier produit à ce stade.

À lire aussi

Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée
1arXiv cs.RO 

Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée

Des chercheurs ont déposé le 27 juin 2026 sur arXiv (arXiv:2606.27962) un framework d'infrastructure de simulation cloud-native pour l'intelligence embarquée, conçu pour unifier en une seule plateforme la génération d'environnements de simulation, l'exécution de tâches, la collecte de trajectoires, l'évaluation de modèles et la gestion de données. L'architecture s'articule en quatre couches fonctionnelles et intègre quatre systèmes représentatifs : D-VLA, RL-VLA3, Sword et Pre-VLA, couvrant respectivement la simulation scalable, la planification dynamique des ressources, l'augmentation visuelle et le filtrage de données en temps réel. Le tout repose sur des technologies cloud-native telles que l'ordonnancement élastique des ressources et la simulation conteneurisée, pour gérer des workloads multi-modèles et multi-tâches à grande échelle. L'enjeu sous-jacent touche directement au goulot d'étranglement qui freine les modèles VLA (Vision-Language-Action) : la collecte de données réelles est coûteuse, peu reproductible et difficile à scaler. Ce framework propose une réponse systémique en substituant ou en complétant les données terrain par de la simulation industrialisée, avec une boucle fermée (closed-loop) permettant d'optimiser les données de façon itérative. Si les composants comme Pre-VLA (filtrage temps réel) et RL-VLA3 (apprentissage par renforcement sur architecture VLA) tiennent leurs promesses à l'échelle, cela pourrait réduire significativement le sim-to-real gap qui reste l'obstacle majeur pour déployer des robots génériques en environnement industriel réel. Il faut toutefois noter que la publication reste au stade de preprint sans benchmarks indépendants validés, et les performances sur robots physiques ne sont pas documentées dans ce papier. Ce travail s'inscrit dans une compétition internationale intense autour des infrastructures de simulation pour l'IA incarnée. NVIDIA pousse Isaac Sim avec l'écosystème Isaac Lab pour l'entraînement par renforcement, tandis que Genesis (dévoilé en 2024, affilié MIT) et MuJoCo Playground ciblent eux aussi la simulation GPU-accélérée à grande échelle. L'approche présentée ici se distingue par son orientation service (SOA) et sa couche de gestion de données unifiée, pensée pour des déploiements multi-équipes plutôt qu'un usage chercheur individuel. Les auteurs ne précisent pas d'affiliation institutionnelle clairement identifiable ni de calendrier de mise à disposition publique du code, deux points qui limiteront concrètement l'adoption tant qu'ils resteront non documentés.

RechercheOpinion
1 source
MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable
2arXiv cs.RO 

MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable

Des chercheurs ont déposé en juin 2026 sur arXiv (2606.17511) MagicSim, une infrastructure de simulation conçue pour unifier dans un seul runtime déterministe les couches de contrôle, de compétences et de planification jusqu'ici traitées séparément. L'architecture repose sur un processus de décision de Markov (MDP) partagé et des spécifications YAML qui découplent le contenu des scènes, le comportement des objets et l'exposition aux agents. À partir de ces définitions, le système génère automatiquement des environnements variés couvrant différentes familles de tâches, régimes de physique, capteurs et morphologies robotiques, tous exécutables dans une même boucle reset-step. Le pipeline central suit la chaîne Commande-Compétence-Planificateur-Robot-Enregistrement : les commandes haut niveau sont instanciées comme des actions robotiques réelles, non comme des éditions directes d'état côté simulateur. Une seule définition de tâche supporte trois usages simultanés : évaluation benchmark et apprentissage par renforcement (RL), collecte automatique de trajectoires via une interface autocollect, et interaction directe avec des agents ou des VLM (Vision-Language Models). L'enjeu central que MagicSim cherche à résoudre est désigné dans la littérature sous le terme "magic actions" : dans la plupart des pipelines existants, les simulateurs trichent en éditant directement l'état du monde plutôt qu'en exécutant des mouvements robotiques réels. Cette pratique, commode pour générer des données d'entraînement, brise le transfert sim-to-real car les trajectoires produites ne correspondent pas à ce qu'un robot physique peut accomplir. En ancrant chaque commande haut niveau dans une pile d'exécution complète, MagicSim génère des trajectoires multimodales structurées qui alignent supervision linguistique, représentations d'action, représentations visuelles et géométriques, et statut de la tâche sur l'épisode réellement exécuté. Pour les équipes développant des VLA à grande échelle (pi0 de Physical Intelligence, GR00T N2 de NVIDIA), la capacité à produire automatiquement des données cohérentes entre simulation et exécution représente un levier direct sur la scalabilité des pipelines de données. Ce travail s'inscrit dans une tentative de consolidation d'un paysage de simulation fragmenté. Les infrastructures concurrentes incluent Isaac Lab de NVIDIA, Genesis, SAPIEN et RoboSuite, chacune optimisée pour un sous-ensemble du workflow : physique haute fidélité, benchmark standardisé, ou collecte de données. MagicSim se positionne comme une alternative unifiée, avec comme argument différenciant l'interface agent/VLM intégrée dès la spécification de tâche. La publication ne mentionne ni déploiement open-source immédiat ni partenariat industriel annoncé, et les résultats restent à ce stade des démonstrations sur environnements internes. La validation sur des benchmarks sectoriels établis comme LIBERO, MetaWorld ou RLBench sera le prochain critère de maturité.

RechercheOpinion
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
3arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
OJOx : démonstrations conditionnées par des spécifications pour l'IA incarnée dans la construction
4arXiv cs.RO 

OJOx : démonstrations conditionnées par des spécifications pour l'IA incarnée dans la construction

Des chercheurs ont publié sur arXiv (id 2609.22289) un article présentant OJOx, une interface de capture de démonstrations conçue pour l'IA incarnée appliquée au secteur de la construction. Le système délivre la géométrie d'un modèle de conception à un casque de réalité mixte, l'ancre dans l'espace de travail physique, puis la restitue dans la vue stéréo en passthrough du démonstrateur, tout en enregistrant simultanément le mouvement du corps entier et des mains. Les auteurs introduisent la notion de "démonstration conditionnée par la spécification" : un enregistrement synchronisé de l'état physique perçu par l'opérateur, de l'état visé fourni par une conception externe, et du comportement qui relie les deux. Une session entièrement instrumentée est rapportée, la pose d'un mur de 33 composants réalisée à partir d'une spécification qui évolue en cours de chantier, et vérifiée par rapport à la scène physique réelle via une caméra externe positionnée indépendamment du système de capture. Les données restent compatibles avec les infrastructures existantes de retargeting pour robots humanoïdes et ont été rejouées en simulation sur un Unitree G1. Ce travail cible un angle mort des pipelines de données pour les modèles vision-langage-action : les grands corpus de démonstrations égocentriques ou corps entier capturent ce qu'une personne fait, rarement pourquoi elle le fait, c'est-à-dire l'intention de conception qui donne son sens au geste. Dans la construction, où chaque ouvrage est défini par un modèle spécifique au projet, une politique entraînée par simple imitation risque de reproduire la géométrie observée sans apprendre à généraliser vers une spécification jamais vue à l'entraînement. OJOx propose donc un format de données permettant de tester explicitement cette capacité de généralisation, plutôt que de simplement supposer qu'elle émerge de l'échelle des données ; il s'agit néanmoins d'une contribution méthodologique et d'un outil de capture, pas d'un produit commercial ni d'un déploiement en usine, à ce stade une preuve de concept limitée à une seule session instrumentée. Cette publication s'inscrit dans la course plus large des laboratoires de robotique incarnée à constituer des jeux de démonstrations humaines à grande échelle pour entraîner des modèles fondation destinés aux robots humanoïdes, un effort généralement concentré sur des tâches de manipulation générique et répétable. La construction, où chaque tâche suit un plan différent, restait jusqu'ici peu couverte par ce type de capture. En rendant ses enregistrements compatibles avec les pipelines de retargeting existants et en les rejouant sur un Unitree G1, l'équipe positionne OJOx comme un module interopérable avec l'écosystème matériel humanoïde déjà en place. L'article ne fournit ni calendrier de déploiement ni partenaire industriel : il ouvre la voie à des jeux de données plus larges pour évaluer si des politiques VLA peuvent réellement agir vers des spécifications absentes de leur entraînement, une question encore ouverte pour l'ensemble du secteur.

RecherchePaper
1 source