Aller au contenu principal
SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel
RecherchearXiv cs.RO 

SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SR-Platform est un pipeline agentique, publié en preprint arXiv (2605.14700) en mai 2026, qui convertit des descriptions en langage naturel en environnements de simulation MuJoCo exécutables et physiquement valides. Le système décompose la génération de scènes en quatre étapes : un orchestrateur LLM qui structure l'intention utilisateur en plan de scène ; un "asset forge" qui récupère des géométries en cache ou en génère de nouvelles via synthèse LLM-CadQuery ; un "layout architect" qui assigne les poses des objets et vérifie les contraintes spatiales ; et une couche bridge qui assemble le fichier MJCF final en intégrant le modèle de robot cible. Déployé comme stack Docker à neuf services (MinIO pour les meshes, Qdrant pour la récupération sémantique d'assets, Redis pour l'état des jobs, InfluxDB pour la télémétrie), SR-Platform affiche une latence médiane d'environ 50 secondes pour des scènes à cinq objets, tombant à 30-40 secondes avec cache d'assets actif, sur une base de 611 appels LLM réussis en 30 jours de production. Le taux de retry de l'asset forge atteint 11,3 %, avec récupération automatique.

Construire manuellement une scène MuJoCo prête à l'entraînement exige une expertise croisée en modélisation 3D, spécification MJCF, gestion des collisions et intégration robot, un processus qui représente typiquement plusieurs heures par scène. Ramener cette étape à moins d'une minute via une invite en langage naturel est un levier direct pour produire des environnements d'entraînement plus variés, facteur clé de la généralisation sim-to-real des politiques robotiques. Pour les équipes de robot learning, cette friction de configuration est réelle et souvent sous-estimée dans les pipelines de données synthétiques. Les métriques publiées portent cependant sur des scènes limitées à cinq objets dans un cadre contrôlé, et la robustesse du pipeline sur des configurations plus complexes ou des descriptions ambiguës reste à démontrer.

La génération automatisée d'environnements de simulation est un goulot d'étranglement reconnu dans les pipelines de robot learning, que ce soit pour le reinforcement learning, l'imitation learning ou l'entraînement de modèles vision-langage-action (VLA). MuJoCo, maintenu par DeepMind, est le moteur physique de référence pour ces travaux. NVIDIA Isaac Lab et le framework open-source Genesis couvrent également cet espace ; Physical Intelligence (pi.ai) mise de son côté sur des pipelines d'entraînement à très large échelle. SR-Platform se positionne en amont, sur la génération de scènes plutôt que de politiques, avec un accent sur l'accessibilité via le langage naturel. Son code source n'est pas publié en open-source et le contexte précis du déploiement qualifié de "production" n'est pas explicité dans le preprint.

À lire aussi

Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique
1arXiv cs.RO 

Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique

Une équipe de recherche propose sur arXiv (2607.16920v1) une plateforme de simulation événementielle discrète, multi-agents et couplée au Building Information Modeling (BIM), pour la navigation et la planification d'opérations robotiques en intérieur. La méthode discrétise l'environnement en cellules de grille converties en nœuds de graphe, classés en trois catégories selon leur relation spatiale avec les éléments du bâtiment : nœuds cibles, nœuds obstacles et nœuds réguliers. Des coûts de traversée sont ensuite assignés aux arêtes reliant les nœuds voisins, ce qui permet à des algorithmes de théorie des graphes de calculer des trajectoires efficaces et sans collision. Les simulations confirment que cette représentation en graphe produit une navigation fonctionnelle, mais les auteurs identifient une limite concrète à discrétisation grossière : un chevauchement entre cellules occupées par une cible et cellules occupées par un obstacle, corrigé par un raffinement de la grille qui améliore la précision spatiale et la faisabilité des trajectoires. L'apport principal tient au type d'information mobilisée. La plupart des robots d'intérieur pour la maintenance de bâtiments (nettoyage, inspection) reposent sur des trajets prédéfinis ou du SLAM, qui ne fournissent qu'une compréhension géométrique limitée de l'environnement. Or des tâches plus complexes, comme localiser et réparer une fuite sur une canalisation, exigent d'accéder à des données que seul le BIM contient réellement : position, géométrie, matériau et attributs opérationnels des composants du bâtiment. En connectant ce gisement de données à un moteur de planification par graphe, la plateforme ouvre la voie à des robots capables de raisonner sur le bâtiment lui-même, et pas seulement de s'y déplacer, ce qui intéresse directement les intégrateurs en facility management et en maintenance industrielle. Il s'agit toutefois d'un travail de recherche à un stade de validation purement simulé, sans déploiement sur robot physique ni site pilote annoncé. Il se positionne dans un contexte plus large où l'exploitation du BIM en robotique reste marginale, la discipline étant dominée par les piles de navigation classiques (SLAM, ROS) et les simulateurs génériques. La plateforme sert de base pour évaluer virtuellement des opérations robotiques avant tout déploiement réel, les suites logiques étant l'extension à des tâches de maintenance plus complexes et une validation sur un déploiement physique.

RecherchePaper
1 source
RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés
2arXiv cs.RO 

RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés

Des chercheurs de l'ISRI-AIST, le laboratoire national de recherche industrielle japonais, ont publié RoboManipBaselines, un framework open-source unifié pour l'apprentissage par imitation appliqué à la manipulation robotique. Disponible sur GitHub et accompagné d'une page projet dédiée, ce cadre couvre l'intégralité du pipeline d'imitation learning : collecte de données, entraînement de politiques et exécution en rollout, aussi bien en simulation que sur robots réels. Concrètement, il supporte plusieurs simulateurs et environnements physiques via une interface unifiée, intègre des capteurs multimodaux (dont tactiles et capteurs 3D), et propose une bibliothèque de modèles de politiques variés. Les évaluations publiées s'appuient sur des datasets publics, ce qui est explicitement conçu pour garantir la reproductibilité des résultats. Plusieurs applications de recherche sont démontrées : augmentation de données, intégration de modèles tactiles, systèmes robotiques interactifs, évaluation de la perception 3D, et extensions matérielles. Ce framework répond à un problème structurel de la recherche en manipulation robotique : l'absence de benchmarks standardisés reproductibles, qui rend la comparaison entre approches quasi impossible et ralentit les transferts vers l'industrie. En proposant un pipeline cohérent du sim au réel, RoboManipBaselines facilite l'évaluation du sim-to-real gap, l'un des verrous critiques avant tout déploiement industriel. Pour un intégrateur ou un ingénieur robotique, l'extensibilité annoncée (ajout de nouveaux robots, tâches et politiques) réduit le coût d'entrée pour tester des architectures de type VLA (Vision-Language-Action) sur des configurations matérielles propres. C'est aussi un outil de validation expérimentale qui peut accélérer la qualification de politiques avant passage en production. L'imitation learning pour la manipulation connaît une effervescence depuis 2023-2024, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA, ou encore les travaux de Stanford et Berkeley. Dans cet écosystème, plusieurs frameworks concurrents existent déjà, notamment LeRobot de HuggingFace, RoboSuite (Stanford), ou MimicGen. RoboManipBaselines se distingue par son accent explicite sur la reproductibilité via datasets publics et son ancrage dans un laboratoire national disposant de plateformes matérielles réelles. L'AIST, acteur historique de la robotique japonaise (humanoïde HRP inclus), apporte une crédibilité expérimentale que les frameworks purement académiques n'ont pas toujours. La prochaine étape naturelle serait une adoption par des équipes industrielles pour valider des politiques sur des tâches d'assemblage ou de picking en conditions non contrôlées.

RecherchePaper
1 source
RoboNav-Arm : navigation à base d'agents et évitement d'obstacles pour bras robotique en environnement encombré
3arXiv cs.RO 

RoboNav-Arm : navigation à base d'agents et évitement d'obstacles pour bras robotique en environnement encombré

Une équipe de chercheurs propose RoboNav-Arm, un framework d'intelligence artificielle agentique destiné à la navigation et à l'évitement d'obstacles pour bras manipulateurs robotiques évoluant en environnement encombré, selon un article publié sur arXiv (arXiv:2607.09716v1). Le système repose sur un module de perception qui détecte les obstacles en temps réel, les localise en 3D et estime la géométrie de la surface au sol, avant de produire un rapport sémantique structuré précisant la position et la forme des objets ainsi que leur situation par rapport aux zones d'interaction critiques du bras. Un module de coordination central orchestre l'ensemble : il invoque des outils comme la mise à jour de la mémoire et de la scène de collision MoveIt, fait communiquer les différents modules entre eux et surveille en continu la progression de la tâche jusqu'à son achèvement. Un troisième module de planification choisit dynamiquement l'algorithme de mouvement le plus adapté, RRTConnect, RRT* ou BiTRRT, selon la configuration de l'environnement et l'objectif visé, avant qu'une étape de raffinement ne sécurise la trajectoire finale. Le tout a été testé dans le simulateur Gazebo Classic, avec des résultats jugés robustes face à des scénarios dynamiques. L'enjeu dépasse la simple démonstration académique : la manipulation robotique en environnement non structuré reste l'un des points durs de l'industrie, les pipelines de perception classiques étant figés et peu capables de s'adapter à des obstacles imprévus. En confiant la décision de planification à une architecture agentique capable de choisir l'algorithme et d'ajuster la trajectoire en fonction du contexte plutôt que de dépendre d'une connaissance préalable de la scène, cette approche s'inscrit dans une tendance plus large qui traverse la robotique industrielle et logistique, celle de systèmes de contrôle pilotés par des modèles capables de raisonner sur l'environnement plutôt que d'exécuter des règles fixes. Reste que la validation se limite à Gazebo Classic, un environnement simulé, sans transfert vers un bras réel ni comparaison chiffrée avec les méthodes de planification classiques. Le travail s'inscrit dans la lignée des recherches sur les architectures agentiques appliquées à la robotique, un domaine dynamisé ces derniers mois par des modèles vision-langage-action comme GR00T N2 ou Pi-0, qui cherchent eux aussi à combiner perception, raisonnement et contrôle moteur. Contrairement à ces VLA entraînés de bout en bout, RoboNav-Arm mise sur une architecture modulaire orchestrée par un agent central s'appuyant sur des outils de planification de mouvement existants comme MoveIt. Les auteurs ne précisent pas de calendrier pour un passage à un bras robotique physique, étape généralement nécessaire pour confirmer la robustesse observée en simulation.

RecherchePaper
1 source
DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique
4arXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats. L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets. DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

RecherchePaper
1 source