Aller au contenu principal
SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel
RecherchearXiv cs.RO 

SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SR-Platform est un pipeline agentique, publié en preprint arXiv (2605.14700) en mai 2026, qui convertit des descriptions en langage naturel en environnements de simulation MuJoCo exécutables et physiquement valides. Le système décompose la génération de scènes en quatre étapes : un orchestrateur LLM qui structure l'intention utilisateur en plan de scène ; un "asset forge" qui récupère des géométries en cache ou en génère de nouvelles via synthèse LLM-CadQuery ; un "layout architect" qui assigne les poses des objets et vérifie les contraintes spatiales ; et une couche bridge qui assemble le fichier MJCF final en intégrant le modèle de robot cible. Déployé comme stack Docker à neuf services (MinIO pour les meshes, Qdrant pour la récupération sémantique d'assets, Redis pour l'état des jobs, InfluxDB pour la télémétrie), SR-Platform affiche une latence médiane d'environ 50 secondes pour des scènes à cinq objets, tombant à 30-40 secondes avec cache d'assets actif, sur une base de 611 appels LLM réussis en 30 jours de production. Le taux de retry de l'asset forge atteint 11,3 %, avec récupération automatique.

Construire manuellement une scène MuJoCo prête à l'entraînement exige une expertise croisée en modélisation 3D, spécification MJCF, gestion des collisions et intégration robot, un processus qui représente typiquement plusieurs heures par scène. Ramener cette étape à moins d'une minute via une invite en langage naturel est un levier direct pour produire des environnements d'entraînement plus variés, facteur clé de la généralisation sim-to-real des politiques robotiques. Pour les équipes de robot learning, cette friction de configuration est réelle et souvent sous-estimée dans les pipelines de données synthétiques. Les métriques publiées portent cependant sur des scènes limitées à cinq objets dans un cadre contrôlé, et la robustesse du pipeline sur des configurations plus complexes ou des descriptions ambiguës reste à démontrer.

La génération automatisée d'environnements de simulation est un goulot d'étranglement reconnu dans les pipelines de robot learning, que ce soit pour le reinforcement learning, l'imitation learning ou l'entraînement de modèles vision-langage-action (VLA). MuJoCo, maintenu par DeepMind, est le moteur physique de référence pour ces travaux. NVIDIA Isaac Lab et le framework open-source Genesis couvrent également cet espace ; Physical Intelligence (pi.ai) mise de son côté sur des pipelines d'entraînement à très large échelle. SR-Platform se positionne en amont, sur la génération de scènes plutôt que de politiques, avec un accent sur l'accessibilité via le langage naturel. Son code source n'est pas publié en open-source et le contexte précis du déploiement qualifié de "production" n'est pas explicité dans le preprint.

À lire aussi

Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique
1arXiv cs.RO 

Robot BIM : plateforme de simulation à événements discrets basée sur des agents pour la robotique

Une équipe de recherche propose sur arXiv (2607.16920v1) une plateforme de simulation événementielle discrète, multi-agents et couplée au Building Information Modeling (BIM), pour la navigation et la planification d'opérations robotiques en intérieur. La méthode discrétise l'environnement en cellules de grille converties en nœuds de graphe, classés en trois catégories selon leur relation spatiale avec les éléments du bâtiment : nœuds cibles, nœuds obstacles et nœuds réguliers. Des coûts de traversée sont ensuite assignés aux arêtes reliant les nœuds voisins, ce qui permet à des algorithmes de théorie des graphes de calculer des trajectoires efficaces et sans collision. Les simulations confirment que cette représentation en graphe produit une navigation fonctionnelle, mais les auteurs identifient une limite concrète à discrétisation grossière : un chevauchement entre cellules occupées par une cible et cellules occupées par un obstacle, corrigé par un raffinement de la grille qui améliore la précision spatiale et la faisabilité des trajectoires. L'apport principal tient au type d'information mobilisée. La plupart des robots d'intérieur pour la maintenance de bâtiments (nettoyage, inspection) reposent sur des trajets prédéfinis ou du SLAM, qui ne fournissent qu'une compréhension géométrique limitée de l'environnement. Or des tâches plus complexes, comme localiser et réparer une fuite sur une canalisation, exigent d'accéder à des données que seul le BIM contient réellement : position, géométrie, matériau et attributs opérationnels des composants du bâtiment. En connectant ce gisement de données à un moteur de planification par graphe, la plateforme ouvre la voie à des robots capables de raisonner sur le bâtiment lui-même, et pas seulement de s'y déplacer, ce qui intéresse directement les intégrateurs en facility management et en maintenance industrielle. Il s'agit toutefois d'un travail de recherche à un stade de validation purement simulé, sans déploiement sur robot physique ni site pilote annoncé. Il se positionne dans un contexte plus large où l'exploitation du BIM en robotique reste marginale, la discipline étant dominée par les piles de navigation classiques (SLAM, ROS) et les simulateurs génériques. La plateforme sert de base pour évaluer virtuellement des opérations robotiques avant tout déploiement réel, les suites logiques étant l'extension à des tâches de maintenance plus complexes et une validation sur un déploiement physique.

RecherchePaper
1 source
RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés
2arXiv cs.RO 

RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés

Des chercheurs de l'ISRI-AIST, le laboratoire national de recherche industrielle japonais, ont publié RoboManipBaselines, un framework open-source unifié pour l'apprentissage par imitation appliqué à la manipulation robotique. Disponible sur GitHub et accompagné d'une page projet dédiée, ce cadre couvre l'intégralité du pipeline d'imitation learning : collecte de données, entraînement de politiques et exécution en rollout, aussi bien en simulation que sur robots réels. Concrètement, il supporte plusieurs simulateurs et environnements physiques via une interface unifiée, intègre des capteurs multimodaux (dont tactiles et capteurs 3D), et propose une bibliothèque de modèles de politiques variés. Les évaluations publiées s'appuient sur des datasets publics, ce qui est explicitement conçu pour garantir la reproductibilité des résultats. Plusieurs applications de recherche sont démontrées : augmentation de données, intégration de modèles tactiles, systèmes robotiques interactifs, évaluation de la perception 3D, et extensions matérielles. Ce framework répond à un problème structurel de la recherche en manipulation robotique : l'absence de benchmarks standardisés reproductibles, qui rend la comparaison entre approches quasi impossible et ralentit les transferts vers l'industrie. En proposant un pipeline cohérent du sim au réel, RoboManipBaselines facilite l'évaluation du sim-to-real gap, l'un des verrous critiques avant tout déploiement industriel. Pour un intégrateur ou un ingénieur robotique, l'extensibilité annoncée (ajout de nouveaux robots, tâches et politiques) réduit le coût d'entrée pour tester des architectures de type VLA (Vision-Language-Action) sur des configurations matérielles propres. C'est aussi un outil de validation expérimentale qui peut accélérer la qualification de politiques avant passage en production. L'imitation learning pour la manipulation connaît une effervescence depuis 2023-2024, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA, ou encore les travaux de Stanford et Berkeley. Dans cet écosystème, plusieurs frameworks concurrents existent déjà, notamment LeRobot de HuggingFace, RoboSuite (Stanford), ou MimicGen. RoboManipBaselines se distingue par son accent explicite sur la reproductibilité via datasets publics et son ancrage dans un laboratoire national disposant de plateformes matérielles réelles. L'AIST, acteur historique de la robotique japonaise (humanoïde HRP inclus), apporte une crédibilité expérimentale que les frameworks purement académiques n'ont pas toujours. La prochaine étape naturelle serait une adoption par des équipes industrielles pour valider des politiques sur des tâches d'assemblage ou de picking en conditions non contrôlées.

RecherchePaper
1 source
RoboNav-Arm : navigation à base d'agents et évitement d'obstacles pour bras robotique en environnement encombré
3arXiv cs.RO 

RoboNav-Arm : navigation à base d'agents et évitement d'obstacles pour bras robotique en environnement encombré

Une équipe de chercheurs propose RoboNav-Arm, un framework d'intelligence artificielle agentique destiné à la navigation et à l'évitement d'obstacles pour bras manipulateurs robotiques évoluant en environnement encombré, selon un article publié sur arXiv (arXiv:2607.09716v1). Le système repose sur un module de perception qui détecte les obstacles en temps réel, les localise en 3D et estime la géométrie de la surface au sol, avant de produire un rapport sémantique structuré précisant la position et la forme des objets ainsi que leur situation par rapport aux zones d'interaction critiques du bras. Un module de coordination central orchestre l'ensemble : il invoque des outils comme la mise à jour de la mémoire et de la scène de collision MoveIt, fait communiquer les différents modules entre eux et surveille en continu la progression de la tâche jusqu'à son achèvement. Un troisième module de planification choisit dynamiquement l'algorithme de mouvement le plus adapté, RRTConnect, RRT* ou BiTRRT, selon la configuration de l'environnement et l'objectif visé, avant qu'une étape de raffinement ne sécurise la trajectoire finale. Le tout a été testé dans le simulateur Gazebo Classic, avec des résultats jugés robustes face à des scénarios dynamiques. L'enjeu dépasse la simple démonstration académique : la manipulation robotique en environnement non structuré reste l'un des points durs de l'industrie, les pipelines de perception classiques étant figés et peu capables de s'adapter à des obstacles imprévus. En confiant la décision de planification à une architecture agentique capable de choisir l'algorithme et d'ajuster la trajectoire en fonction du contexte plutôt que de dépendre d'une connaissance préalable de la scène, cette approche s'inscrit dans une tendance plus large qui traverse la robotique industrielle et logistique, celle de systèmes de contrôle pilotés par des modèles capables de raisonner sur l'environnement plutôt que d'exécuter des règles fixes. Reste que la validation se limite à Gazebo Classic, un environnement simulé, sans transfert vers un bras réel ni comparaison chiffrée avec les méthodes de planification classiques. Le travail s'inscrit dans la lignée des recherches sur les architectures agentiques appliquées à la robotique, un domaine dynamisé ces derniers mois par des modèles vision-langage-action comme GR00T N2 ou Pi-0, qui cherchent eux aussi à combiner perception, raisonnement et contrôle moteur. Contrairement à ces VLA entraînés de bout en bout, RoboNav-Arm mise sur une architecture modulaire orchestrée par un agent central s'appuyant sur des outils de planification de mouvement existants comme MoveIt. Les auteurs ne précisent pas de calendrier pour un passage à un bras robotique physique, étape généralement nécessaire pour confirmer la robustesse observée en simulation.

RecherchePaper
1 source
De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
4arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source