Aller au contenu principal
RecherchearXiv cs.RO 

ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ARSTAG, un système agentic Real2Sim2Real qui transforme une image RGB et une instruction en langage naturel en données d'entraînement pour des politiques robotiques visuomotrices, sans construction manuelle de scène ni téléopération. Décrit dans un papier publié sur arXiv le 22 septembre 2026 (arXiv:2609.24563), le système s'appuie sur une hiérarchie d'agents linguistiques qui bâtissent une scène de simulation adaptée à la tâche, génèrent des démonstrations robot-réalisables puis élargissent la distribution d'entraînement par randomisation, sous la supervision d'un agent coordinateur gérant le retour d'information entre étapes. Sur sept tâches de manipulation (préhension, placement, empilement), le pipeline a permis un transfert simulation-vers-réel de trois architectures de politiques sur un robot bimanuel, la politique pi0.5 atteignant un taux de réussite moyen réel de 74,6 %. Les ablations montrent que la randomisation spécifique à la tâche améliore la robustesse, et que la performance croît avec la taille du jeu de données généré.

Ce travail cible le goulot d'étranglement central de l'apprentissage robotique : la collecte de données spécifiques à chaque tâche. Les politiques vision-language-action, comme pi-0 ou GR00T N2, exigent des volumes massifs de démonstrations, généralement recueillies par téléopération humaine, méthode coûteuse et difficile à faire évoluer. En automatisant via des agents LLM la construction de scène, la génération de démonstrations et la randomisation du domaine, ARSTAG vise à réduire l'ingénierie manuelle nécessaire pour adapter un robot à une nouvelle tâche, un enjeu direct pour les intégrateurs voulant déployer bras et humanoïdes sur des tâches variées. Le taux de 74,6 % reste toutefois une démonstration de faisabilité sur sept tâches en laboratoire, pas un déploiement industriel.

ARSTAG s'inscrit dans la lignée des recherches sur le Real2Sim2Real, qui partent d'observations réelles plutôt que de scènes construites à la main pour réduire l'écart simulation-réel, une piste également explorée par des systèmes comme RoboGen ou DexMimicGen. Tester le pipeline sur trois architectures différentes, dont pi0.5, successeur de pi-0 développé par Physical Intelligence, suggère une volonté de positionner ARSTAG comme une brique de génération de données agnostique au modèle plutôt que comme un concurrent des laboratoires qui développent ces politiques. Le papier reste une contribution académique, sans partenariat industriel ni calendrier de déploiement commercial annoncés ; l'étape suivante serait l'extension à davantage de tâches et de plateformes robotiques, notamment humanoïdes.

À lire aussi

Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents
1arXiv cs.RO 

Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents

Un article publié le 20 août 2026 sur arXiv (référence 2608.18227v1) revisite Push-T, benchmark de référence pour l'apprentissage de politiques de manipulation par démonstration humaine, dans lequel un robot doit pousser un bloc en forme de T jusqu'à une pose cible en n'utilisant qu'un seul point de contact. Les auteurs ont chargé un agent de codage LLM, Claude Code associé au modèle Fable 5, de produire une solution algorithmique sans aucune donnée de démonstration. L'agent a retrouvé de lui-même la simulation 2D Gym du benchmark en ligne, mené des expériences simulées pour apprendre la mécanique de poussée, puis optimisé itérativement son code jusqu'à atteindre 100% de réussite avec 46% d'étapes en moins que la meilleure politique de diffusion entraînée sur 200 démonstrations humaines. Il a ensuite étendu la tâche à tout l'alphabet, de Push-A à Push-Z, via un curriculum auto-généré, et produit des simulations 3D avec retour visuel pour les bras robotiques Franka et UR5. Vidéos, politiques et détails complets doivent encore être publiés en ligne. Ce résultat interroge une hypothèse centrale du secteur, selon laquelle la manipulation robotique fine passe nécessairement par l'apprentissage par imitation ou par des modèles vision-langage-action entraînés sur de vastes jeux de démonstrations, à l'image de Pi-0, GR00T N2 ou Helix. Ici, un agent de codage génère un contrôle explicite et interprétable qui surpasse une politique de diffusion apprise, sans collecte de données préalable, ce qui intéresse directement les intégrateurs et équipes de R&D cherchant à réduire le coût et le délai de déploiement sur des tâches bien spécifiées. Le succès reste toutefois circonscrit à un benchmark 2D très étudié : l'extension à des simulations 3D avec Franka et UR5 constitue un pas vers la généralisation, mais aucune validation sur robot physique réel n'est rapportée, ce qui limite la portée immédiate pour la production. Push-T tire son origine des travaux sur la Diffusion Policy, qui en avaient fait un banc d'essai standard pour comparer les politiques de manipulation apprises. Ce court article se positionne dans le champ émergent de la « robotique agentique », où des agents de codage basés sur des LLM, comme Claude Code, sont testés comme alternative aux pipelines d'apprentissage par imitation qui dominent aujourd'hui la robotique humanoïde et les bras manipulateurs. Aucun laboratoire ni entreprise autre qu'Anthropic, via son modèle Fable 5, n'est cité dans le résumé, et aucune date de publication des vidéos et politiques associées n'est encore précisée. L'étude reste à ce stade une preuve de concept en simulation, sans pilote industriel ni déploiement matériel confirmé.

RecherchePaper
1 source
De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
2arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source
DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique
3arXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats. L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets. DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

RecherchePaper
1 source
STABLE : génération d'agencements de table prêts à la simulation via un système dual sémantique-physique
4arXiv cs.RO 

STABLE : génération d'agencements de table prêts à la simulation via un système dual sémantique-physique

Une équipe de chercheurs a publié STABLE (arXiv:2605.16137), un système de génération automatique de scènes de table prêtes à la simulation à partir d'instructions textuelles. Le système repose sur une architecture duale composée de deux modules complémentaires : un Semantic Reasoner, un LLM fine-tuné sur un dataset structuré de scènes de table qui produit des dispositions d'objets grossières depuis les consignes de tâche, et un Physics Corrector, un modèle de débruitage basé sur les flux physiques qui calcule des mises à jour de pose pour corriger les arrangements invalides. Les deux modules s'alternent selon un paradigme de génération progressive, en étendant la scène des objets critiques pour la tâche vers les objets d'arrière-plan. Les expériences montrent que STABLE génère des scènes conformes aux instructions tout en améliorant significativement la validité physique par rapport aux méthodes existantes. Le problème ciblé est concret et documenté : lorsqu'on confie la génération de layouts 3D à des LLMs seuls, les objets se retrouvent fréquemment en collision ou en suspension, rendant les scènes inutilisables pour l'entraînement robotique. Pour les équipes travaillant sur des pipelines sim-to-real en manipulation de table, cette limite impose un post-traitement manuel coûteux. L'apport de STABLE est de séparer le raisonnement sémantique (ce qui doit être présent et où, logiquement) du raisonnement physique (comment corriger les positions pour que la scène soit simulable), plutôt que de charger un seul modèle des deux. C'est une réponse directe au sim-to-real gap dans la phase de génération de données, un verrou bien identifié dans la communauté Embodied AI. Cette publication s'inscrit dans une tendance plus large autour de la génération automatique d'environnements de simulation pour l'apprentissage robot, où des approches comme LayoutGPT avaient déjà montré que les LLMs raisonnent mal en coordonnées spatiales. STABLE ne revendique pas de déploiement industriel : c'est une contribution de recherche, avec des résultats expérimentaux sur benchmarks mais sans pipeline productionisé ni timeline commerciale annoncée. Les prochaines étapes naturelles seraient l'extension au-delà des surfaces planes et l'intégration dans des frameworks de génération de données pour la manipulation, comme ceux utilisés par les équipes travaillant sur des modèles VLA (Vision-Language-Action).

RecherchePaper
1 source