Aller au contenu principal
STABLE : génération d'agencements de table prêts à la simulation via un système dual sémantique-physique
RecherchearXiv cs.RO 

STABLE : génération d'agencements de table prêts à la simulation via un système dual sémantique-physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié STABLE (arXiv:2605.16137), un système de génération automatique de scènes de table prêtes à la simulation à partir d'instructions textuelles. Le système repose sur une architecture duale composée de deux modules complémentaires : un Semantic Reasoner, un LLM fine-tuné sur un dataset structuré de scènes de table qui produit des dispositions d'objets grossières depuis les consignes de tâche, et un Physics Corrector, un modèle de débruitage basé sur les flux physiques qui calcule des mises à jour de pose pour corriger les arrangements invalides. Les deux modules s'alternent selon un paradigme de génération progressive, en étendant la scène des objets critiques pour la tâche vers les objets d'arrière-plan. Les expériences montrent que STABLE génère des scènes conformes aux instructions tout en améliorant significativement la validité physique par rapport aux méthodes existantes.

Le problème ciblé est concret et documenté : lorsqu'on confie la génération de layouts 3D à des LLMs seuls, les objets se retrouvent fréquemment en collision ou en suspension, rendant les scènes inutilisables pour l'entraînement robotique. Pour les équipes travaillant sur des pipelines sim-to-real en manipulation de table, cette limite impose un post-traitement manuel coûteux. L'apport de STABLE est de séparer le raisonnement sémantique (ce qui doit être présent et où, logiquement) du raisonnement physique (comment corriger les positions pour que la scène soit simulable), plutôt que de charger un seul modèle des deux. C'est une réponse directe au sim-to-real gap dans la phase de génération de données, un verrou bien identifié dans la communauté Embodied AI.

Cette publication s'inscrit dans une tendance plus large autour de la génération automatique d'environnements de simulation pour l'apprentissage robot, où des approches comme LayoutGPT avaient déjà montré que les LLMs raisonnent mal en coordonnées spatiales. STABLE ne revendique pas de déploiement industriel : c'est une contribution de recherche, avec des résultats expérimentaux sur benchmarks mais sans pipeline productionisé ni timeline commerciale annoncée. Les prochaines étapes naturelles seraient l'extension au-delà des surfaces planes et l'intégration dans des frameworks de génération de données pour la manipulation, comme ceux utilisés par les équipes travaillant sur des modèles VLA (Vision-Language-Action).

À lire aussi

ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche
1arXiv cs.RO 

ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche

Une équipe de recherche présente ARSTAG, un système agentic Real2Sim2Real qui transforme une image RGB et une instruction en langage naturel en données d'entraînement pour des politiques robotiques visuomotrices, sans construction manuelle de scène ni téléopération. Décrit dans un papier publié sur arXiv le 22 septembre 2026 (arXiv:2609.24563), le système s'appuie sur une hiérarchie d'agents linguistiques qui bâtissent une scène de simulation adaptée à la tâche, génèrent des démonstrations robot-réalisables puis élargissent la distribution d'entraînement par randomisation, sous la supervision d'un agent coordinateur gérant le retour d'information entre étapes. Sur sept tâches de manipulation (préhension, placement, empilement), le pipeline a permis un transfert simulation-vers-réel de trois architectures de politiques sur un robot bimanuel, la politique pi0.5 atteignant un taux de réussite moyen réel de 74,6 %. Les ablations montrent que la randomisation spécifique à la tâche améliore la robustesse, et que la performance croît avec la taille du jeu de données généré. Ce travail cible le goulot d'étranglement central de l'apprentissage robotique : la collecte de données spécifiques à chaque tâche. Les politiques vision-language-action, comme pi-0 ou GR00T N2, exigent des volumes massifs de démonstrations, généralement recueillies par téléopération humaine, méthode coûteuse et difficile à faire évoluer. En automatisant via des agents LLM la construction de scène, la génération de démonstrations et la randomisation du domaine, ARSTAG vise à réduire l'ingénierie manuelle nécessaire pour adapter un robot à une nouvelle tâche, un enjeu direct pour les intégrateurs voulant déployer bras et humanoïdes sur des tâches variées. Le taux de 74,6 % reste toutefois une démonstration de faisabilité sur sept tâches en laboratoire, pas un déploiement industriel. ARSTAG s'inscrit dans la lignée des recherches sur le Real2Sim2Real, qui partent d'observations réelles plutôt que de scènes construites à la main pour réduire l'écart simulation-réel, une piste également explorée par des systèmes comme RoboGen ou DexMimicGen. Tester le pipeline sur trois architectures différentes, dont pi0.5, successeur de pi-0 développé par Physical Intelligence, suggère une volonté de positionner ARSTAG comme une brique de génération de données agnostique au modèle plutôt que comme un concurrent des laboratoires qui développent ces politiques. Le papier reste une contribution académique, sans partenariat industriel ni calendrier de déploiement commercial annoncés ; l'étape suivante serait l'extension à davantage de tâches et de plateformes robotiques, notamment humanoïdes.

RecherchePaper
1 source
SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation
2arXiv cs.RO 

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation

SceneSmith est un framework agentique hiérarchique, présenté dans un preprint arXiv (2602.09153v2), qui génère des environnements intérieurs prêts pour la simulation robotique à partir de prompts en langage naturel. Le pipeline décompose la génération en trois étapes successives : layout architectural, placement de meubles, peuplement d'objets de petite taille. Chaque étape est pilotée par un trio d'agents VLM (vision-language model) jouant les rôles de designer, critique et orchestrateur. Pour les objets statiques, SceneSmith utilise la synthèse texte-vers-3D ; pour les objets articulés (portes, tiroirs, armoires), il interroge des bases de données d'assets existantes et estime automatiquement les propriétés physiques. Les résultats mesurés : 3 à 6 fois plus d'objets que les méthodes concurrentes, moins de 2 % de collisions inter-objets, 96 % des objets stables sous simulation physique. Une étude utilisateur conduite auprès de 205 participants donne à SceneSmith 92 % de taux de victoire sur le réalisme et 91 % sur la fidélité aux prompts face aux baselines -- des chiffres à interpréter avec prudence, les études perceptuelles restant par nature subjectives. L'enjeu central est le sim-to-real gap : les environnements synthétiques actuels sont trop épars et trop ordonnés pour que les politiques apprises soient transférables dans un foyer réel. SceneSmith cible directement ce problème en générant des scènes denses et encombrées, avec des objets articulés et des propriétés physiques cohérentes. Si les métriques annoncées résistent à une évaluation indépendante, cela réduit significativement le coût de constitution de jeux de données de simulation pour l'entraînement de politiques de manipulation, qu'il s'agisse de VLA ou de diffusion policies -- un besoin direct d'équipes comme Physical Intelligence ou Skild AI. Les auteurs démontrent que le pipeline s'intègre dans une boucle d'évaluation automatique de politiques robotiques, ce qui est précisément l'étape manquante pour industrialiser le cycle entraînement-évaluation en simulation. La génération automatique d'environnements intérieurs pour la robotique repose depuis des années sur des datasets à annotation manuelle coûteuse comme AI2-THOR, iGibson ou BEHAVIOR-1K, ou sur la génération procédurale (ProcTHOR), dont les scènes manquent de réalisme et de densité. SceneSmith s'inscrit dans une tendance plus large d'orchestration par LLM et VLM pour la génération 3D, une voie également explorée par Holodeck (Allen Institute for AI) et RoomDreamer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans le papier, ce qui en fait pour l'instant une contribution de recherche, sans acteur français ou européen identifiable dans l'écosystème décrit. La connexion directe à l'évaluation de politiques signale néanmoins une ambition claire d'intégration dans des pipelines d'entraînement réels, à mesure que la course aux robots domestiques s'intensifie.

RecherchePaper
1 source
PhysX-CoT : raisonnement physique structuré, d'une image unique à des actifs 3D prêts pour la simulation
3arXiv cs.RO 

PhysX-CoT : raisonnement physique structuré, d'une image unique à des actifs 3D prêts pour la simulation

Des chercheurs ont publié le 11 août 2026 sur arXiv (référence 2608.08053v1) une méthode baptisée PhysX-CoT, conçue pour générer des actifs 3D prêts pour la simulation directement à partir d'une seule image. Contrairement aux approches actuelles, qui confient cette tâche à un modèle vision-langage produisant un flux de tokens unique et global ensuite décodé en géométrie et en champs physiques, PhysX-CoT décompose le processus en une trajectoire explicite et structurée d'états par partie : décomposition, ancrage 2D et 3D, relations entre parties, géométrie grossière et indices de surface, chaque étape étant supervisée séparément. La géométrie est factorisée de sorte que des boîtes englobantes 3D encodent le placement tandis que des codes locaux encodent la forme, et un entraînement par renforcement de type GRPO aligné sur cette chaîne de raisonnement optimise la validité du parsing, l'ancrage, la géométrie, le placement et la cohérence physique. Testée selon un protocole unifié, avec les mêmes backbone, données et décodeur figé que les méthodes concurrentes, PhysX-CoT dépasse la meilleure référence existante sur les métriques de géométrie, d'échelle et d'attributs physiques, et les actifs générés se chargent, entrent en collision et s'articulent correctement dans Unreal Engine 5. Pour l'industrie robotique et l'IA incarnée, ce travail s'attaque à un goulot d'étranglement réel : la production à grande échelle d'environnements simulés physiquement crédibles, nécessaires à l'entraînement de politiques VLA comme celles utilisées par GR00T N2, Pi-0 ou Helix. En rendant les étapes intermédiaires de génération vérifiables plutôt qu'implicites, la méthode ouvre la voie à un diagnostic plus fin des erreurs de géométrie ou de physique qui pénalisent aujourd'hui les pipelines automatisés. Les auteurs appuient leur démonstration sur des contrôles rigoureux (oracle, comparaisons à budget de tokens équivalent, permutation de l'ordre des états), montrant que ce raisonnement structuré est fonctionnel et non cosmétique, un point de méthode qui renforce la crédibilité des gains annoncés malgré leur origine auto-rapportée. Ce travail s'inscrit dans la lignée des recherches en chaîne de raisonnement appliquées au-delà du texte, transposées ici à la génération d'actifs 3D physiques pour la robotique simulée. Il reste à ce stade une contribution académique, sans déploiement commercial annoncé ; les prochaines étapes attendues concernent l'intégration à des pipelines d'entraînement de robots et l'extension à des actifs plus complexes.

RecherchePaper
1 source
GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot
4arXiv cs.RO 

GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot

Un laboratoire de robotique universitaire (RCHI Lab) publie GenPHRI, une nouvelle version (arXiv:2604.08664v2, article de remplacement) d'un framework de simulation générative pour l'interaction physique humain-robot, ou pHRI. Le système transforme une simple description en langage naturel en scénario de simulation complet, comprenant une pièce meublée, une pose humaine adaptée à la tâche et un robot exécutant l'interaction demandée. L'architecture s'appuie sur des agents fondés sur des modèles vision-langage : un agent générateur et un agent critique itèrent sur chaque composant de la scène, pendant qu'un agent orchestrateur arbitre les décisions entre les différentes étapes de construction. Les auteurs ont généré 50 scénarios d'assistance distincts sans aucune intervention manuelle, puis déployé deux de ces tâches lors d'une étude impliquant 12 participants humains. Les politiques de vision entraînées sur ces données atteignent un taux de réussite zero-shot d'environ 80% en conditions réelles, contre environ 90% en simulation, avec des comportements jugés cohérents avec les consignes textuelles. Une seconde voie de déploiement, sans entraînement, permet aussi l'exécution directe des trajectoires générées, au prix d'une couverture de contact plus limitée. Le travail cible un goulot d'étranglement concret du secteur : construire des scènes et des mouvements de simulation adaptés à chaque tâche de pHRI reste coûteux et lent, ce qui freine l'entraînement de politiques robotiques capables d'interagir physiquement avec des humains, au delà des tâches de manipulation d'objets classiques. En automatisant entièrement la génération de scénarios à partir de texte, GenPHRI illustre une tendance plus large où des agents VLM remplacent l'ingénierie manuelle de scènes simulées. L'écart mesuré entre performance simulée et performance réelle, dix points de pourcentage, reste toutefois un signal utile à retenir pour quiconque évalue la fiabilité de politiques entraînées uniquement en simulation avant tout déploiement physique auprès d'humains. L'étude reste à ce stade un travail de recherche académique et non un produit commercialisé : la validation s'appuie sur une étude utilisateur restreinte à 12 participants et deux tâches déployées, pas sur un déploiement industriel. Les auteurs publient GenPHRI comme plateforme ouverte pour générer, entraîner et déployer des tâches de pHRI à partir de prompts textuels, avec davantage de détails sur le site du projet associé au laboratoire.

RecherchePaper
1 source