Aller au contenu principal
GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot
RecherchearXiv cs.RO 

GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un laboratoire de robotique universitaire (RCHI Lab) publie GenPHRI, une nouvelle version (arXiv:2604.08664v2, article de remplacement) d'un framework de simulation générative pour l'interaction physique humain-robot, ou pHRI. Le système transforme une simple description en langage naturel en scénario de simulation complet, comprenant une pièce meublée, une pose humaine adaptée à la tâche et un robot exécutant l'interaction demandée. L'architecture s'appuie sur des agents fondés sur des modèles vision-langage : un agent générateur et un agent critique itèrent sur chaque composant de la scène, pendant qu'un agent orchestrateur arbitre les décisions entre les différentes étapes de construction. Les auteurs ont généré 50 scénarios d'assistance distincts sans aucune intervention manuelle, puis déployé deux de ces tâches lors d'une étude impliquant 12 participants humains. Les politiques de vision entraînées sur ces données atteignent un taux de réussite zero-shot d'environ 80% en conditions réelles, contre environ 90% en simulation, avec des comportements jugés cohérents avec les consignes textuelles. Une seconde voie de déploiement, sans entraînement, permet aussi l'exécution directe des trajectoires générées, au prix d'une couverture de contact plus limitée.

Le travail cible un goulot d'étranglement concret du secteur : construire des scènes et des mouvements de simulation adaptés à chaque tâche de pHRI reste coûteux et lent, ce qui freine l'entraînement de politiques robotiques capables d'interagir physiquement avec des humains, au delà des tâches de manipulation d'objets classiques. En automatisant entièrement la génération de scénarios à partir de texte, GenPHRI illustre une tendance plus large où des agents VLM remplacent l'ingénierie manuelle de scènes simulées. L'écart mesuré entre performance simulée et performance réelle, dix points de pourcentage, reste toutefois un signal utile à retenir pour quiconque évalue la fiabilité de politiques entraînées uniquement en simulation avant tout déploiement physique auprès d'humains.

L'étude reste à ce stade un travail de recherche académique et non un produit commercialisé : la validation s'appuie sur une étude utilisateur restreinte à 12 participants et deux tâches déployées, pas sur un déploiement industriel. Les auteurs publient GenPHRI comme plateforme ouverte pour générer, entraîner et déployer des tâches de pHRI à partir de prompts textuels, avec davantage de détails sur le site du projet associé au laboratoire.

Dans nos dossiers

À lire aussi

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique
1arXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats. L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets. DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

RecherchePaper
1 source
SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation
2arXiv cs.RO 

SceneSmith : génération à base d'agents de scènes intérieures prêtes pour la simulation

SceneSmith est un framework agentique hiérarchique, présenté dans un preprint arXiv (2602.09153v2), qui génère des environnements intérieurs prêts pour la simulation robotique à partir de prompts en langage naturel. Le pipeline décompose la génération en trois étapes successives : layout architectural, placement de meubles, peuplement d'objets de petite taille. Chaque étape est pilotée par un trio d'agents VLM (vision-language model) jouant les rôles de designer, critique et orchestrateur. Pour les objets statiques, SceneSmith utilise la synthèse texte-vers-3D ; pour les objets articulés (portes, tiroirs, armoires), il interroge des bases de données d'assets existantes et estime automatiquement les propriétés physiques. Les résultats mesurés : 3 à 6 fois plus d'objets que les méthodes concurrentes, moins de 2 % de collisions inter-objets, 96 % des objets stables sous simulation physique. Une étude utilisateur conduite auprès de 205 participants donne à SceneSmith 92 % de taux de victoire sur le réalisme et 91 % sur la fidélité aux prompts face aux baselines -- des chiffres à interpréter avec prudence, les études perceptuelles restant par nature subjectives. L'enjeu central est le sim-to-real gap : les environnements synthétiques actuels sont trop épars et trop ordonnés pour que les politiques apprises soient transférables dans un foyer réel. SceneSmith cible directement ce problème en générant des scènes denses et encombrées, avec des objets articulés et des propriétés physiques cohérentes. Si les métriques annoncées résistent à une évaluation indépendante, cela réduit significativement le coût de constitution de jeux de données de simulation pour l'entraînement de politiques de manipulation, qu'il s'agisse de VLA ou de diffusion policies -- un besoin direct d'équipes comme Physical Intelligence ou Skild AI. Les auteurs démontrent que le pipeline s'intègre dans une boucle d'évaluation automatique de politiques robotiques, ce qui est précisément l'étape manquante pour industrialiser le cycle entraînement-évaluation en simulation. La génération automatique d'environnements intérieurs pour la robotique repose depuis des années sur des datasets à annotation manuelle coûteuse comme AI2-THOR, iGibson ou BEHAVIOR-1K, ou sur la génération procédurale (ProcTHOR), dont les scènes manquent de réalisme et de densité. SceneSmith s'inscrit dans une tendance plus large d'orchestration par LLM et VLM pour la génération 3D, une voie également explorée par Holodeck (Allen Institute for AI) et RoomDreamer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné dans le papier, ce qui en fait pour l'instant une contribution de recherche, sans acteur français ou européen identifiable dans l'écosystème décrit. La connexion directe à l'évaluation de politiques signale néanmoins une ambition claire d'intégration dans des pipelines d'entraînement réels, à mesure que la course aux robots domestiques s'intensifie.

RecherchePaper
1 source
Séparation comportement-exécution pour l'interaction physique homme-robot contrainte
3arXiv cs.RO 

Séparation comportement-exécution pour l'interaction physique homme-robot contrainte

Des chercheurs proposent, dans une prépublication arXiv (2609.00669v1) du 2 septembre 2026, une architecture qui sépare la spécification du comportement souhaité et sa réalisation contrainte dans les interactions physiques homme-robot. Une couche comportement calcule une accélération désirée au point de contact, ak^id = ftheta(ek, ėk, F_h,k), tandis qu'une couche réalisation distincte la convertit en commandes robot sous contraintes et rapporte explicitement l'écart entre accélération désirée et réalisée, plutôt que de le masquer par saturation. Le système, un programme quadratique à horizon glissant, est testé sur un bras Franka FR3 à 7 degrés de liberté, à commande en couple, simulé sous MuJoCo. Sous une poussée soutenue de 20 newtons, la limite de l'espace de travail est respectée à environ 0,1 à 0,2 mm près, contre un dépassement de 4,4 cm en contrôle d'impédance classique et 4,7 cm en admittance, deux méthodes qui écrêtent instantanément les commandes. Avec un budget d'actionneur réduit, l'application des contraintes sur tout l'horizon garde le plan faisable à 2,1x10^-4 N.m près, contre un dépassement pouvant atteindre 11,329 N.m pour une variante qui ne contraint que le premier pas de calcul. Sur le système non linéaire réellement exécuté, l'écart se réduit mais reste favorable à l'approche par horizon complet, 0,161 contre 0,380 N.m. Cette séparation architecturale intéresse les intégrateurs de robots collaboratifs et humanoïdes en contact physique répété avec des humains ou des objets, un domaine où le contrôle d'impédance et d'admittance restent la norme malgré des dépassements de plusieurs centimètres lors de chocs ou de poussées. En rendant l'erreur de réalisation visible plutôt que dissimulée dans la saturation, l'approche facilite le diagnostic et la certification de sécurité des systèmes à interaction physique, un enjeu central pour les cobots industriels et les humanoïdes partageant des tâches avec des opérateurs. Elle montre aussi qu'un changement de comportement, par exemple passer d'un mode impédance à un mode admittance, peut s'effectuer en modifiant seulement les coefficients d'objectif du solveur sans reconstruire toute la boucle de commande, ce qui simplifierait le déploiement de comportements adaptatifs en temps réel. Le travail s'inscrit dans la lignée du contrôle d'impédance et d'admittance, formalismes classiques de l'interaction homme-robot, en cherchant à corriger leur principal défaut, la gestion approximative des contraintes par écrêtage instantané. La validation reste circonscrite à un cas d'étude planaire et à une seule plateforme robotique en simulation, ce que les auteurs présentent eux-mêmes comme une preuve de concept ciblée plutôt qu'un système prêt au déploiement industriel. Les prochaines étapes attendues incluent l'extension à des tâches tridimensionnelles, à d'autres architectures robotiques, et une validation sur matériel réel au-delà de la simulation MuJoCo.

UELe bras robotique utilisé pour les tests, le Franka FR3, est fabriqué par l'entreprise allemande Franka Robotics, mais aucun déploiement ni application concrète en France ou en UE n'est mentionné.

RecherchePaper
1 source
ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche
4arXiv cs.RO 

ARSTAG : un système à base d'agents Real2Sim2Real pour la génération de données robotiques spécifiques à une tâche

Une équipe de recherche présente ARSTAG, un système agentic Real2Sim2Real qui transforme une image RGB et une instruction en langage naturel en données d'entraînement pour des politiques robotiques visuomotrices, sans construction manuelle de scène ni téléopération. Décrit dans un papier publié sur arXiv le 22 septembre 2026 (arXiv:2609.24563), le système s'appuie sur une hiérarchie d'agents linguistiques qui bâtissent une scène de simulation adaptée à la tâche, génèrent des démonstrations robot-réalisables puis élargissent la distribution d'entraînement par randomisation, sous la supervision d'un agent coordinateur gérant le retour d'information entre étapes. Sur sept tâches de manipulation (préhension, placement, empilement), le pipeline a permis un transfert simulation-vers-réel de trois architectures de politiques sur un robot bimanuel, la politique pi0.5 atteignant un taux de réussite moyen réel de 74,6 %. Les ablations montrent que la randomisation spécifique à la tâche améliore la robustesse, et que la performance croît avec la taille du jeu de données généré. Ce travail cible le goulot d'étranglement central de l'apprentissage robotique : la collecte de données spécifiques à chaque tâche. Les politiques vision-language-action, comme pi-0 ou GR00T N2, exigent des volumes massifs de démonstrations, généralement recueillies par téléopération humaine, méthode coûteuse et difficile à faire évoluer. En automatisant via des agents LLM la construction de scène, la génération de démonstrations et la randomisation du domaine, ARSTAG vise à réduire l'ingénierie manuelle nécessaire pour adapter un robot à une nouvelle tâche, un enjeu direct pour les intégrateurs voulant déployer bras et humanoïdes sur des tâches variées. Le taux de 74,6 % reste toutefois une démonstration de faisabilité sur sept tâches en laboratoire, pas un déploiement industriel. ARSTAG s'inscrit dans la lignée des recherches sur le Real2Sim2Real, qui partent d'observations réelles plutôt que de scènes construites à la main pour réduire l'écart simulation-réel, une piste également explorée par des systèmes comme RoboGen ou DexMimicGen. Tester le pipeline sur trois architectures différentes, dont pi0.5, successeur de pi-0 développé par Physical Intelligence, suggère une volonté de positionner ARSTAG comme une brique de génération de données agnostique au modèle plutôt que comme un concurrent des laboratoires qui développent ces politiques. Le papier reste une contribution académique, sans partenariat industriel ni calendrier de déploiement commercial annoncés ; l'étape suivante serait l'extension à davantage de tâches et de plateformes robotiques, notamment humanoïdes.

RecherchePaper
1 source