Aller au contenu principal
Au-delà des heuristiques : un pipeline Real2Sim standardisé pour l'interaction physique homme-robot en simulation avec humain dans la boucle
RecherchearXiv cs.RO 

Au-delà des heuristiques : un pipeline Real2Sim standardisé pour l'interaction physique homme-robot en simulation avec humain dans la boucle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente un pipeline Real2Sim destiné à améliorer la fidélité des simulations Human-in-the-Loop (HITL) utilisées pour tester des robots d'assistance physique. Le système cible l'interface pelvis-sangle d'un assistant mobile à l'équilibre porté au-dessus du sol, modélisée comme un mécanisme viscoélastique à 6 degrés de liberté (DoF). Douze paramètres directionnels de raideur et d'amortissement sont identifiés pour chaque sujet grâce à l'algorithme CMA-ES (Covariance Matrix Adaptation Evolution Strategy), en utilisant le retour subjectif "sûr et confortable" de l'utilisateur comme point de fonctionnement reproductible, ce qui permet de lever l'ambiguïté liée au serrage du harnais selon la morphologie de chaque personne. Sur une cohorte de cinq sujets, une analyse par corrélation intraclasse distingue les paramètres transférables d'un individu à l'autre de ceux propres à chaque sujet, produisant un jeu de paramètres a priori. Appliqué à un nouveau sujet non testé auparavant, ce prior ne nécessite plus de recalibrer que 5 des 12 paramètres, contre les 12 habituellement requis.

L'enjeu dépasse la seule prouesse méthodologique: la simulation HITL est présentée comme une alternative nécessaire aux essais physiques, coûteux et risqués, pour valider des robots destinés à une population vieillissante. Or la fidélité de ces simulations dépendait jusqu'ici de paramètres d'impédance réglés à la main plutôt qu'identifiés à partir de données réelles. Les auteurs montrent que des réglages trop souples ou trop rigides échouent systématiquement à reproduire le comportement réel, ce qui confirme qu'aucune procédure heuristique ne permet de trouver de façon fiable le bon point de fonctionnement. Le modèle calibré reproduit l'enveloppe d'interaction réelle et génère des adaptations de démarche biomécaniquement plausibles chez le jumeau numérique humain (Human Digital Twin, HDT).

Ce travail s'inscrit dans la recherche sur les jumeaux numériques humains comme outils prédictifs pour la vérification préclinique de contrôleurs personnalisés, avant tout déploiement sur un patient réel. En réduisant le nombre de paramètres à recalibrer pour un nouvel utilisateur, l'approche ouvre la voie à une adaptation plus rapide des simulateurs à chaque morphologie, une étape jugée nécessaire avant d'envisager des essais cliniques plus larges sur des dispositifs d'assistance à l'équilibre.

À lire aussi

Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot
1arXiv cs.RO 

Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot

Une équipe de chercheurs propose dans un article publié sur arXiv (2606.00459) un contrôleur proportionnel-dérivé (PD) adaptatif capable de limiter l'énergie mécanique d'un robot humanoïde lors d'interactions physiques avec des humains. Le système agit sur les deux composantes énergétiques du robot, énergie cinétique et énergie potentielle, sans nécessiter de capteurs de force externes ni d'estimation de couple articulaire. Les gains du contrôleur sont paramétrables : l'opérateur peut définir précisément le seuil d'énergie limite et la "sharpness", c'est-à-dire la brutalité de la transition entre comportement nominal et comportement contraint. Le contrôleur a été validé sur le robot humanoïde TALOS de PAL Robotics (1,75 m, 95 kg, 32 degrés de liberté), d'abord en simulation, puis sur le hardware réel, confirmant le comportement souple attendu et le respect des limites énergétiques définies. L'intérêt de cette approche réside dans son applicabilité large : la majorité des robots industriels et de service ne disposent pas de capteurs de force six axes ou de couple articulaire, conditions requises par les approches classiques de contrôle d'impédance ou de couple. Un contrôleur basé sur l'énergie, implémentable avec des encodeurs standards et un modèle cinématique, ouvre la voie à une couche de sécurité pHRI sur des plateformes à bas coût ou à architecture fermée. Les auteurs fournissent également une preuve formelle de stabilité avec une condition explicite, ce qui distingue cette contribution des schémas énergétiques antérieurs souvent sans garanties théoriques complètes, un point critique pour toute certification industrielle. PAL Robotics, entreprise barcelonaise spécialisée dans les robots de service et de recherche, fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens, notamment dans le cadre de projets H2020 et Horizon Europe. Le contrôle compliant pour la pHRI est un champ en compétition directe avec les approches à apprentissage par renforcement (RL) et les contrôleurs de type whole-body control (WBC) développés par des équipes comme le DLR, ETH Zurich ou Boston Dynamics. Ce travail s'inscrit dans une tendance plus large visant à sécuriser les humanoïdes sans alourdir leur architecture sensorielle, une contrainte clé pour le déploiement en milieu industriel partagé. La prochaine étape logique serait une validation en scénario de collaboration réelle, avec des humains non prévenus, pour éprouver la robustesse du seuil énergétique face à des contacts imprévus.

UEPAL Robotics (Barcelone) fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens financés par H2020/Horizon Europe ; cette couche de sécurité pHRI sans capteurs de force pourrait être directement intégrée dans les projets de collaboration humain-robot en cours au sein de l'écosystème de recherche européen.

RecherchePaper
1 source
REVOLVE : un cadre automatisé en boucle fermée pour faire évoluer la manipulation robotique avec une intervention humaine minimale
2arXiv cs.RO 

REVOLVE : un cadre automatisé en boucle fermée pour faire évoluer la manipulation robotique avec une intervention humaine minimale

Publié en septembre 2026 sur arXiv (2609.14633v1), REVOLVE (Robot Evolving via Orchestrated Loops, Verification, and Experience) est un framework logiciel qui automatise en boucle fermée l'entraînement de politiques de manipulation robotique. Il combine ARC (Automated Reset and Collection), qui réinitialise seul l'environnement et corrige les échecs de la politique, et DLE (Dual-Loop Evolution), qui réinjecte en continu les données d'échec dans l'entraînement et affine, via une mémoire externe des erreurs, le jugement de l'agent superviseur. Sur quatre tâches de manipulation réelles, après cinq itérations, REVOLVE relève de 18,5% le taux de réussite moyen des politiques et de 8,5% la précision de jugement de l'agent, tout en réduisant l'effort humain de 94,4% en collecte de données et de 95,1% en tests de déploiement. L'enjeu dépasse la prouesse technique : dans la quasi-totalité des déploiements de robots manipulateurs, remettre en état l'environnement et collecter des données correctives après un échec restent des tâches manuelles qui freinent le passage à l'échelle des politiques apprises par imitation ou par renforcement. En automatisant détection d'échec, réinitialisation physique et intégration continue de l'expérience, REVOLVE s'attaque au goulot d'étranglement qui sépare les démonstrations de laboratoire d'un déploiement industriel autonome. Pour les intégrateurs et équipes robotique en entreprise, l'intérêt est un modèle qui s'améliore pendant son exploitation plutôt qu'un système figé après l'entraînement, un argument qui pèse dans le débat sur la capacité réelle des politiques vision-language-action hors des vidéos de démonstration soigneusement sélectionnées. Cette proposition s'inscrit dans une limite connue de la recherche en manipulation robotique : les politiques data-driven progressent en exécution et en généralisation, mais restent dépendantes d'une supervision humaine constante pour corriger les erreurs et remettre les objets en place après chaque essai raté. REVOLVE se présente comme une plateforme logicielle unifiée regroupant collecte, entraînement, déploiement et apprentissage continu dans un seul flux, en alternative aux pipelines où ces étapes restent cloisonnées et dépendantes d'opérateurs. Classé «new» sur arXiv, ce travail reste une contribution de recherche, non un produit commercialisé ni un déploiement industriel confirmé, et l'article ne précise ni la nature des quatre tâches testées ni l'identité des laboratoires impliqués.

RecherchePaper
1 source
GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot
3arXiv cs.RO 

GenPHRI : simulation générative à base d'agents pour l'interaction physique homme-robot

Un laboratoire de robotique universitaire (RCHI Lab) publie GenPHRI, une nouvelle version (arXiv:2604.08664v2, article de remplacement) d'un framework de simulation générative pour l'interaction physique humain-robot, ou pHRI. Le système transforme une simple description en langage naturel en scénario de simulation complet, comprenant une pièce meublée, une pose humaine adaptée à la tâche et un robot exécutant l'interaction demandée. L'architecture s'appuie sur des agents fondés sur des modèles vision-langage : un agent générateur et un agent critique itèrent sur chaque composant de la scène, pendant qu'un agent orchestrateur arbitre les décisions entre les différentes étapes de construction. Les auteurs ont généré 50 scénarios d'assistance distincts sans aucune intervention manuelle, puis déployé deux de ces tâches lors d'une étude impliquant 12 participants humains. Les politiques de vision entraînées sur ces données atteignent un taux de réussite zero-shot d'environ 80% en conditions réelles, contre environ 90% en simulation, avec des comportements jugés cohérents avec les consignes textuelles. Une seconde voie de déploiement, sans entraînement, permet aussi l'exécution directe des trajectoires générées, au prix d'une couverture de contact plus limitée. Le travail cible un goulot d'étranglement concret du secteur : construire des scènes et des mouvements de simulation adaptés à chaque tâche de pHRI reste coûteux et lent, ce qui freine l'entraînement de politiques robotiques capables d'interagir physiquement avec des humains, au delà des tâches de manipulation d'objets classiques. En automatisant entièrement la génération de scénarios à partir de texte, GenPHRI illustre une tendance plus large où des agents VLM remplacent l'ingénierie manuelle de scènes simulées. L'écart mesuré entre performance simulée et performance réelle, dix points de pourcentage, reste toutefois un signal utile à retenir pour quiconque évalue la fiabilité de politiques entraînées uniquement en simulation avant tout déploiement physique auprès d'humains. L'étude reste à ce stade un travail de recherche académique et non un produit commercialisé : la validation s'appuie sur une étude utilisateur restreinte à 12 participants et deux tâches déployées, pas sur un déploiement industriel. Les auteurs publient GenPHRI comme plateforme ouverte pour générer, entraîner et déployer des tâches de pHRI à partir de prompts textuels, avec davantage de détails sur le site du projet associé au laboratoire.

RecherchePaper
1 source
Exploitation de l'expertise humaine pour l'assemblage robotique de précision dans la construction industrialisée : un cadre d'apprentissage par renforcement interactif avec installateur dans la boucle, économe en échantillons
4arXiv cs.RO 

Exploitation de l'expertise humaine pour l'assemblage robotique de précision dans la construction industrialisée : un cadre d'apprentissage par renforcement interactif avec installateur dans la boucle, économe en échantillons

Une équipe de recherche a publié sur arXiv, en septembre 2026, un cadre d'apprentissage par renforcement interactif pour l'assemblage robotique de fenêtres préfabriquées en construction industrialisée (arXiv:2609.13234). Le système combine démonstrations téléopérées hors ligne, reprises en main binaires de l'installateur aux seuls échecs de contact, et récompenses terminales alignées sur les critères d'acceptation, pilotées par une politique d'action séquentielle fondée sur Q-chunking et Flow Q-Learning. Testé dans le simulateur MuJoCo, de la préhension par ventouse jusqu'au positionnement à jeu serré, le pipeline atteint 100% de pose autonome réussie avec 12 à 15 minutes de supervision humaine cumulée sur 3 heures d'entraînement en ligne, pour un jeu de 2 mm par côté avec pose et frottement randomisés. Le seuil de 95% de réussite est atteint en 0,5 puis 1,5 heure selon les deux configurations testées. Ce résultat cible un verrou classique de la robotique de construction: convertir le savoir-faire tacite d'un installateur en autonomie exploitable malgré un retour d'acceptation rare et une forte variabilité de contact. En ramenant à quelques minutes la supervision nécessaire pour approcher une fiabilité totale sur des tolérances millimétriques, l'étude suggère qu'un apprentissage par renforcement guidé par l'humain reste efficace même à récompense très sparse, un enjeu direct pour les intégrateurs visant l'automatisation d'assemblages jugés jusqu'ici trop précis pour la robotique classique. Une réserve s'impose: tous les résultats proviennent de simulation, sans essai sur robot physique ni déploiement réel rapporté, et le transfert sim-to-réel sur un jeu de 2 mm reste l'inconnue principale avant toute application industrielle. La méthode prolonge les travaux récents sur l'apprentissage hors ligne vers en ligne et sur les politiques d'action segmentées (Q-chunking), associées ici à Flow Q-Learning pour capturer des manœuvres de récupération multimodales en cas d'échec de contact, avec une phase de warm-start pour stabiliser la transition. Elle se distingue des approches tout-autonome ou tout-téléopérées en ne sollicitant l'opérateur qu'aux frontières d'échec de contact. L'article ne cite ni partenaire industriel, ni site de déploiement, ni concurrent nommé, ni calendrier de pilote: il s'agit d'une contribution méthodologique validée par ablations isolant les apports de l'abstraction temporelle, de l'intervention humaine et du calibrage du warm-start, sans feuille de route de production précisée.

RecherchePaper
1 source