Aller au contenu principal
RecherchearXiv cs.RO 

Optimisation simultanée directe et inverse avec humain dans la boucle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente sur arXiv (arXiv:2609.22630) une méthode baptisée SFIHILO, pour Simultaneous Forward and Inverse Human-In-the-Loop Optimization, conçue pour déduire les préférences individuelles d'un utilisateur face à un robot et calculer ensuite la politique de contrôle qui maximise ces préférences. Le système commence par construire un modèle direct qui prédit les résultats perçus par l'utilisateur à partir d'une politique de contrôle donnée, puis utilise ce modèle pour choisir activement les questions à poser à l'utilisateur, ce qui accélère l'apprentissage inverse de la fonction de récompense. Une fois cette fonction estimée, la politique finale est optimisée sans nécessiter de nouveaux essais avec l'utilisateur. Les candidats de politique sont classés selon la réduction d'incertitude qu'ils apportent simultanément aux deux modèles, direct et inverse, en ciblant une frontière de préférence régionale. Les tests ont été menés uniquement en simulation, sur des scénarios variant l'hétérogénéité des profils d'utilisateurs, le nombre de dimensions des résultats mesurés, les exigences de précision, les niveaux de bruit et la non-stationnarité des préférences dans le temps.

L'enjeu pratique concerne la robotique d'assistance, exosquelettes, prothèses ou dispositifs de rééducation, où chaque essai de politique de contrôle coûte cher: il faut exécuter la commande, mesurer des résultats biomécaniques ou physiologiques, puis recueillir un retour subjectif, ce qui limite drastiquement le nombre de requêtes possibles avant qu'un système ne s'adapte à un individu. En comparaison avec des stratégies d'apprentissage actif basées sur l'information mutuelle, les auteurs rapportent une meilleure efficacité d'échantillonnage pour l'apprentissage inverse de la récompense, sans dégrader la précision du modèle direct. Si ces résultats se confirment au-delà de la simulation, cela ouvrirait la voie à des robots d'assistance capables de personnaliser leur comportement à un utilisateur donné avec un nombre d'itérations réduit, un facteur limitant connu des approches d'apprentissage par renforcement inverse classiques.

Le travail s'inscrit dans la lignée des méthodes d'inverse reinforcement learning et d'optimisation avec humain dans la boucle, en réponse au coût expérimental élevé des interactions homme-robot réelles. Il reste à ce stade une validation en simulation uniquement, sans expérimentation sur sujets humains ni déploiement matériel: aucune date de test clinique, aucun partenaire industriel ni produit associé n'est mentionné dans les travaux publiés.

Dans nos dossiers

À lire aussi

HITL-D : contrôle partagé assisté par diffusion avec humain dans la boucle
1arXiv cs.RO 

HITL-D : contrôle partagé assisté par diffusion avec humain dans la boucle

HITL-D (Human-In-The-Loop Diffusion) est un framework de contrôle partagé pour la téléopération robotique, présenté dans un preprint arXiv (2605.21460) non encore évalué par des pairs. Le système combine une politique de diffusion apprise avec le contrôle humain classique : l'opérateur pilote le robot via joystick pour les déplacements en position cartésienne, tandis que le système prend en charge automatiquement l'orientation de l'effecteur terminal. Cette orientation autonome est conditionnée en temps réel par un nuage de points 3D de la scène et la position courante de l'effecteur. Résultat : le nombre d'axes de contrôle que l'opérateur doit gérer simultanément diminue, réduisant mécaniquement la charge cognitive. Une étude utilisateur menée sur 12 participants dans des tâches multi-étapes, d'insertion et de manipulation fine démontre une réduction de 40 % du temps d'exécution des tâches, une baisse de 37 % de la charge mentale perçue, et des scores Likert supérieurs pour l'indépendance, l'intuitivité et la confiance, comparés à une téléopération classique sans assistance. Ces résultats adressent un problème central du déploiement industriel : la pleine autonomie robotique reste fragile sur les tâches d'assemblage précis (insertion, ajustement fin), tandis que la téléopération pure est coûteuse en ressources humaines et génère de la fatigue opérateur. HITL-D occupe ce no man's land en déléguant sélectivement les degrés de liberté les moins intuitifs à la politique apprise. L'approche par diffusion conditionnée sur nuage de points est techniquement notable : contrairement à un lissage de trajectoire, elle intègre une représentation géométrique de l'environnement pour générer une assistance contextuelle. Il faut toutefois relativiser : 12 participants constituent un échantillon limité, et l'abstract ne précise ni la complexité exacte des scènes testées, ni si les expériences ont été conduites sur robot réel ou en simulation. Le travail s'inscrit dans la continuité directe des Diffusion Policies (Chi et al., Columbia, 2023), devenues un paradigme dominant en manipulation robotique apprise. Le contrôle partagé et la "sliding autonomy" sont des concepts étudiés depuis les années 2000 (notamment en robotique médicale et spatiale), mais leur combinaison avec des politiques génératives modernes reste peu explorée. Face aux approches VLA full-autonomy comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les modèles dérivés de RT-2, HITL-D ne cherche pas à remplacer l'humain mais à l'augmenter, ce qui le positionne sur un marché différent : téléopération industrielle assistée, chirurgie robotique, déminage. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné dans le preprint ; l'étape suivante naturelle serait une validation sur tâches réelles à plus grande échelle et avec des opérateurs non experts.

RecherchePaper
1 source
EvoHIL : optimisation évolutive de la récompense et de la politique par flow matching pour l'apprentissage par renforcement robuste avec humain dans la boucle
2arXiv cs.RO 

EvoHIL : optimisation évolutive de la récompense et de la politique par flow matching pour l'apprentissage par renforcement robuste avec humain dans la boucle

Une équipe de recherche vient de publier sur arXiv (2608.03872, début août 2026) EvoHIL, un framework d'apprentissage par renforcement avec humain dans la boucle (HIL-RL) pour la manipulation robotique riche en contacts. Le système combine trois mécanismes : une récompense auto-évolutive (SER) qui met à jour le classificateur de succès à partir d'exemples positifs validés par un humain et de négatifs faibles provisoires ; une stabilisation de flux d'actions (AFS), qui génère des séquences temporellement cohérentes via flow matching en s'appuyant sur les préfixes d'actions déjà exécutés et les démonstrations ; et un fine-tuning hors ligne dit « rétention-aware », qui rejoue des données d'interaction rééclairées tout en ancrant l'acteur-critique AFS au comportement antérieur, sans interaction robotique supplémentaire. Les auteurs ont testé EvoHIL sur six tâches de manipulation, sur des bras Franka FR3 et SO-101, sous un changement contrôlé d'éclairage. Comparé aux méthodes HIL-RL classiques et à l'imitation learning, EvoHIL améliore le taux de réussite, l'accord avec les labels de confirmation humaine, la fluidité du mouvement et le temps de complétion. L'intérêt tient à la façon dont le papier attaque trois faiblesses couplées qui plombent le HIL-RL en conditions réelles : un modèle de récompense visuel statique qui s'effondre dès que la scène change, des actions échantillonnées indépendamment qui produisent des mouvements saccadés, et des politiques vision-based fragiles face aux changements d'apparence. C'est exactement ce type de fragilité qui sépare les démonstrations de labo des déploiements industriels, où l'éclairage, le fond ou la position des objets varient en permanence. En montrant qu'un reward model, un générateur d'actions et un domaine visuel peuvent être adaptés conjointement plutôt que séparément, EvoHIL nourrit le débat sur la viabilité des politiques VLA à l'échelle, une question centrale pour tout intégrateur cherchant à sortir un bras collaboratif ou un humanoïde des conditions contrôlées d'une démo. Le travail s'inscrit dans la lignée des recherches récentes sur le flow matching appliqué aux politiques robotiques, une approche popularisée par des modèles comme Pi-0 ou GR00T N2 pour produire des trajectoires plus fluides que les méthodes de diffusion classiques. Il s'agit toutefois d'un article académique soumis en double-aveugle, avec une page projet hébergée sous un identifiant anonyme et sans affiliation d'entreprise ni de laboratoire revendiquée à ce stade, ni déploiement industriel annoncé. Les essais se limitent à deux plateformes de bras manipulateurs en environnement contrôlé, loin des volumes d'un déploiement commercial. La suite logique, si les résultats tiennent lors de la publication définitive, serait une extension à davantage de tâches, de plateformes et de variations environnementales pour confirmer la robustesse au-delà du simple changement d'éclairage testé ici.

RecherchePaper
1 source
Au-delà des heuristiques : un pipeline Real2Sim standardisé pour l'interaction physique homme-robot en simulation avec humain dans la boucle
3arXiv cs.RO 

Au-delà des heuristiques : un pipeline Real2Sim standardisé pour l'interaction physique homme-robot en simulation avec humain dans la boucle

Une équipe de recherche présente un pipeline Real2Sim destiné à améliorer la fidélité des simulations Human-in-the-Loop (HITL) utilisées pour tester des robots d'assistance physique. Le système cible l'interface pelvis-sangle d'un assistant mobile à l'équilibre porté au-dessus du sol, modélisée comme un mécanisme viscoélastique à 6 degrés de liberté (DoF). Douze paramètres directionnels de raideur et d'amortissement sont identifiés pour chaque sujet grâce à l'algorithme CMA-ES (Covariance Matrix Adaptation Evolution Strategy), en utilisant le retour subjectif "sûr et confortable" de l'utilisateur comme point de fonctionnement reproductible, ce qui permet de lever l'ambiguïté liée au serrage du harnais selon la morphologie de chaque personne. Sur une cohorte de cinq sujets, une analyse par corrélation intraclasse distingue les paramètres transférables d'un individu à l'autre de ceux propres à chaque sujet, produisant un jeu de paramètres a priori. Appliqué à un nouveau sujet non testé auparavant, ce prior ne nécessite plus de recalibrer que 5 des 12 paramètres, contre les 12 habituellement requis. L'enjeu dépasse la seule prouesse méthodologique: la simulation HITL est présentée comme une alternative nécessaire aux essais physiques, coûteux et risqués, pour valider des robots destinés à une population vieillissante. Or la fidélité de ces simulations dépendait jusqu'ici de paramètres d'impédance réglés à la main plutôt qu'identifiés à partir de données réelles. Les auteurs montrent que des réglages trop souples ou trop rigides échouent systématiquement à reproduire le comportement réel, ce qui confirme qu'aucune procédure heuristique ne permet de trouver de façon fiable le bon point de fonctionnement. Le modèle calibré reproduit l'enveloppe d'interaction réelle et génère des adaptations de démarche biomécaniquement plausibles chez le jumeau numérique humain (Human Digital Twin, HDT). Ce travail s'inscrit dans la recherche sur les jumeaux numériques humains comme outils prédictifs pour la vérification préclinique de contrôleurs personnalisés, avant tout déploiement sur un patient réel. En réduisant le nombre de paramètres à recalibrer pour un nouvel utilisateur, l'approche ouvre la voie à une adaptation plus rapide des simulateurs à chaque morphologie, une étape jugée nécessaire avant d'envisager des essais cliniques plus larges sur des dispositifs d'assistance à l'équilibre.

RecherchePaper
1 source
COSMIC : optimisation simultanée de la structure, des matériaux et du contrôle intégré pour les systèmes robotiques
4arXiv cs.RO 

COSMIC : optimisation simultanée de la structure, des matériaux et du contrôle intégré pour les systèmes robotiques

Des chercheurs ont publié sur arXiv (référence 2605.12654, mai 2026) COSMIC, un framework de co-conception par descente de gradient pour robots à treillis structurel (truss-lattice) qui optimise simultanément la topologie, la distribution des matériaux et la politique de contrôle. Contrairement aux approches classiques où structure, matériaux et contrôle sont conçus séquentiellement par des équipes distinctes, COSMIC intègre un contrôleur neuronal directement dans un simulateur différentiable, permettant le calcul automatique des gradients à travers l'ensemble du pipeline de conception. Les variables topologiques et matérielles, de nature mixte (discrètes et continues), sont encodées dans un espace continu, et une optimisation sous contraintes navigue un paysage de solutions hautement non-convexe. Les études de cas démontrent que le framework découvre systématiquement des stratégies de locomotion plus performantes que les approches à conception séparée, tout en s'adaptant à différentes conditions aux limites et exigences fonctionnelles. L'enjeu est fondamental : la quasi-totalité des systèmes robotiques actuels, des bras industriels aux humanoïdes, souffrent d'un déficit de co-conception hérité de la séparation des disciplines mécaniques, matériaux et contrôle. COSMIC s'attaque directement à ce que les biologistes observent depuis des décennies : dans la nature, morphologie et contrôle co-évoluent, et cette interaction produit des solutions inaccessibles à l'optimisation séparée. Pour les équipes R&D, l'approche par différentiation automatique ouvre la voie à des boucles de conception automatisées plutôt que manuelles, réduisant potentiellement les itérations de prototypage. La flexibilité annoncée vis-à-vis des conditions fonctionnelles suggère une applicabilité au-delà de la locomotion (reconfiguration, manipulation), mais ces affirmations restent à ce stade limitées à des validations en simulation. La co-conception robotique est un domaine actif depuis plusieurs années, avec des approches concurrentes issues de la robotique évolutionnaire (travaux de Josh Bongard, NEAT morphologique) et des frameworks différentiables comme DiffTaichi ou Brax de Google DeepMind. COSMIC se distingue par l'intégration simultanée des trois entités dans un cadre gradient unifié, là où la plupart des travaux existants n'en co-optimisent que deux. La lacune critique du papier est l'absence de validation hardware : les robots truss-lattice sont réputés difficiles à fabriquer et à contrôler physiquement, et le gap sim-to-real constitue l'obstacle majeur avant toute application industrielle. Les prochaines étapes annoncées concernent des comportements autonomes complexes, sans timeline ni partenaire industriel mentionnés.

RecherchePaper
1 source