Optimisation simultanée directe et inverse avec humain dans la boucle
Une équipe de recherche présente sur arXiv (arXiv:2609.22630) une méthode baptisée SFIHILO, pour Simultaneous Forward and Inverse Human-In-the-Loop Optimization, conçue pour déduire les préférences individuelles d'un utilisateur face à un robot et calculer ensuite la politique de contrôle qui maximise ces préférences. Le système commence par construire un modèle direct qui prédit les résultats perçus par l'utilisateur à partir d'une politique de contrôle donnée, puis utilise ce modèle pour choisir activement les questions à poser à l'utilisateur, ce qui accélère l'apprentissage inverse de la fonction de récompense. Une fois cette fonction estimée, la politique finale est optimisée sans nécessiter de nouveaux essais avec l'utilisateur. Les candidats de politique sont classés selon la réduction d'incertitude qu'ils apportent simultanément aux deux modèles, direct et inverse, en ciblant une frontière de préférence régionale. Les tests ont été menés uniquement en simulation, sur des scénarios variant l'hétérogénéité des profils d'utilisateurs, le nombre de dimensions des résultats mesurés, les exigences de précision, les niveaux de bruit et la non-stationnarité des préférences dans le temps.
L'enjeu pratique concerne la robotique d'assistance, exosquelettes, prothèses ou dispositifs de rééducation, où chaque essai de politique de contrôle coûte cher: il faut exécuter la commande, mesurer des résultats biomécaniques ou physiologiques, puis recueillir un retour subjectif, ce qui limite drastiquement le nombre de requêtes possibles avant qu'un système ne s'adapte à un individu. En comparaison avec des stratégies d'apprentissage actif basées sur l'information mutuelle, les auteurs rapportent une meilleure efficacité d'échantillonnage pour l'apprentissage inverse de la récompense, sans dégrader la précision du modèle direct. Si ces résultats se confirment au-delà de la simulation, cela ouvrirait la voie à des robots d'assistance capables de personnaliser leur comportement à un utilisateur donné avec un nombre d'itérations réduit, un facteur limitant connu des approches d'apprentissage par renforcement inverse classiques.
Le travail s'inscrit dans la lignée des méthodes d'inverse reinforcement learning et d'optimisation avec humain dans la boucle, en réponse au coût expérimental élevé des interactions homme-robot réelles. Il reste à ce stade une validation en simulation uniquement, sans expérimentation sur sujets humains ni déploiement matériel: aucune date de test clinique, aucun partenaire industriel ni produit associé n'est mentionné dans les travaux publiés.
Dans nos dossiers




