Imitation générative antagoniste à partir d'observations, fondée sur l'expérience et la faisabilité, malgré des morphologies différentes
Des chercheurs proposent EF-GAIfO (Experience-Based Feasibility-Aware Generative Adversarial Imitation from Observation), une méthode d'apprentissage par imitation à partir d'observations, publiée sur arXiv sous la référence 2610.01171. Elle apprend à un robot à partir de trajectoires d'états sans étiquettes d'actions, comme celles que fournissent les interfaces de démonstration sans robot. Son principe est d'estimer la faisabilité de chaque démonstration humaine à partir de l'expérience propre du robot. Elle ne s'appuie ni sur un modèle dynamique explicite, ni sur un grand jeu de données d'exploration préalable. La zone jugée faisable n'est pas figée: elle s'élargit à mesure que la politique progresse et que le robot rencontre des transitions d'état plus variées, ce qui permet d'intégrer peu à peu des démonstrations d'abord écartées. La validation porte sur une tâche de locomotion en simulation et sur un robot quadrupède réel, qui doit atteindre et saisir un objet. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni modèle de robot, ni comparaison chiffrée avec d'autres méthodes.
L'enjeu est un problème que connaissent bien les équipes qui collectent des démonstrations humaines pour entraîner des robots: l'écart d'incarnation. Un humain et un robot n'ont ni la même morphologie ni la même dynamique. Une partie des mouvements démontrés est donc physiquement irréalisable pour la machine, et les imiter à l'aveugle peut dégrader la politique apprise. Les critères de faisabilité employés jusqu'ici sont souvent conçus à la main, ou exigent un modèle de dynamique ou de vastes données d'exploration, ce qui pèse sur le coût de déploiement. Un critère qui évolue avec l'apprentissage pourrait réduire cette ingénierie. Il serait aussi utile pour les approches qui exploitent des vidéos ou des gants de capture, où les actions ne sont pas annotées. Il faut toutefois rester prudent: il s'agit d'un préprint à la première version, non évalué par des pairs. La preuve sur matériel se limite apparemment à une seule tâche sur un quadrupède, loin de la manipulation dextre d'un humanoïde. Rien n'indique que la méthode passe à l'échelle de tâches longues ou de plateformes à nombreux degrés de liberté.
Le travail s'inscrit dans la lignée de l'apprentissage antagoniste génératif par imitation (GAIL), décliné en version sans actions (GAIfO), qui entraîne un discriminateur à distinguer les transitions d'états de l'expert de celles de la politique. Sa limite connue est de supposer que toutes les démonstrations sont atteignables. La tendance actuelle, portée par les modèles vision-langage-action (VLA) et par les données de téléopération, laisse ouverte la question de l'exploitation de vidéos humaines pour des robots d'autre forme. Les suites naturelles sont des tests sur davantage de tâches, sur des humanoïdes et face à des méthodes de référence, avec des chiffres publiés. Aucun pilote industriel ni calendrier n'est annoncé à ce stade.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



