BlenDAgger : contrôle partagé par mélange pour l'apprentissage par imitation interactif
Des chercheurs proposent Blended DAgger (BlenDAgger), une méthode de collecte de données pour l'apprentissage par imitation, décrite dans un preprint arXiv. Lors des interventions humaines, le système ne laisse pas l'opérateur prendre le contrôle total du robot. Il mélange en continu les actions de la politique et celles du démonstrateur, selon un principe de contrôle partagé. La méthode a été testée sur cinq tâches de manipulation, deux en conditions réelles et trois en simulation. Sur les deux tâches réelles, la politique finale atteint une performance autonome supérieure d'au moins 30 points de pourcentage à celle obtenue avec HG-DAgger, la référence où l'humain reprend la main de façon binaire. Les transitions entre politique et intervention humaine sont 57 % plus fluides, et les trajectoires corrigées sont 14 % plus proches des données d'entraînement. Une étude utilisateur (n=14) sur les deux tâches réelles montre une collecte plus rapide (facteur de Bayes de 13,32), sans différence perçue subjectivement par les opérateurs.
L'enjeu est le coût de la donnée corrective, principal goulot d'étranglement des politiques de manipulation entraînées par imitation. La téléopération complète pour corriger un robot est fatigante, et les démonstrations humaines sont rarement optimales. Un opérateur qui ne fait que guider la politique produit des données plus cohérentes avec sa distribution. Cela réduit le décalage entre ce que le robot sait faire et ce qu'on lui enseigne, et pourrait diminuer le temps opérateur nécessaire pour affiner une politique, un poste de coût réel pour les intégrateurs. Les résultats restent toutefois ceux d'un laboratoire. Le résumé ne précise ni les tâches, ni le robot, ni les taux de réussite absolus, ni le nombre de démonstrations. Un écart de 30 points peut donc partir d'une base basse. L'échantillon de 14 participants reste modeste.
Cette approche s'inscrit dans la lignée de DAgger (2011) et de HG-DAgger (2019), qui ont popularisé l'apprentissage par imitation interactif. Elle rejoint la vague actuelle du fine-tuning de politiques généralistes à partir de corrections humaines, comme les VLA de type Pi-0 ou GR00T. Le preprint n'annonce ni code, ni déploiement industriel, ni calendrier. Aucun acteur français ou européen n'est cité dans le résumé. La suite dépendra d'une validation sur d'autres robots, d'autres tâches et de plus gros modèles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




