L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique
Un benchmark publié sur arXiv (2610.00542v1) s'attaque à une question que les évaluations classiques d'apprentissage par imitation continu laissent de côté : un robot qui conserve ses anciennes compétences reste-t-il réellement guidé par le langage ? Les auteurs construisent un protocole fondé sur LIBERO, avec des variantes d'instructions qui préservent le sens (paraphrases) et d'autres qui le modifient, pour les quatre suites Goal, Spatial, Object et Long. Les expériences de politiques portent surtout sur LIBERO-Goal. Les politiques y sont évaluées après chaque étape d'apprentissage séquentiel, avec les instructions originales puis paraphrasées. Plusieurs méthodes représentatives d'imitation continue sont comparées dans leurs hypothèses d'origine. Trois diagnostics complètent les métriques habituelles d'apprentissage et d'oubli : la robustesse sémantique, l'adaptation à l'objectif et la sensibilité au langage. Le matériel complémentaire est publié sur une page projet intitulée « stillgrounded ».
Le résultat principal tient en une phrase : de bonnes performances en apprentissage continu ne garantissent pas un ancrage langagier fiable. Une politique peut afficher un taux de réussite élevé sans avoir conservé le lien entre l'instruction et l'action. Elle peut s'appuyer sur des indices de scène, des associations d'objets ou une structure de tâche mémorisée. Pour les intégrateurs et les responsables techniques qui envisagent des robots pilotés par VLA (vision-language-action) et mis à jour en continu, le point est concret. Un robot qui exécute correctement « ses » tâches en conditions de test peut échouer ou agir de façon incohérente si la consigne est reformulée ou modifiée. Cela relativise aussi les scores de benchmark en rétention de tâches, qui peuvent surestimer la fiabilité réelle d'une compétence retenue. Ces diagnostics permettent de distinguer une compétence conservée et correctement guidée d'une compétence conservée par simple mémorisation du contexte. Il s'agit d'un travail académique en simulation : aucun chiffre de performance n'est donné dans le résumé, et la portée des conclusions reste à vérifier dans le détail des expériences, qui se concentrent sur une seule suite.
Ce travail s'inscrit dans le prolongement de LIBERO, benchmark de référence pour l'apprentissage tout au long de la vie en manipulation robotique, devenu terrain d'essai courant pour les politiques conditionnées par le langage. La question de l'ancrage rejoint des critiques déjà formulées sur les modèles VLA, soupçonnés d'ignorer partiellement le texte au profit de régularités visuelles. Aucun acteur industriel n'est directement concerné : il s'agit d'un outil d'évaluation, pas d'un produit. Sa valeur dépendra de son adoption par les équipes qui développent des politiques généralistes et des méthodes d'apprentissage continu. La suite logique serait son extension aux autres suites de LIBERO, puis à des politiques de grande taille et à des données réelles, seules capables de montrer si l'écart entre rétention et ancrage se retrouve hors simulation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




