
Acquisition autonome de compétences de manipulation robotique par diversité-qualité guidée par le langage
Des chercheurs publient le 30 aout 2026 sur arXiv (2608.30983) une méthode d'apprentissage de manipulation robotique combinant algorithmes de quality-diversity (QD) et grands modèles de langage, a partir d'une simple description de la tache en langage naturel. Le système n'exige plus qu'un expert écrive a la main les fonctions de fitness et de diversité : un LLM explore un espace réduit de fonctionnels pour générer lui-même ces métriques, sans prompt spécifique ni fine-tuning. Les chercheurs adaptent pour cela une variante multi-descripteurs de l'algorithme MAP-Elites, nommée MES. Teste dans le simulateur Genesis sur quatre taches de manipulation, le système produit des archives de primitives de mouvement plus diversifiées que les méthodes QD classiques a paramétrage manuel ou infère.
Pour les intégrateurs et les laboratoires de robotique, l'enjeu est le goulot d'étranglement des bibliothèques de primitives de mouvement, dont la construction exige aujourd'hui qu'un ingénieur code a la main un critère de succès différent pour chaque nouvelle tache. Contrairement aux techniques de reward-shaping par LLM, qui n'apprennent qu'une seule politique performante, cette méthode produit un répertoire entier de comportements varies, ce qui permettrait a un robot de s'adapter zero-shot a des contraintes rencontrées au déploiement, comme un obstacle ou une contrainte d'espace inédite, sans reentrainement. C'est un argument de plus en faveur de l'usage des LLM pour automatiser l'ingénierie de récompense en robotique par apprentissage, au-delà de la simple génération d'une politique rigide et unique.
Les algorithmes de quality-diversity, popularises par MAP-Elites, sont utilises depuis plusieurs années en robotique pour construire des répertoires de comportements plutôt qu'une seule solution optimale, notamment pour la marche adaptative ou la manipulation robuste aux pannes. Leur limite restait la dépendance a des métriques de fitness et de diversité écrites par des experts, un frein a l'autonomie complète du robot, que les approches de reward-shaping par LLM contournaient au prix d'une sortie unique et peu adaptable. Le travail, publie en preprint sur arXiv le 30 aout 2026, n'a été valide qu'en simulation, sur quatre taches de manipulation dans Genesis, sans transfert démontre sur robot physique ni calendrier de déploiement industriel annonce.
Dans nos dossiers




