
ACDC : planification de curriculum adaptatif avec contrôle contrastif dynamique pour l'apprentissage par renforcement conditionné par objectifs en manipulation robotique
Des chercheurs proposent ACDC (Adaptive Curriculum planning with Dynamic Contrastive control), une nouvelle méthode d'apprentissage par renforcement conditionné par objectif (goal-conditioned RL) pour la manipulation robotique, dans une version mise à jour (v3) d'un article déposé sur arXiv. Le système combine deux mécanismes. D'un côté, un planificateur de curriculum adaptatif multidimensionnel (AC) qui ajuste dynamiquement l'équilibre entre exploration diversifiée et exploitation ciblée, en fonction du taux de réussite de l'agent et de sa progression d'entraînement. De l'autre, un module de contrôle contrastif dynamique (DC) qui traduit ce plan de curriculum en sélection d'expériences guidée par la norme, via un apprentissage contrastif contraint. Les auteurs annoncent des résultats supérieurs aux méthodes de référence de l'état de l'art sur plusieurs tâches de manipulation robotique complexes, tant en efficacité d'échantillonnage qu'en taux de réussite final. L'article ne précise ni les environnements de test exacts, ni les valeurs chiffrées des gains obtenus, ni le laboratoire ou l'affiliation des auteurs.
Pour la recherche en robotique, ACDC s'attaque à une limite connue des approches actuelles de goal-conditioned RL : leur dépendance à des schémas de priorisation de l'expérience collectée, souvent statiques, qui produisent des performances inégales selon la diversité des tâches. En rapprochant la stratégie d'apprentissage du curriculum progressif observé chez l'humain, plutôt que d'un simple rejeu d'expérience priorisé, l'approche vise une meilleure généralisation entre tâches de manipulation, un enjeu clé pour les intégrateurs qui cherchent à réduire le volume de données nécessaire à l'entraînement de politiques robotiques.
Le travail s'inscrit dans une lignée de recherches combinant curriculum learning et contrastive learning pour améliorer l'efficacité d'échantillonnage en RL, un axe actif depuis les méthodes de hindsight expérience replay. Le statut "replace" sur arXiv indique une révision par rapport à une version antérieure, sans qu'on sache si l'article a été accepté dans une conférence ou une revue à comité de lecture. Aucune suite (code source, benchmark public, application industrielle) n'est mentionnée à ce stade.
Dans nos dossiers




