
CLAM : modèles d'action latente continue pour l'apprentissage robotique à partir de démonstrations non étiquetées
Un nouveau papier arXiv (2505.04999v2, version révisée) présente CLAM, pour Continuous Latent Action Models, une méthode d'apprentissage de politiques de contrôle robotique qui se passe des démonstrations à actions étiquetées, coûteuses à collecter en téléopération. Le principe : à partir de simples séquences d'observations (sans étiquette d'action), un modèle infère des actions latentes continues entre deux images consécutives via une prédiction de dynamique auto-supervisée. Pour transformer ces actions latentes en commandes moteur réellement exécutables, les chercheurs entraînent conjointement un décodeur d'actions sur un petit volume de données dites "de jeu" (play data), c'est-à-dire des interactions non ciblées sur une tâche précise mais qui, elles, comportent des actions étiquetées. Les tests couvrent la locomotion sur DMControl, la manipulation sur MetaWorld, et des tâches réelles sur un bras robotique WidowX. Résultat annoncé : un taux de réussite moyen multiplié par 2 à 3 par rapport aux précédentes méthodes à actions latentes, avec des performances qui se rapprochent du behavior cloning entraîné sur des actions expertes complètes, la référence "privilégiée" du domaine.
L'enjeu dépasse la seule performance technique : le goulot d'étranglement de l'apprentissage par imitation reste la collecte de démonstrations étiquetées, un processus lent et onéreux en téléopération. Si des politiques efficaces peuvent être apprises depuis de simples vidéos ou séquences d'observations, cela ouvre la voie à des jeux de données bien plus larges et moins chers à constituer, en combinant une masse de démonstrations non étiquetées avec un minimum de données annotées. Il faut toutefois noter que la validation reste majoritairement en simulation, avec un unique bras WidowX pour la partie matérielle réelle : il s'agit d'une preuve de concept académique, pas d'un déploiement industriel à l'échelle.
CLAM s'inscrit dans la lignée des travaux sur les modèles d'action latente et de monde pour la robotique, qu'il cherche explicitement à surpasser en tant que base de comparaison. Il se distingue de l'approche dominante des modèles vision-langage-action comme Pi-0 ou GR00T N2, qui reposent sur de vastes corpus d'actions étiquetées. Code et vidéos sont publiés sur clamrobot.github.io, laissant la porte ouverte à des reproductions et extensions par la communauté.
Dans nos dossiers




