CLAP : les modèles du monde vidéo à embodiment croisé, des simulateurs physiques sans apprentissage spécifique
Une nouvelle prépublication arXiv décrit CLAP, un framework de génération vidéo conditionnée par l'action capable d'apprendre simultanément sur des vidéos humaines et robotiques hétérogènes à l'échelle d'internet, plutôt que de rester cantonné à une seule plateforme comme la plupart des modèles existants. Il unifie les espaces d'action, incompatibles entre robots et absents des vidéos humaines, via trois représentations combinées : poses de l'effecteur terminal, instructions en langage naturel et actions latentes apprises automatiquement. L'entraînement suit un curriculum en deux temps, acquérant d'abord des a priori physiques génériques sur des vidéos non annotées avant de les ancrer dans l'espace des poses d'effecteur pour un déploiement zero-shot sur des tâches réelles. Sur le benchmark DROID, CLAP égale voire dépasse les modèles vidéo spécialisés à une seule plateforme, et a aussi été évalué sur Bridge, des robots bimanuels YAM et des humanoïdes G1 ; code et modèles sont publiés en open source sur omni-clap.github.io.
L'enjeu dépasse la performance sur un benchmark : la plupart des modèles vidéo servant de simulateurs physiques pour entraîner ou évaluer des politiques robotiques restent liés à une seule plateforme, obligeant à recollecter des données coûteuses à chaque nouveau robot. En montrant qu'un modèle entraîné sur un corpus mixte humains et robots peut égaler des modèles spécialisés puis les dépasser via un fine-tuning few-shot, CLAP esquisse un paradigme où un modèle de monde générique s'adapte à moindre coût à chaque nouvel embodiment, un argument pertinent pour les intégrateurs qui multiplient bras bimanuels et humanoïdes. La promesse d'un simulateur physique « zero-shot » reste néanmoins à nuancer, les résultats portant sur des benchmarks académiques contrôlés plutôt que sur un déploiement industriel.
Ce travail s'inscrit dans la multiplication des modèles de monde vidéo appliqués à la robotique, où la génération vidéo sert de plus en plus de proxy de simulation pour entraîner des politiques d'action sans multiplier les essais réels, un usage jusque-là limité par l'incompatibilité des espaces d'action et par l'absence de labels dans les vidéos humaines, qui composent pourtant l'essentiel des données disponibles à l'échelle d'internet. Les bancs d'essai (DROID, Bridge) et plateformes testées (bras bimanuels YAM, humanoïde G1) sont des références standard de la recherche en apprentissage robotique, ce qui situe CLAP comme un travail académique plutôt qu'un produit commercial. Les auteurs, qui publient l'ensemble du code et des modèles, présentent le fine-tuning few-shot comme la piste principale pour étendre ce paradigme à de nouvelles plateformes, sans calendrier de déploiement industriel annoncé.
Dans nos dossiers




