CrossBFM : distiller un espace latent de comportements partagé entre plusieurs morphologies de robots humanoïdes
CrossBFM, publié sur arXiv (2609.38087), propose de distiller un espace latent de comportements partagé entre plusieurs humanoïdes. Les Behavior Foundation Models (BFM) offrent à un humanoïde une politique pilotable par un simple vecteur latent, qui peut désigner un mouvement à imiter, une pose à atteindre ou une récompense à maximiser. Les représentations Forward-Backward produisent bien de tels espaces, mais elles demandent des centaines d'heures GPU pour un seul robot. Entraînées pour un second robot, elles génèrent un espace distinct, sans lien avec le premier. CrossBFM utilise le retargeting, qui fournit une correspondance image par image entre morphologies, pour entraîner un encodeur unifié sans paramètre propre à un robot. Cet encodeur distille l'espace en moins d'une heure GPU pour tous les robots d'entraînement à la fois. Des contrôleurs conditionnés par le latent, entraînés en PPO classique, ajoutent environ 10 heures GPU. Sur trois humanoïdes, les trois modes de prompt fonctionnent. Le suivi de mouvement perd seulement 0,025 rad par rapport à une politique conditionnée directement sur les articulations. L'atteinte de poses se fait sans chute, et les 41 prompts de récompense testés sont tous optimisés.
Pour l'industrie, le résultat déplace le coût du problème. Au lieu de refaire un entraînement de plusieurs centaines d'heures GPU pour chaque nouvelle plateforme, l'espace de comportements devient un actif réutilisable, et le passage à un nouveau robot ne coûte plus qu'une distillation légère et un entraînement de tracker. Pour un intégrateur ou un fabricant qui décline plusieurs modèles d'humanoïdes, c'est un argument économique direct. Deux résultats d'ablation nuancent la portée. Entraîner l'encodeur sur un quart seulement du corpus de mouvements ne coûte que 5 % de performance de suivi. Sur un robot jamais vu à l'entraînement, l'encodeur récupère jusqu'à 89 % de la performance des robots vus. Ce transfert reste toutefois limité aux morphologies proches, et « jusqu'à » désigne le meilleur cas, pas une moyenne. Les auteurs affirment aussi avoir validé la chaîne sur des robots réels pour les trois modes de prompt, y compris avec des latents générés par modèle à flux. L'article ne détaille pas ici la nature des robots ni l'ampleur de ces essais.
Ces travaux s'inscrivent dans la lignée des modèles de comportement fondés sur les représentations Forward-Backward, dont le principal frein était le coût d'entraînement propre à chaque robot. Ils se distinguent des approches de politiques généralistes de type VLA, qui visent le langage et la vision plutôt qu'un espace de contrôle bas niveau partagé. Il s'agit d'une préimpression non relue par des pairs, et le site du projet est dotdandung.github.io/crossbfm. Les prochaines étapes à surveiller sont l'extension à des morphologies plus éloignées, l'ampleur des tests sur matériel réel et une éventuelle adoption par les constructeurs d'humanoïdes.
Dans nos dossiers




