Bi-MoDe : apprentissage par imitation à contrôle bilatéral via décodage conditionné par modificateur pour moduler vitesse d'exécution et intensité de contact
Bi-MoDe (Bilateral Control-based Imitation Learning via Modifier-Conditioned Decoding) est un nouveau framework de recherche en robotique décrit dans une publication arXiv (2609.16040v1, mise en ligne mi-septembre 2026, texte intégral et matériel additionnel disponibles sur mertcookimg.github.io/bi-mode). Il s'appuie sur l'apprentissage par imitation à contrôle bilatéral, une méthode qui capture simultanément la position et la force appliquée pendant une démonstration, ce qui la rend adaptée à des tâches de manipulation impliquant un contact physique soutenu avec l'environnement. La contribution technique consiste à injecter un latent contraint dans chaque couche du décodeur Transformer générant les actions, via une technique de conditionnement appelée adaLN-Zero, afin qu'un opérateur puisse spécifier au moment de l'exécution comment une tâche apprise doit être réalisée, par exemple rapidement ou lentement, avec douceur ou fermeté. Les chercheurs ont testé la méthode sur une tâche réelle unique, l'essuyage d'un tableau blanc, en combinant des modificateurs temporels (vitesse) et physiques (intensité du contact).
L'enjeu dépasse la simple démonstration technique : la plupart des politiques d'imitation actuelles produisent un comportement figé, calé sur les démonstrations d'entraînement, sans possibilité de moduler finement la force ou le rythme sans réentraîner le modèle. Pour des intégrateurs industriels manipulant des pièces fragiles ou des opérations à cadence variable, pouvoir ajuster l'intensité de contact à la volée serait un vrai gain d'exploitabilité. Les résultats indiquent une amélioration du respect des consignes physiques par rapport à une base de référence par action-chunking, avec un contrôle temporel comparable, et une étude d'ablation montre que le conditionnement du décodeur et la composition dans l'espace latent doivent être combinés pour obtenir cette précision.
Le travail s'inscrit dans la lignée du contrôle bilatéral, technique de téléopération historiquement utilisée pour transmettre le retour de force dans l'apprentissage par imitation, un axe de recherche distinct des approches VLA généralistes comme GR00T N2 ou Pi-0. Il s'agit toutefois d'un preprint arXiv non encore évalué par les pairs, validé sur une seule tâche en laboratoire, sans acteur industriel ni feuille de route de déploiement annoncée à ce stade.
Dans nos dossiers




