BAT : concilier agilité et stabilité par commutation de politiques en ligne pour le contrôle du corps entier d'un robot humanoïde sur de longs horizons
Des chercheurs proposent BAT, un cadre de commutation de politiques en ligne pour le contrôle du corps entier d'humanoïdes sur de longs enchaînements de mouvements. Le travail, publié sur arXiv (2604.01064, version 2), part d'un constat : les approches existantes suivent deux paradigmes. Les politiques couplées coordonnent tout le corps de façon globale, tandis que les politiques découplées traitent chaque module séparément pour gagner en précision. BAT choisit dynamiquement entre deux contrôleurs généralistes entraînés par apprentissage par renforcement, l'un couplé et l'autre découplé, selon le contexte du mouvement en cours. Deux prédicteurs de commutation travaillent en parallèle. OpVQ-VAE s'appuie sur des « tokens » de mouvement et généralise bien. OpHRL est un prédicteur en boucle fermée qui tient compte de l'état du robot. Un routeur de familiarité des tokens (Token-Familiarity Router) arbitre lorsque les deux divergent : il privilégie OpHRL pour les séquences de tokens connues et OpVQ-VAE pour les séquences inédites. Les auteurs annoncent 85,2 % de réussite sur des combinaisons de mouvements longues déjà vues à l'entraînement, et 71,3 % sur des mouvements jamais rencontrés. Ils rapportent aussi de meilleurs résultats que les contrôleurs corps entier existants sur les mouvements pris isolément, ainsi qu'un déploiement zéro-shot sur le Unitree G1.
L'intérêt pratique tient au compromis que les équipes rencontrent sans cesse. Une politique couplée donne des gestes dynamiques et agiles, comme des sauts ou des mouvements amples, mais elle perd en précision. Une politique découplée manipule ou positionne mieux, mais elle devient moins robuste quand le mouvement exige une coordination globale. Plutôt que de chercher un contrôleur unique qui concilie tout, BAT montre qu'on peut combiner des spécialistes et basculer entre eux à l'exécution. Le point à surveiller est l'écart entre mouvements vus et inédits : 85,2 % contre 71,3 %, soit près de 14 points perdus, ce qui reste loin de la fiabilité attendue en production. Ces chiffres viennent de benchmarks de recherche, sans durée de tâche, nombre d'essais ni conditions détaillés dans le résumé. Le transfert zéro-shot sur G1 est encourageant, mais rien ne dit qu'il couvre toute la distribution de mouvements testée en simulation.
Ce travail s'inscrit dans la vague des contrôleurs généralistes corps entier pour humanoïdes, nourrie par l'apprentissage par renforcement en simulation et l'imitation de mouvements humains. Le Unitree G1, peu coûteux et très répandu dans les laboratoires, sert désormais de plateforme de référence pour valider ces méthodes. Les auteurs ne se positionnent pas ici face aux modèles VLA commerciaux (Figure, Tesla, NVIDIA), car BAT agit à la couche basse de contrôle, pas au niveau du raisonnement ou de la planification. Cette couche reste pourtant un goulot d'étranglement pour passer des démonstrations à des tâches longues et enchaînées. La version 2 laisse penser que l'article a été révisé après relecture. Les suites logiques seraient des tests sur d'autres plateformes, des tâches de manipulation plus longues et une mesure de la robustesse hors laboratoire. Aucun calendrier de déploiement industriel n'est annoncé.
Dans nos dossiers




