Au-delà de l'alignement de politique : boucler la planification et l'apprentissage pour le contrôle de robots avec des modèles du monde appris
Des chercheurs proposent PL-MPC (Planning-Learning MPC), une évolution de TD-MPC, la famille de méthodes qui combine un modèle du monde appris, une optimisation de trajectoire en ligne (MPPI) et des fonctions de valeur et de politique apprises. Trois modifications sont introduites, sans toucher à l'architecture du modèle du monde ni à l'optimiseur. Des cibles TD multi-étapes hybrides exposent le critique à davantage de récompenses réellement observées avant le bootstrap. Une estimation de valeur terminale sensible au désaccord entre critiques réduit le poids des valeurs incertaines pendant la planification. Enfin, une distillation de l'acteur pondérée par le retour privilégie les actions exécutées par le planificateur dans les épisodes les plus rentables. Sur HumanoidBench, le Total Average Return passe de 98±18 à 387±255 sur balance-hard, et de 199±13 à 466±200 sur hurdle. Les résultats restent dépendants de la tâche sur le reste du benchmark, et la méthode demeure compétitive sur DMControl. Un test de transfert sim-to-real zero-shot est réalisé sur l'alignement d'un écrou avec une clé, avec un bras KUKA IIWA14 à 7 DoF. Le taux de succès observé est supérieur à celui de TD-M(PC)^2, pour la taille d'objet d'entraînement et deux tailles inédites. Code et données doivent être publiés ultérieurement.
L'intérêt tient à la manière dont le problème est posé. Le planificateur génère les données dont le critique et l'acteur apprennent, et ceux-ci notent et proposent à leur tour les plans futurs : les erreurs de valeur peuvent donc se renforcer d'un cycle à l'autre. Les variantes précédentes se contentaient d'aligner la politique sur le comportement du planificateur. PL-MPC traite aussi la supervision du critique et la valeur terminale, ce qui suggère que les gains viennent de la boucle entière plutôt que d'un seul composant. Il faut toutefois lire les chiffres avec prudence. Les écarts-types sont très larges (387±255, 466±200), les gains se concentrent sur deux tâches, et les ablations montrent que les composants interagissent différemment d'une tâche à l'autre. Le test sim-to-real reste un seul scénario sur bras fixe, sans aucune mesure sur un humanoïde réel : il ne dit rien du passage à l'échelle sur des robots à corps entier.
Ce travail prolonge TD-MPC et TD-MPC2, références du contrôle basé sur modèle du monde pour les systèmes de grande dimension, ainsi que TD-M(PC)^2, variante contrainte par la politique qui sert ici de point de comparaison direct. Il se positionne en recherche amont, à distance des approches VLA généralistes (Pi-0, GR00T, Helix) qui dominent les annonces industrielles. HumanoidBench reste un banc d'essai simulé, et un transfert réussi sur un bras industriel ne garantit pas la robustesse sur un humanoïde. La suite dépendra de la publication du code et des données annoncés sur pl-mpc-humanoid.github.io, puis d'éventuelles validations sur matériel humanoïde.
Dans nos dossiers




