
PLAT : suivi épars de mouvements-clés pour le contrôle humanoïde par apprentissage de transition latente privilégiée
Un cadre nomme PLAT, pour Privileged LAtent Transition learning, a été publie sur arXiv sous la référence 2609.25754v1. Il s'attaque au contrôle de robots humanoïdes par "keyframes temporisées éparses" : le robot ne reçoit que quelques poses-clés futures et leurs instants d'arrivée souhaites, plutôt qu'une référence dense image par image comme le font les politiques de motion tracking classiques. L'entrainement se déroule en trois étapes : un expert de suivi de mouvement dense preentraine fournit d'abord un prior de mouvement robuste, un prior latent privilégié est ensuite appris par imitation de type DAgger a partir de séquences d'objectifs denses servant de supervision privilégiée, puis un apprentissage par renforcement affine les transitions dans l'espace latent plutôt que les actions elles-mêmes. Les auteurs rapportent un suivi stable et précis en simulation sur des horizons de planification variables, avec un avantage marque a long horizon, et un déploiement réussi sur un robot humanoïde Unitree G1.
Le problème vise est concret pour les équipes de recherche et les intégrateurs en robotique humanoïde : les politiques de suivi dense, précises mais rigides, s'exploitent mal comme contrôleurs de haut niveau pour la planification de taches ou la génération interactive de mouvement, car elles exigent une référence complète a chaque instant. En rendant le contrôle pilotable par de simples poses-clés espacées dans le temps, PLAT propose une interface plus légère entre un module de décision, planificateur ou générateur de mouvement, et l'exécution bas niveau, une séparation qui rejoint la logique d'architectures décision/exécution comme GR00T N2 ou Helix. Le transfert réussi vers un robot physique va dans le sens d'un rapprochement simulation-déploiement, même si les résultats quantitatifs reposent surtout sur la simulation, avec un seul modèle de robot teste et aucun taux de réussite en conditions réelles communique dans le résume.
Ce travail s'inscrit dans la lignée des politiques de suivi de mouvement entraînées en simulation puis transférées sur robot réel, méthode courante pour les humanoïdes Unitree et dans la recherche en contrôle appris. Il se distingue des modèles généralistes de type VLA, tels Pi-0 ou GR00T N2, en ciblant la couche de contrôle moteur bas niveau plutôt que la perception ou la planification, une brique complémentaire plutôt que rivale. Publie sous la catégorie "new" d'arXiv, sans partenariat industriel ni calendrier de déploiement annonces, PLAT demeure a ce stade une contribution de recherche dont la robustesse hors simulation et sur d'autres plateformes reste a démontrer.
Dans nos dossiers




