Accélérer l'apprentissage de politiques visuelles grâce au contrôle prédictif par échantillonnage
Une équipe de recherche a publié le 20 septembre 2026 sur arXiv (2609.20575) une méthode baptisée Sampling-Guided Policy Search (SGPS), destinée à l'apprentissage de politiques visuelles pour la locomotion et la manipulation de robots. Le système combine un contrôle prédictif par échantillonnage (sampling-based model-prédictive control) avec des gradients de politique de premier ordre (FoPG) issus de simulation différentiable, une technique reconnue pour réduire le coût de calcul mais sujette à converger vers des schémas de contact non désirés entre le robot et son environnement. La politique est d'abord initialisée par clonage de comportement à partir d'actions échantillonnées, puis l'entraînement alterne raffinement par échantillonnage et mises à jour FoPG à court horizon, sous états initiaux perturbés et dynamiques randomisées. Une formulation FoPG découplée exclut le rendu du graphe de calcul, ce qui permet d'apprendre directement à partir d'observations de profondeur (depth) sans passer par un professeur basé sur l'état complet du système. L'entraînement tient sur un seul GPU et couvre locomotion, franchissement d'obstacles, poussée de caisse et portage bimanuel, testés en simulation sur les robots quadrupèdes et humanoïdes Unitree Go2 et G1. La politique distillée a ensuite été transférée en zero-shot sur un Go2 réel, capable de trotter, ramper, franchir des haies et alterner entre ces comportements de façon autonome grâce à sa caméra de profondeur embarquée.
Pour l'industrie robotique, ce travail répond à deux contraintes concrètes : le coût prohibitif en GPU et mémoire de l'apprentissage de politiques visuelles, et le fossé persistant entre simulation et réel pour les comportements de contact. En démontrant qu'une politique fondée uniquement sur la profondeur, entraînée sur un seul GPU, transfère sans réentraînement sur un robot physique, l'étude nuance l'idée reçue selon laquelle les politiques vision-langage-action à grande échelle nécessitent systématiquement des infrastructures massives ou un professeur privilégié à état complet. Cela intéresse directement les intégrateurs travaillant sur AMR et quadrupèdes à budget de calcul limité.
Ce résultat s'inscrit dans la lignée des travaux combinant simulation différentiable (type Isaac Gym) et contrôle prédictif pour la locomotion de robots à pattes, un axe de recherche actif face aux approches par distillation professeur-élève à partir d'état privilégié. Il s'agit d'un preprint académique sans annonce de déploiement commercial ni de partenaire industriel ; les prochaines étapes attendues concernent l'extension à d'autres plateformes et tâches de manipulation bimanuelle.
Dans nos dossiers




