Apprentissage de la loco-manipulation à partir de démonstrations SMPC via un RL clairsemé hors ligne vers en ligne
Une équipe de recherche présente dans un preprint arXiv publié le 13 août 2026 (arXiv:2608.12063v1) une méthode d'apprentissage combinant locomotion et manipulation pour robots à pattes. Le système utilise du Sample-based Model Predictive Control (SMPC), une forme de commande prédictive par échantillonnage, exécutée entièrement en simulation pour générer automatiquement de vastes jeux de données hors ligne, jouant le rôle d'expert artificiel. Ces données servent ensuite à entraîner un agent de reinforcement learning (RL) off-policy à l'aide de récompenses de tâche uniquement éparses (sparse rewards), sans le façonnage manuel et chronophage de fonctions de récompense denses habituellement nécessaire. Cet agent de haut niveau est couplé à un contrôleur bas niveau assurant la stabilité dynamique du robot. Les auteurs valident la robustesse du transfert simulation-vers-réel (sim-to-real) en déployant des compétences complexes de loco-manipulation sur deux morphologies différentes: un quadrupède Spot équipé d'un bras et un humanoïde G1.
L'intérêt principal de ces travaux tient à la résolution du goulot d'étranglement le plus coûteux du RL appliqué à la robotique: la conception manuelle de récompenses denses, qui ralentit considérablement l'apprentissage de nouvelles compétences à chaque nouvelle tâche. En s'appuyant sur des démonstrations SMPC pour préremplir l'exploration, les auteurs affirment que les politiques apprises finissent par surpasser leur propre professeur de commande optimale, un résultat notable si confirmé à plus grande échelle. Pour les intégrateurs et décideurs du secteur, cela illustre une voie alternative aux approches VLA entraînées sur des démonstrations réelles massives: générer les données d'entraînement en simulation via un contrôleur classique plutôt que par téléopération humaine, ce qui pourrait réduire les coûts de collecte de données pour les robots à pattes et humanoïdes.
Ce travail s'inscrit dans la tendance du RL offline-to-online et de l'usage de contrôleurs optimaux comme professeurs pour le RL. Il reste à ce stade une publication de recherche, sans nom d'entreprise, de laboratoire ni de calendrier de déploiement commercial associés dans l'abstract, et sans comparaison chiffrée directe avec les approches VLA concurrentes.
Dans nos dossiers




