
Apprendre à marcher avec moins de données : une approche Dyna pour la locomotion quadrupède
Une équipe de recherche a publié une version révisée sur arXiv (2509.06296v2) d'une méthode de renforcement pour accélérer l'entraînement de robots quadrupèdes en simulation. Les algorithmes on-policy classiques comme PPO exigent des dizaines de millions d'interactions simulées avant de converger. La méthode proposée injecte des données synthétiques dans les rollouts PPO via une architecture Dyna : un modèle de transition appris génère de courtes trajectoires additionnelles ancrées à la simulation physique, introduites progressivement pour éviter les erreurs de début d'entraînement. Sur le quadrupède Unitree Go1, elle converge en 19,64 millions de pas de simulation contre 27,53 millions pour PPO seul, soit 12,24% de temps d'entraînement en moins, sans perte de performance. Des essais croisés sur ANYmal, du suisse ANYbotics (spin-off de l'ETH Zurich), et sur le Unitree Go2 confirment le gain, avec des compromis sur la récompense pour les morphologies les plus complexes.
Pour l'industrie robotique, l'efficacité d'échantillonnage reste le principal goulot d'étranglement : chaque nouvelle démarche ou terrain appris par un quadrupède consomme des semaines de calcul avant le transfert du simulateur vers le robot réel. Une réduction d'environ 29% des pas de simulation nécessaires, si elle se confirme au-delà des trois plateformes testées, réduirait les coûts et délais pour les intégrateurs qui personnalisent des contrôleurs pour Unitree, ANYbotics ou d'autres fabricants. Le résultat renforce aussi une tendance de fond en RL : utiliser des modèles du monde appris en complément, et non en remplacement, de la simulation physique. Le bémol : le gain se réduit sur les morphologies complexes, signe que ces architectures hybrides restent à calibrer robot par robot plutôt qu'universelles.
Le papier s'inscrit dans la lignée du RL model-based initié par l'architecture Dyna de Richard Sutton dans les années 1990, revenue au premier plan pour réduire le coût du RL model-free sur des tâches de contrôle continu à haute dimension comme la locomotion. Il prolonge des travaux appliquant PPO à des quadrupèdes commerciaux (Unitree Go1/Go2, ANYmal) pour la marche ou le franchissement d'obstacles, où l'entraînement massif en simulation précède le déploiement réel. Les résultats restent cantonnés à la simulation : aucun essai sur robot physique ni calendrier de transfert sim-to-real n'est mentionné, les auteurs présentant leurs travaux comme un cadre méthodologique plutôt qu'un produit prêt à déployer.
La validation croisée sur ANYmal, quadrupède du suisse ANYbotics (spin-off de l'ETH Zurich), suggère un intérêt potentiel pour les intégrateurs européens, mais aucun essai réel ni déploiement n'est mentionné.
Dans nos dossiers




