Apprentissage automatique de programme d'entraînement au niveau des trajectoires pour la locomotion de robots à pattes sur terrain non structuré
Des chercheurs ont mis en ligne le 18 août 2026 un article sur arXiv (référence 2608.16164, soumission croisée) présentant une méthode d'apprentissage par curriculum automatique au niveau des trajectoires pour entraîner des politiques de locomotion de robots à pattes sur terrain non structuré. Contrairement aux approches existantes, qui imposent des curriculums heuristiques sur des terrains paramétrés artificiellement (pentes, marches ou obstacles générés selon des règles fixes), la méthode génère directement les tâches d'entraînement à partir de cartes de terrain réel non structuré. Le système fonctionne en boucle fermée avec deux composants: un évaluateur qui apprend, à chaque mise à jour du curriculum, une fonction de difficulté associant à une trajectoire donnée un score adapté au niveau actuel de la politique, et un échantillonneur qui propose de nouvelles trajectoires guidées par cet évaluateur pour l'entraînement suivant. Les auteurs rapportent un gain de 56,3% du taux de réussite des trajectoires par rapport à un entraînement sans curriculum, de 18,5% par rapport à un curriculum conçu manuellement sur les terrains les plus difficiles, et jusqu'à 39,74% lorsque le robot doit franchir un même obstacle depuis des directions d'approche variées.
Le problème visé, la conception du curriculum d'entraînement, reste un goulot d'étranglement concret pour les équipes qui développent des robots à pattes destinés à des environnements réels non standardisés: chantiers, sites logistiques extérieurs, interventions post-catastrophe. Les curriculums heuristiques actuels risquent de faire surapprendre les politiques sur des motifs perceptifs quasi fixes, ce qui limite leur généralisation une fois confrontées à un terrain véritablement irrégulier. En automatisant la génération de trajectoires au bon niveau de difficulté et en la faisant évoluer avec la politique, cette approche réduit potentiellement le travail d'ingénierie manuelle et améliore la robustesse hors distribution, un enjeu central pour tout intégrateur cherchant à passer de la démonstration en simulation à un déploiement fiable.
L'article s'inscrit dans la lignée des travaux sur l'apprentissage par curriculum en apprentissage par renforcement, technique connue pour éviter les échecs d'exploration précoce lors de l'entraînement de politiques complexes. Aucun nom d'entreprise, de laboratoire ni de plateforme robotique spécifique n'apparaît dans le résumé, et les résultats communiqués semblent reposer sur des expériences quantitatives et qualitatives sans précision explicite d'un déploiement sur matériel réel, ce qui invite à la prudence avant d'extrapoler ces gains à des conditions de terrain hors simulation.
Dans nos dossiers




