Curricula de sécurité prédictifs pour une locomotion à pattes robuste
Des chercheurs proposent les Predictive Safety Curricula (PSC), un cadre d'entraînement pour les politiques de locomotion de robots à pattes, décrit dans un preprint arXiv (2609.37070v1) qui n'a pas encore été évalué par des pairs. Le système entraîne un critique de sécurité distributionnel à partir des rollouts de la politique. Ce critique prédit le coût de sécurité futur. Ces prédictions servent à prioriser deux éléments : les contextes de terrain et les événements aléatoires déjà rencontrés pendant l'entraînement. La récompense de la tâche et la fonction de perte d'optimisation de la politique restent inchangées, et seule la distribution des données d'entraînement est modifiée. Les auteurs comparent PSC à la progression standard de terrain, au replay basé sur l'avantage et aux curricula fondés sur le learning progress. Les tests couvrent de la locomotion en terrain accidenté contrôlé et deux piles de locomotion de production. Sur le robot ANYmal-D, PSC réduit de 63 % l'incidence des collisions de tibia par rapport au curriculum learning-progress, sur trois seeds d'entraînement appariées, avec une baisse dans chacune. Sur une plateforme de montée d'escaliers de production, non nommée dans le résumé, les auteurs n'observent aucune collision de tibia lors des essais matériels évalués.
Le résultat s'attaque à un écart bien connu des intégrateurs : une politique apprise peut afficher de bonnes performances moyennes tout en gardant des défaillances rares mais coûteuses, comme un choc ou une chute. Les curricula usuels ajustent la difficulté de la tâche, sans cibler la distribution des expériences critiques pour la sécurité. Un allocateur d'expérience qui n'exige ni nouvelle récompense ni modification de l'algorithme d'optimisation est facile à intégrer dans une chaîne d'entraînement existante. C'est un argument pour les équipes qui visent la fiabilité en exploitation plutôt que la démonstration. Le transfert vers deux piles de production distinctes suggère que le principe n'est pas lié à un seul contrôleur. Les gains sont les plus marqués sur terrain difficile et avec des observations dégradées, ce qui correspond aux conditions de chantier ou d'inspection industrielle.
Il faut toutefois relativiser. Le résumé ne donne ni taux absolus de collision, ni nombre d'essais matériels, ni intervalles de confiance. Trois seeds et des essais matériels en nombre non précisé donnent une puissance statistique limitée. La mention « aucune collision observée » sur la plateforme d'escaliers ne prouve pas l'absence de risque. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement sim-to-real sur ANYmal, du ccadre de l'apprentissage sûr par critique distributionnel et des curricula automatiques. Il reste à voir si les résultats se reproduisent sur d'autres morphologies, dont les humanoïdes, et si le coût de calcul du critique reste raisonnable à grande échelle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




