Priors de morphologie d'ordre supérieur pour l'apprentissage par renforcement de quadrupèdes face à la dégradation des actionneurs
Des chercheurs proposent de modéliser le quadrupède Unitree Go1 non plus comme un simple graphe de nœuds (articulations) et d'arêtes (segments), mais comme un complexe cellulaire. Celui-ci ajoute des cellules de rang 2, des « faces » qui représentent les membres et le corps entier. Une politique de commande par apprentissage par renforcement traite cette structure avec un passage de messages fondé sur la théorie de Hodge. Le travail, publié sur arXiv (2610.10934v1), cible la dégradation d'actionneurs, c'est-à-dire la perte partielle de couple sur certaines articulations. Selon les auteurs, l'acteur Hodge « nœud-arête-face » obtient le meilleur retour (return) sur des dégradations jamais vues à l'entraînement, avec un taux de survie plus élevé et une erreur de suivi de vitesse plus faible que les références. Le résumé ne donne aucun chiffre, ni l'ampleur des écarts, ni le nombre de graines d'entraînement, ni le détail des pannes testées. Rien n'indique non plus une validation sur un robot physique.
L'intérêt tient à la question posée, plus qu'au résultat. Quand un moteur faiblit, la marche devient un problème de coordination : les autres articulations, voire d'autres pattes, doivent compenser. Un biais inductif qui encode explicitement cette structure mécanique d'ordre supérieur pourrait rendre les politiques plus robustes sans multiplier les données d'entraînement. Pour les intégrateurs de robots d'inspection ou de logistique, la tolérance aux pannes dégradées, qui évite un arrêt complet en cas d'usure ou de surchauffe, vaut autant que la performance nominale. Reste à prouver que ce gain survit au transfert vers le réel (sim-to-real) et qu'il justifie un coût de calcul supérieur à celui d'un perceptron classique.
Ce travail prolonge les politiques à graphes sensibles à la morphologie, apparues avec des approches de type NerveNet, qui avaient montré de meilleurs résultats en apprentissage et en généralisation face à des perturbations du corps. Les auteurs testent ici si l'ajout de structure d'ordre supérieur renforce ces bénéfices. Le Go1 est la plateforme de référence de nombreux laboratoires. La suite logique serait de comparer la méthode à des politiques entraînées par randomisation de domaine, d'élargir à d'autres morphologies (bipèdes, humanoïdes) et de réaliser des essais matériels avec des pannes injectées.
Dans nos dossiers




