Co-design Gym : un benchmark unifié pour la co-optimisation de la morphologie et de la politique de contrôle
Une équipe de chercheurs publie sur arXiv (identifiant 2610.02366) Co-Design Gym, une suite de benchmarks dédiée à l'optimisation conjointe de la morphologie d'un agent et de sa politique de contrôle. L'ensemble couvre 20 familles d'environnements, avec plus de 85 configurations de co-conception prédéfinies. Les domaines vont de la manipulation robotique et de la locomotion à la coopération multi-robots, en passant par les dynamiques déformables et molles, les jeux vidéo, les réseaux électriques, les réseaux sans fil, la course de F1, les entrepôts multi-agents et le contrôle optimal. Les auteurs y ajoutent une évaluation systématique d'algorithmes de co-conception représentatifs, pour dresser l'état de l'art actuel. Il s'agit d'un travail de recherche académique : aucun produit, déploiement industriel ni donnée de performance matérielle n'est annoncé, et le résumé ne chiffre pas les résultats de cette comparaison.
L'intérêt tient à une hypothèse implicite de la plupart des benchmarks d'apprentissage par renforcement et de robotique : l'agent est figé, seule la politique s'apprend. Or la morphologie conditionne les politiques que l'on peut découvrir, et la meilleure morphologie dépend elle-même des politiques qu'elle autorise. Optimiser les deux séparément donne donc des résultats sous-optimaux. Pour les roboticiens et les intégrateurs, la question est concrète : choix du nombre de degrés de liberté, de la géométrie des membres, de l'emplacement des actionneurs ou de la préhension. Ces décisions se prennent aujourd'hui surtout par ingénierie et itération manuelle, et la co-conception reste peu comparable d'une étude à l'autre. Un banc d'essai commun permettrait de mesurer sur une base homogène ce que ces méthodes apportent réellement, et de vérifier si les gains observés sur des cas isolés se généralisent. L'élargissement à des domaines hors robotique (réseaux, énergie) suggère aussi que la méthode vise un usage plus large que les seuls humanoïdes.
Ce travail s'inscrit dans une littérature sur la co-optimisation forme-contrôle qui existe depuis des années, mais dont les résultats sont dispersés entre des environnements ad hoc, ce qui freine les comparaisons. Co-Design Gym adopte le format des suites de type Gym, devenues le standard pour l'apprentissage de politiques, afin de favoriser un progrès cumulatif. Le résumé ne précise ni les algorithmes testés, ni les scores, ni la disponibilité du code, des points à vérifier dans le texte complet. Il reste aussi à voir si ces environnements, simulés, transféreront vers du matériel réel, où l'écart simulation-réalité pèse encore sur la fabrication de morphologies optimisées.
Dans nos dossiers




