Neuf essais pour récupérer : un benchmark reproductible de l'adaptation aux dommages des robots souples sans répertoire de comportements
Un nouveau benchmark publié sur arXiv (2610.07616) propose un protocole reproductible pour mesurer la récupération de robots souples endommagés, sans répertoire de comportements précalculés, avec seulement neuf essais en ligne. Le protocole apparie des masques de dommages au sein de chaque morphologie, conserve un contrôleur nominal mesuré comme solution de repli et sépare le développement des méthodes de leur évaluation sur des corps inédits. Le contrôleur de référence repose sur un processus gaussien avec amélioration espérée (GP-EI) qui ajuste les phases des actionneurs en trois sondes d'initialisation puis six essais choisis d'après le retour du système. Sur deux cohortes disjointes de 75 corps, il dépasse la recherche aléatoire, Sobol, CEM et CMA-ES à budget égal. Il améliore le gain du pire masque sur 69 des 75 corps de confirmation, avec un avantage de 0,235 à 0,310 de récompense moyenne sur le pire masque. Lors d'un test de résistance sur la cohorte de développement, où 10 % des voxels occupés sont retirés physiquement, GP-EI progresse sur 71 corps sur 75 et devance l'implémentation officielle de TuRBO (BoTorch) de 0,356.
L'intérêt tient moins à l'algorithme qu'à la méthode d'évaluation. Les travaux d'adaptation aux dommages se comparent souvent sur des corps de développement, avec des budgets inégaux et sans repli mesuré, ce qui gonfle les gains. Ici, l'inférence est menée corps par corps et la cohorte de confirmation reste gelée. Le coût de sécurité est aussi chiffré : le rejeu à contrôleur fixe donne 5,06 largeurs de voxel de récupération moyenne, pour une hausse de seulement 0,0031 du p99 de déformation d'arête dans le pire masque. Une porte de déploiement stricte, interdisant toute sollicitation supplémentaire, ne conserve toutefois que 48,7 % du gain moyen. Pour un intégrateur, cela signifie qu'une partie de la récupération s'obtient en sollicitant davantage la structure. Une réserve s'impose : le comparateur le plus proche, un GP local de type TuRBO, n'est pas distingué statistiquement, puisque l'intervalle de confiance apparié inclut zéro. Tout cela relève de la simulation de voxels, sans validation sur matériel physique.
Le travail s'inscrit dans la lignée de l'algorithme Intelligent Trial and Error (Cully et al., 2015), qui adaptait un robot endommagé en quelques essais grâce à un répertoire de comportements précalculé en simulation. Le benchmark cherche à mesurer ce que de tels a priori appris de dommages apportent réellement par rapport à une optimisation bayésienne sans répertoire, et fournit le point de comparaison manquant. Les contrôleurs rejouables, l'inférence au niveau des corps et les cohortes gelées sont publiés pour permettre aux futures méthodes d'être comparées dans les mêmes conditions. La suite logique serait de confronter les approches à répertoire, les politiques apprises et ce socle GP-EI, puis de passer du voxel simulé à des robots souples réels.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




