
Arnold : une politique transformer musculaire multitâche et multi-corps
Une équipe de recherche a mis en ligne sur arXiv la version révisée d'Arnold, une politique de contrôle basée sur un transformer capable de piloter des modèles musculosquelettiques humains à haute dimension sur 14 tâches distinctes: manipulation fine d'objets, atteinte de cibles et locomotion. Contrairement aux politiques dites "spécialistes", entraînées séparément pour chaque tâche, Arnold combine clonage comportemental et apprentissage par renforcement pour égaler, voire dépasser, les performances de ces spécialistes avec un seul modèle multi-tâches et multi-corps. L'innovation centrale tient dans un "vocabulaire sensorimoteur", une représentation compositionnelle qui encode la sémantique des différentes modalités sensorielles, objectifs et actionneurs, ce qui permet à l'architecture transformer de gérer des espaces d'observation et d'action de taille variable selon les tâches. Code et données sont publiés sur GitHub (amathislab/arnold), identifiant arXiv 2508.18066.
L'enjeu dépasse la simple prouesse technique: contrôler des systèmes musculosquelettiques, non-linéaires et comptant des dizaines de muscles, reste un problème ouvert en neurosciences computationnelles et en biomécanique, avec des retombées attendues en prothétique et en rééducation motrice. Qu'une seule politique généraliste tienne tête à des spécialistes fait écho à la dynamique observée en robotique avec les modèles VLA (vision-language-action) de type Pi-0 ou GR00T, mais appliquée ici au muscle plutôt qu'au moteur électrique. Les auteurs tempèrent toutefois l'enthousiasme: leur analyse causale du signal moteur montre que les synergies musculaires de faible dimension restent largement spécifiques à chaque tâche, et que les méthodes d'analyse de variance classiques sous-estiment systématiquement la complexité réelle du contrôle. Autrement dit, la généralisation des performances ne s'accompagne pas d'une simplification interne du contrôle, un résultat qui nuance le récit d'une politique unique universelle et qui recoupe des observations déjà faites sur le vivant.
Ce travail s'inscrit dans la lignée des simulateurs musculosquelettiques utilisés pour entraîner des agents en apprentissage par renforcement sur des corps virtuels dotés de dizaines de muscles, à la croisée du machine learning, de la biomécanique et des neurosciences. Il rejoint un mouvement plus large vers des politiques multi-tâches "généralistes", en écho aux approches VLA de la robotique humanoïde. La publication ouverte du code et des données doit permettre à la communauté de reproduire les résultats et d'évaluer la capacité d'Arnold à s'adapter rapidement à des tâches encore inédites.
Dans nos dossiers




