Apprentissage d'une représentation du mouvement expressive et compositionnelle via des compétences spectrales
Des chercheurs proposent les « spectral skills », une représentation latente qui sert d'interface de commande entre un planificateur de haut niveau et un contrôleur bas niveau pour humanoïdes. Ces skills encodent de courts segments de mouvement sous forme compacte. Elles sont apprises par apprentissage prédictif : l'encodeur doit prédire le mouvement suivant, et non reconstruire son entrée. Sur un humanoïde de 29 DOF, un contrôleur conditionné par ces skills réduit l'erreur de suivi global de 62 % par rapport à l'état de l'art. Le même contrôleur, gelé, enchaîne des skills encodées indépendamment sans politique de transition dédiée. Il compose aussi de nouveaux comportements en ajoutant des directions orthogonales à une skill de base compatible, ce qui produit des combinaisons absentes des données d'entraînement. Les auteurs présentent du suivi de mouvement, de l'enchaînement et de la composition, ainsi qu'un pilotage par un planificateur conditionné par le langage, sur un Unitree G1 réel. Le travail, publié sur arXiv (2609.37677), est accompagné d'une page projet.
L'enjeu porte sur l'interface entre planificateur et contrôleur, un point de friction des architectures hiérarchiques pour humanoïdes. Cette interface doit permettre une exécution précise, rester assez simple pour être prédite par un modèle de fondation (VLA ou planificateur de langage) et se prêter à la composition. Les représentations actuelles sacrifient en général l'un de ces critères. Si les résultats se confirment, un contrôleur unique et figé pourrait exécuter des comportements variés sans réentraîner de module de transition. Cela réduirait le coût d'intégration pour ceux qui greffent un planificateur sur une base de locomotion existante. Deux réserves : la réduction de 62 % est relative à un état de l'art que le résumé ne nomme pas, et les démonstrations matérielles sur G1 restent qualitatives. Aucun chiffre de robustesse, de taux de réussite ni de durée d'exécution n'est fourni. Le passage de la démonstration de laboratoire à un déploiement industriel n'est donc pas établi.
Ce travail s'inscrit dans le mouvement des modèles de fondation robotiques pour humanoïdes. Ceux-ci adoptent souvent une architecture à deux niveaux, comme les systèmes duaux de type Helix chez Figure ou GR00T chez NVIDIA, avec un module « lent » qui décide et un module « rapide » qui exécute. Le Unitree G1, plateforme abordable et très répandue dans les laboratoires, sert ici de banc d'essai. Il rend la méthode reproductible par d'autres équipes, mais les 29 DOF et les capacités du G1 ne reflètent pas les contraintes de charge utile ou d'endurance d'un humanoïde industriel. Les suites logiques sont la validation sur d'autres morphologies, la comparaison publique avec les méthodes de suivi de mouvement existantes et l'intégration avec des planificateurs de type VLA à grande échelle. Aucun pilote industriel ni calendrier n'est annoncé.
Dans nos dossiers




