
Co${}^{2}$Skill : contrôle du corps entier par composition de compétences pour l'interaction humain-environnement à long horizon
Des chercheurs publient sur arXiv (2610.09291) Co²Skill, un contrôleur « whole-body » en simulation physique qui unifie deux capacités traitées jusqu'ici séparément : l'interaction avec la scène (s'asseoir, se lever, grimper, franchir des escaliers) et la manipulation dextre d'objets. Le système repose sur une politique unique, construite sur un a priori de mouvement préentraîné (motion prior). Des masques d'observation, dépendants de la tâche et de la phase en cours, sélectionnent l'information utile à chaque objectif. L'entraînement combine deux curriculums. Le premier, de loco-manipulation conditionnée par un but, associe un guidage partiel par trajectoires de référence, pour la précision, à une exploration depuis des états initiaux variés, ce qui autorise une exécution au-delà des démonstrations. Le second, inter-tâches, entraîne conjointement des compétences isolées et des séquences de tâches sélectionnées. Il préserve l'état physique d'une tâche à l'autre, par exemple en maintenant une prise pendant une interaction avec la scène. Les tests couvrent chaque compétence, leur enchaînement et des conditions aléatoires. Une démonstration de composition de compétences est aussi présentée dans des environnements intérieurs. Le résumé ne donne ni taux de réussite, ni nombre de degrés de liberté, ni durée de cycle.
L'intérêt tient à la jonction entre deux sous-domaines qui avancent en parallèle. D'un côté, les contrôleurs de personnages physiques savent produire des mouvements plausibles pour l'interaction avec la scène. De l'autre, la manipulation dextre est traitée à part, avec ses propres politiques. Un humanoïde utile en usine, en entrepôt ou à domicile doit pourtant porter un objet tout en montant une marche ou en s'asseyant, sans lâcher sa prise. La préservation de l'état physique entre les tâches vise précisément ce point, qui fait souvent échouer les enchaînements de compétences appris séparément. Pour un intégrateur, le résultat ne prouve rien sur le transfert vers un robot réel : il s'agit d'une évaluation en simulation, sans validation matérielle annoncée, donc l'écart sim-to-real reste entier. Les décideurs B2B doivent le lire comme une brique de recherche et non comme un produit ou un déploiement.
Le travail s'inscrit dans la lignée des contrôleurs physiques fondés sur des a priori de mouvement, nés de l'animation et de l'imitation de capture de mouvement, que la robotique humanoïde réutilise pour la locomotion et la manipulation. Il se situe en amont des modèles fondation pour humanoïdes, comme GR00T N2 de NVIDIA ou Helix de Figure, qui visent l'échelle par la donnée et le langage plutôt que par la composition explicite de compétences. Aucun partenaire industriel, calendrier de pilote ni code publié n'est mentionné dans le résumé. La suite logique serait une validation sur matériel, puis une comparaison avec les approches VLA sur des tâches longues, à vérifier dans le texte complet.
Dans nos dossiers



