Développer des compétences combinées de manipulation et de locomotion via une représentation d'interaction et une composition de compétences
Des chercheurs présentent une méthode pour apprendre à un robot humanoïde à combiner préhension et locomotion à partir de principes développementaux, dans un article déposé sur arXiv (2608.00208v1). La première brique est une politique de saisie corps entier inspirée de l'analyse harmonique : des harmoniques cubiques servent de poids pour représenter la relation spatiale main objet via une convolution spatiale, et un curriculum de découplage des articulations des doigts, appliqué au sein même de chaque épisode d'apprentissage, permet au robot d'apprendre à saisir sans dataset externe ni modèle pré-entraîné. La seconde brique combine cette politique de saisie avec une politique de lever et de marche apprise séparément, en s'appuyant sur des scores d'interaction main objet pour décider, à chaque instant, quelle politique pilote quelles articulations. Résultat : 93% de réussite en zero shot sur des objets jamais vus, et entre 96 et 100% de réussite pour se relever tout en tenant l'objet saisi.
L'intérêt pratique dépasse la simple prouesse technique : la plupart des démonstrations de manipulation mobile chez les humanoïdes empilent des compétences apprises isolément, avec un risque élevé d'interférence entre politiques au moment de les enchaîner. Ici, la généralisation zero shot à des objets inconnus, sans recourir à un modèle vision langage action massif comme Pi-0, GR00T N2 ou Helix, tranche avec la tendance dominante du secteur, qui mise sur l'échelle des données plutôt que sur des curricula développementaux. L'enseignement le plus transférable pour des ingénieurs robotique ou des intégrateurs concerne la composition de compétences : elle ne fonctionne de façon fiable que si chaque politique est entraînée sur le corps entier du robot, y compris des parties a priori inutiles à la tâche, comme garder les doigts actifs pendant l'apprentissage de la marche.
Le travail s'inscrit dans la course plus large à la manipulation mobile chez les humanoïdes, un problème que des acteurs commerciaux comme Figure, Agility ou plusieurs plateformes chinoises tentent aussi de résoudre, le plus souvent via des modèles VLA pré-entraînés à grande échelle plutôt que par apprentissage développemental from scratch. L'abstract ne mentionne ni déploiement réel ni acteur français ou européen, et les résultats restent issus d'environnements contrôlés de simulation ou de laboratoire ; reste à voir si l'approche passe l'échelle vers des comportements plus complexes ou vers d'autres plateformes matérielles.
Dans nos dossiers




