
ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes
Le laboratoire à l'origine du projet ViLoMan, publié en preprint sur arXiv (arXiv:2609.19340, soumission anonyme en relecture en double aveugle, page projet viloman-anonymous.pages.dev), présente un système d'apprentissage pour la loco-manipulation autonome des robots humanoïdes. La méthode transforme des démonstrations humaines partielles, capturées de façon cinématique lors d'interactions homme-objet, en trajectoires robotiques complètes et physiquement exécutables. Ces trajectoires alimentent ensuite un entraînement par distillation enseignant-élève, qui produit une politique unique convertissant des observations de profondeur en vision égocentrique et des mesures proprioceptives directement en commandes articulaires pour l'ensemble du corps. Une fois déployée, cette politique ne nécessite ni mouvement de référence ni commande intermédiaire. Les auteurs l'ont testée sur des tâches de fermeture de porte, avec des configurations de porte et des positions de départ variées, en simulation puis sur un robot réel Unitree G1, montrant qu'une seule politique suffit à accomplir la tâche uniquement à partir des capteurs embarqués.
Ce travail s'attaque à deux obstacles centraux du secteur : la rareté de données d'interaction robot-objet physiquement réalisables, et la difficulté d'apprendre un contrôle unifié du corps entier à partir des seules observations embarquées, sans capture de mouvement externe ni téléopération lourde. En démontrant un transfert simulation-réel fonctionnel avec un capteur de profondeur et la proprioception seuls, l'étude apporte un contre-exemple concret à l'hypothèse selon laquelle les politiques de loco-manipulation humanoïde exigent nécessairement de vastes jeux de données téléopérées coûteux à constituer. Pour les intégrateurs et décideurs robotique, l'intérêt réside surtout dans la méthode de conversion des démonstrations humaines en données d'entraînement robot exploitables, une piste alternative aux pipelines de collecte par téléopération utilisés par des acteurs comme Figure ou Physical Intelligence.
ViLoMan s'inscrit dans la compétition croissante autour des politiques vision-langage-action et des architectures de contrôle whole-body pour humanoïdes, aux côtés d'approches commerciales comme Helix de Figure, GR00T N2 de Nvidia ou Pi-0 de Physical Intelligence, qui reposent largement sur des données de téléopération à grande échelle. Ici, l'origine académique et le statut anonyme de la soumission signalent une contribution de recherche encore au stade du laboratoire, validée sur une seule tâche restreinte de fermeture de porte plutôt que déployée en conditions industrielles. Les prochaines étapes attendues concernent l'extension à d'autres tâches de manipulation et à des environnements plus variés avant toute perspective de déploiement réel.
Dans nos dossiers




