FetchMan : politiques de loco-manipulation humanoïde visuelle apprises par simulation
Une équipe de chercheurs publie sur arXiv (2608.17027v1, août 2026) FetchMan, un système d'apprentissage de politiques de loco-manipulation humanoïde entraîné entièrement en simulation avant transfert vers le réel. Le pipeline combine plus de 150 000 scènes simulées, un clonage comportemental initial suivi d'un affinage par apprentissage par renforcement via une méthode appelée Flow-GRPO, appliquée sur une récompense unique et éparse. Les chercheurs déploient la politique en zero-shot, sans aucune donnée réelle, sur un robot humanoïde Unitree G1 : la tâche consiste à marcher vers un objet cible puis à le saisir dans des scènes jamais vues à l'entraînement, avec un taux de réussite de 73,3% sur des scénarios à objet unique. L'équipe publie également FetchMan-Bench, un benchmark de simulation destiné à évaluer ce type de politiques, et présente une première extension vers l'entraînement multi-objets.
Le résultat le plus significatif pour le secteur n'est pas le taux de succès en lui-même, mais le constat méthodologique : le clonage de démonstrations synthétiques, quelle que soit la quantité de données injectée, plafonne à des performances limitées et ne peut être compensé par plus de volume. Seul l'ajout d'apprentissage par renforcement permet de dépasser ce plafond. Cette observation nuance l'hypothèse largement répandue chez les fournisseurs de politiques génératives type VLA (vision-langage-action) selon laquelle la mise à l'échelle des données de démonstration suffit à elle seule à améliorer la généralisation. Pour les intégrateurs et décideurs qui évaluent des piles logicielles pour humanoïdes, cela suggère qu'une phase de fine-tuning par renforcement en simulation, et non uniquement plus de données d'imitation, reste nécessaire pour atteindre une manipulation robuste face à des scènes inédites.
Le sim-to-real est déjà la norme pour la locomotion humanoïde, mais son extension à la manipulation mobile combinant marche, équilibre et préhension restait un point de friction, faute de données réelles suffisantes pour ces séquences complexes. FetchMan s'inscrit dans un paysage concurrentiel où plusieurs laboratoires développent des politiques génératives concurrentes, dont Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, généralement entraînées avec des volumes massifs de démonstrations réelles ou synthétiques. En choisissant le Unitree G1 comme plateforme de test et en publiant son benchmark, l'équipe pose une première étape vers des politiques généralistes de loco-manipulation capables de gérer plusieurs objets, avec pour prochaine étape annoncée l'élargissement de l'entraînement multi-objets à plus grande échelle.
Dans nos dossiers




