BiGym 2.0 : évaluation de politiques apprises et développées par des agents pour la manipulation domestique humanoïde
BiGym 2.0, publié sur arXiv (2610.07594) par l'équipe derrière le dépôt swirl-uk/BiGym2, adapte le benchmark de manipulation bimanuelle BiGym au robot humanoïde Unitree G1. La suite couvre 20 tâches domestiques, toutes pilotées par un contrôleur whole-body unifié, utilisé aussi bien pour la collecte de démonstrations que pour l'évaluation. Chaque tâche fournit 60 démonstrations humaines natives, enregistrées en réalité virtuelle, avec vues multi-caméras synchronisées et traces d'exécution du corps entier. Quatre familles de méthodes sont comparées, avec les mêmes vues embarquées, la même proprioception et le même contrôleur : fine-tuning de modèles vision-langage-action (VLA), apprentissage par imitation, apprentissage par renforcement guidé par démonstrations, et agents de codage partant de zéro, auxquels on accorde le budget d'interactions d'un apprentissage par renforcement en ligne. Environnements, démonstrations et traces d'évaluation sont publiés en open source.
Sur la moyenne de neuf tâches retenues pour la comparaison, le fine-tuning de VLA obtient le meilleur score. Les programmes écrits par des agents de codage dépassent toutefois toutes les bases de référence d'apprentissage par renforcement guidé par démonstrations sur cette même moyenne, et dominent sur l'atteinte bimanuelle. Les limites restent nettes : l'empilement entre espaces de travail distincts n'est pas résolu, π0.5 reste faible sur la tâche pick-box, et le transport multi-objets pénalise l'imitation, le renforcement guidé et les agents de codage.
L'intérêt est double pour les intégrateurs et les équipes de recherche. D'une part, le résultat tempère l'idée d'une manipulation domestique humanoïde déjà acquise : quand le bras doit agir pendant que le corps s'équilibre, fait un pas ou change de posture, les tâches longues et à plusieurs objets restent hors de portée des méthodes actuelles, y compris des VLA. D'autre part, la performance des programmes générés par agents, sans démonstrations, suggère une voie concurrente de l'apprentissage de politiques, à surveiller. Le fait que toutes les méthodes partagent observations et contrôleur rend la comparaison plus lisible que les démonstrations isolées, mais il s'agit de simulation : le transfert vers le matériel réel n'est pas évalué ici, et les scores détaillés ne figurent pas dans le résumé.
BiGym, introduit initialement pour la manipulation mobile bimanuelle sur un robot à base roulante, sert de référence aux travaux sur les VLA et l'imitation. Le passage au G1, plateforme humanoïde accessible largement diffusée en recherche, rapproche le benchmark des modèles de la famille π0.5 de Physical Intelligence, déjà évalués ici. Les suites possibles tiennent à l'ouverture des données : d'autres laboratoires pourront y confronter leurs VLA ou leurs agents de codage, et l'écart sur l'empilement et le transport multi-objets servira de cible aux prochains travaux.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




