HumanoidToolBench : évaluation de l'utilisation d'outils par les robots humanoïdes, du choix à l'exécution mobile
HumanoidToolBench, un nouveau benchmark publié sur arXiv (2610.02089), vise à évaluer l'usage d'outils par des robots humanoïdes, de la sélection de l'outil jusqu'à l'exécution mobile. Il comprend 18 tâches réparties sur trois scénarios, trois niveaux d'exécution et deux modes de jeu d'outils. Il est accompagné de ToolBook, un jeu de 3 100 démonstrations collectées en simulation et sur un Unitree G1 réel. Les auteurs ont évalué sept politiques en simulation et trois sur le robot physique. Ils ont aussi mené des sondages ciblés sur GR00T N1.7, le modèle fondation de NVIDIA. Le code et les données sont publiés en accès libre sur le site du projet, hébergé par le groupe SNU-PI.
Les résultats montrent un écart important entre choisir un outil adapté et mener la tâche à son terme. Les sondages sur GR00T N1.7 révèlent deux faiblesses. La précision de sélection baisse sur des outils jamais vus à l'entraînement. Le robot continue en outre d'exécuter la tâche initiale lorsqu'on lui donne une instruction sans rapport. Le résumé ne donne ni taux de réussite chiffrés ni détail par politique, ce qui empêche de mesurer l'ampleur exacte de l'écart.
Pour l'industrie, ce travail cible un angle mort. Un humanoïde dépasse ses limites physiques (portée, force, précision) grâce à des outils, et cette capacité conditionne des usages réels en logistique, maintenance ou assemblage. Or les benchmarks existants testent séparément la sélection d'outil, la manipulation ou la locomotion, rarement les trois ensemble sur un humanoïde. Le résultat est un rappel utile pour les intégrateurs: un modèle vision-langage-action (VLA) qui paraît convaincant en démonstration peut échouer dès que l'outil change ou que la consigne dérive. Le second défaut, la persistance de la tâche malgré une instruction étrangère, soulève une question de fiabilité et de sécurité pour tout déploiement au contact d'opérateurs humains.
Le choix du Unitree G1, humanoïde de recherche à prix relativement accessible, répond à une logique de reproductibilité: de nombreux laboratoires peuvent répliquer les expériences. GR00T N1.7 s'inscrit dans la lignée des modèles généralistes de NVIDIA, face à des VLA concurrents comme Pi-0 de Physical Intelligence ou Helix de Figure. Il s'agit ici d'un benchmark académique, sans produit ni déploiement commercial à la clé. Sa valeur dépendra de son adoption par la communauté, qui pourra s'en servir pour comparer des modèles plus récents et mesurer si l'écart entre sélection et exécution se réduit.
Dans nos dossiers




