Aller au contenu principal
RecherchearXiv cs.RO 

HumanoidToolBench : évaluation de l'utilisation d'outils par les robots humanoïdes, du choix à l'exécution mobile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

HumanoidToolBench, un nouveau benchmark publié sur arXiv (2610.02089), vise à évaluer l'usage d'outils par des robots humanoïdes, de la sélection de l'outil jusqu'à l'exécution mobile. Il comprend 18 tâches réparties sur trois scénarios, trois niveaux d'exécution et deux modes de jeu d'outils. Il est accompagné de ToolBook, un jeu de 3 100 démonstrations collectées en simulation et sur un Unitree G1 réel. Les auteurs ont évalué sept politiques en simulation et trois sur le robot physique. Ils ont aussi mené des sondages ciblés sur GR00T N1.7, le modèle fondation de NVIDIA. Le code et les données sont publiés en accès libre sur le site du projet, hébergé par le groupe SNU-PI.

Les résultats montrent un écart important entre choisir un outil adapté et mener la tâche à son terme. Les sondages sur GR00T N1.7 révèlent deux faiblesses. La précision de sélection baisse sur des outils jamais vus à l'entraînement. Le robot continue en outre d'exécuter la tâche initiale lorsqu'on lui donne une instruction sans rapport. Le résumé ne donne ni taux de réussite chiffrés ni détail par politique, ce qui empêche de mesurer l'ampleur exacte de l'écart.

Pour l'industrie, ce travail cible un angle mort. Un humanoïde dépasse ses limites physiques (portée, force, précision) grâce à des outils, et cette capacité conditionne des usages réels en logistique, maintenance ou assemblage. Or les benchmarks existants testent séparément la sélection d'outil, la manipulation ou la locomotion, rarement les trois ensemble sur un humanoïde. Le résultat est un rappel utile pour les intégrateurs: un modèle vision-langage-action (VLA) qui paraît convaincant en démonstration peut échouer dès que l'outil change ou que la consigne dérive. Le second défaut, la persistance de la tâche malgré une instruction étrangère, soulève une question de fiabilité et de sécurité pour tout déploiement au contact d'opérateurs humains.

Le choix du Unitree G1, humanoïde de recherche à prix relativement accessible, répond à une logique de reproductibilité: de nombreux laboratoires peuvent répliquer les expériences. GR00T N1.7 s'inscrit dans la lignée des modèles généralistes de NVIDIA, face à des VLA concurrents comme Pi-0 de Physical Intelligence ou Helix de Figure. Il s'agit ici d'un benchmark académique, sans produit ni déploiement commercial à la clé. Sa valeur dépendra de son adoption par la communauté, qui pourra s'en servir pour comparer des modèles plus récents et mesurer si l'écart entre sélection et exécution se réduit.

À lire aussi

Modèle fondation à l'échelle pour robots humanoïdes
1arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
Évaluation de l'inférence d'affordance sémantique par VLM pour des morphologies robotiques non humanoïdes
2arXiv cs.RO 

Évaluation de l'inférence d'affordance sémantique par VLM pour des morphologies robotiques non humanoïdes

Une équipe de chercheurs publie sur arXiv (2604.19509) une évaluation empirique des modèles vision-langage (VLM) pour l'inférence d'affordances sur des robots à morphologie non humanoïde. L'"affordance" désigne ici la capacité d'un modèle à déterminer quelles actions sont physiquement réalisables par un robot donné face à un objet spécifique. Les auteurs ont constitué un jeu de données hybride combinant des annotations réelles de relations affordance-objet et des scénarios synthétiques générés par VLM, couvrant plusieurs catégories d'objets et plusieurs types de morphologies robotiques. Les résultats montrent une généralisation prometteuse aux formes non humanoïdes, mais des performances très variables selon les domaines d'objets. Le constat central est un schéma systématique de faible taux de faux positifs associé à un fort taux de faux négatifs, révélant que les VLM adoptent des prédictions trop conservatrices. Ce biais est particulièrement prononcé pour les outils inédits et les manipulations non conventionnelles. Pour les intégrateurs qui envisagent d'utiliser les VLM comme couche de planification sémantique, ce résultat est structurellement important. Le biais conservateur offre un avantage de sécurité intrinsèque, les robots n'entreprenant pas d'actions impossibles ou dangereuses, mais le taux élevé de faux négatifs freine l'exploitation réelle : le système refuse des tâches qu'il pourrait pourtant accomplir. Pour un architecte de système ou un COO industriel, cela confirme qu'un VLM seul ne peut pas servir de module d'affordance universel pour des cobots ou des AMR (robots mobiles autonomes) aux morphologies spécifiques. Des couches complémentaires, simulation physique ou vérification cinématique, restent nécessaires pour corriger ce défaut sans sacrifier la sécurité. La recherche sur les affordances VLM s'est construite massivement sur des corpus centrés sur l'interaction humain-objet, laissant les robots non humanoïdes structurellement sous-représentés. Des architectures VLA (Vision-Language-Action) comme pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA ont été évaluées principalement sur des tâches de manipulation humain-like. Cette étude pointe un enjeu distinct pour des plateformes comme Spot de Boston Dynamics ou ANYmal d'ANYbotics, dont les effecteurs et degrés de liberté (DOF) diffèrent fondamentalement de la main humaine. Les auteurs proposent des architectures hybrides et des jeux de données morpho-spécifiques comme prochaines étapes pour réduire le biais conservateur tout en préservant les faibles taux de faux positifs, seul acquis de sécurité clairement démontré.

UELes intégrateurs européens déployant des AMR ou cobots non humanoïdes (ANYmal d'ANYbotics, Spot) doivent anticiper des couches de vérification cinématique complémentaires aux VLM avant tout déploiement autonome en planification sémantique.

RechercheOpinion
1 source
H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde
3arXiv cs.RO 

H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde

Des chercheurs ont publié le 14 août 2026 sur arXiv (2608.13049) un nouveau benchmark baptisé H2R-Bench, conçu pour évaluer la capacité des modèles de génération vidéo à transformer des démonstrations de manipulation humaines filmées à la première personne en vidéos de manipulation robotique correspondant à un embodiment cible. Chaque instance du benchmark associe une vidéo de démonstration humaine, des contraintes d'embodiment robotique, et des annotations ancrées dans la source couvrant les objectifs de tâche, les événements d'action, les contacts fonctionnels et les réactions des objets manipulés. L'évaluation repose sur cinq dimensions : l'atteinte de l'état final visé, la complétude des événements d'action, le transfert des contacts fonctionnels, la cohérence de l'embodiment et la qualité vidéo générale. Les auteurs ont testé onze modèles de génération vidéo de pointe sur six familles de tâches de manipulation et deux embodiments robotiques distincts. Résultat principal : même les modèles les plus performants échouent souvent sur la cohérence d'embodiment, l'interaction fonctionnelle avec les objets et l'exécution correcte de la tâche. Ce constat touche un point sensible de l'apprentissage robotique : la collecte de démonstrations réelles sur robot reste coûteuse et difficile à faire monter en échelle, alors que les vidéos humaines égocentriques sont abondantes et bon marché. Convertir ces vidéos humaines en données d'entraînement robot-centriques via des modèles de monde vidéo est envisagé depuis plusieurs mois comme une voie pour contourner ce goulot d'étranglement, notamment pour entraîner des politiques VLA. H2R-Bench montre que cette promesse reste largement non tenue en pratique : la différence morphologique entre mains humaines et effecteurs robotiques continue de casser la cohérence physique des vidéos générées. Pour les intégrateurs et laboratoires qui envisagent la génération vidéo synthétique comme substitut à la téléopération, ce résultat invite à la prudence sur la maturité réelle de cette approche. Le travail s'inscrit dans la vague plus large des modèles de monde vidéo appliqués à la robotique, où la génération vidéo sert de plus en plus de brique de simulation ou de source de données synthétiques. Jusqu'ici, l'évaluation de ces modèles se limitait souvent à la qualité visuelle brute, sans mesurer si la vidéo générée respecte les contraintes physiques et fonctionnelles d'un robot donné. H2R-Bench comble ce vide avec un cadre diagnostique systématique et réutilisable pour les futurs modèles. Il ne s'agit pas d'une annonce produit ni d'un partenariat industriel, mais d'un travail de recherche évaluative destiné à orienter la prochaine génération de modèles capables de combler l'écart d'embodiment entre humains et robots.

RecherchePaper
1 source
MobileOcc : un jeu de données d'occupation sémantique sensible à l'humain pour robots mobiles
4arXiv cs.RO 

MobileOcc : un jeu de données d'occupation sémantique sensible à l'humain pour robots mobiles

Une équipe de recherche publie MobileOcc, un jeu de données d'occupation sémantique 3D pour robots mobiles opérant en environnements piétons denses, un scénario peu couvert comparativement à la conduite autonome. L'article, référencé arXiv 2511.16949, décrit un pipeline d'annotation combinant occupation d'objets statiques et un nouveau cadre d'optimisation de maillage pour les humains : leur géométrie déformable est reconstruite à partir d'images 2D puis affinée avec des points LiDAR associés. Le jeu de données alimente deux benchmarks, la prédiction d'occupation et la prédiction de vitesse des piétons, testés avec des méthodes monoculaires, stéréo et panoptiques dotées de métriques et d'implémentations de référence reproductibles. La méthode d'annotation est aussi validée sur des jeux de données d'estimation de pose humaine 3D, avec des résultats jugés robustes ; le code et les données sont publiés sur autonomousrobots.nl. La perception d'occupation dense est une brique critique pour la navigation sécurisée des robots mobiles au contact d'humains, en entrepôt, en hôpital ou en espace public, où anticiper position et mouvement d'un piéton conditionne l'évitement de collision. La plupart des jeux de données d'occupation 3D existants visaient l'automobile, avec des scènes routières peu représentatives des couloirs et halls parcourus par les robots de service. Modéliser les humains comme des objets déformables plutôt que comme de simples boîtes englobantes, et publier des baselines multi-capteurs reproductibles, comble un manque de standardisation qui facilitera la comparaison des systèmes de perception chez les intégrateurs. Ce travail s'inscrit dans une tendance de transfert des techniques de perception nées pour la conduite autonome vers la robotique mobile et humanoïde, à mesure que LiDAR et architectures d'occupation 3D se banalisent. MobileOcc reste un jeu de données et un protocole d'évaluation académiques, sans déploiement industriel annoncé, et il s'agit d'une version corrigée de la publication initiale sur arXiv. L'ouverture du code et des données vise à établir une référence que d'autres laboratoires pourront reprendre pour comparer leurs modèles de perception en environnement piéton, chantier ouvert tant pour la recherche que pour de futurs usages commerciaux en robotique de service.

RecherchePaper
1 source