Aller au contenu principal
RecherchearXiv cs.RO 

H2RBench : un benchmark réel-vers-simulation pour évaluer le transfert humain-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent H2RBench, un benchmark Real2Sim (réel vers simulation) destine a évaluer les méthodes de transfert humain-vers-robot (H2R), publie sur arXiv le 22 septembre 2026 sous la référence 2609.24778. Le problème vise est méthodologique: apprendre des politiques de manipulation a partir de vidéos de démonstrations humaines est une piste prometteuse pour l'apprentissage robotique a grande échelle, mais les méthodes existantes sont évaluées dans des conditions disparates, taches, scènes, objets et niveaux de supervision robotique différents, rendant toute comparaison rigoureuse impossible. H2RBench standardise ce protocole en combinant vidéos humaines réelles et démonstrations robotiques simulées sur quatre taches de manipulation aux exigences variées. Plusieurs méthodes représentatives, chacune avec sa stratégie propre pour combler l'écart d'incarnation entre humain et robot, y sont comparées. Resultat central: la performance simulée prédit fortement la performance réelle, avec une corrélation de Pearson de 0,89, une corrélation de Spearman de 0,85 et une violation de rang maximale moyenne (MMRV) de 0,06.

Pour l'industrie robotique, ce travail comble un vide méthodologique: sans étalon commun, impossible de savoir quelle stratégie d'apprentissage par vidéo humaine généralisé le mieux avant un déploiement couteux sur robot réel. En montrant que le classement des méthodes en simulation reproduit fidèlement leur classement réel, H2RBench autorise une phase de sélection quasi entièrement simulée, réduisant le temps et le cout des essais physiques pour les intégrateurs. L'étude montre aussi que les méthodes ne tirent pas toutes parti également de données humaines supplémentaires: certaines scalent bien avec davantage de vidéos, d'autres plafonnent vite, une distinction directement utile pour prioriser les investissements en collecte de données.

Ce travail s'inscrit dans une tendance de la recherche en robotique visant a remplacer la téléopération, lente et couteuse a collecter, par des corpus de vidéos humaines abondantes, une direction suivie par les laboratoires développant des modèles généralistes vision-langage-action. Le champ du transfert H2R restait toutefois fragmente, chaque équipe publiant ses résultats sur des bancs d'essai maison non comparables entre eux. L'article ne mentionne ni partenaire industriel ni calendrier de publication du code ou des données, ce qui en fait une contribution académique plutôt qu'un outil prêt a l'emploi pour les intégrateurs.

À lire aussi

Vers une simulation visuellement réaliste : un benchmark pour évaluer la manipulation robotique en simulation
1arXiv cs.RO 

Vers une simulation visuellement réaliste : un benchmark pour évaluer la manipulation robotique en simulation

Une équipe de recherche a publié le 9 mai 2026 un nouveau benchmark de simulation dédié à l'évaluation des politiques de manipulation robotique, sous le nom VISER (Visually Realistic Simulation for Robot Manipulation Evaluation). Le système repose sur une bibliothèque de plus de 1 000 assets 3D équipés de matériaux PBR (Physically-Based Rendering), intégrés dans des scènes générées automatiquement. Pour constituer cette base à grande échelle, les auteurs ont développé un pipeline automatisé combinant des modèles de langage multimodaux (MLLMs) pour la segmentation des pièces et la récupération des matériaux. Les tâches d'évaluation couvrent la saisie, le placement et des séquences longue durée (long-horizon tasks), permettant de tester des modèles Vision-Language-Action (VLA) dans des conditions reproductibles. Résultat clé : un coefficient de corrélation de Pearson moyen de 0,92 entre les performances en simulation et les performances réelles, mesuré sur plusieurs politiques distinctes. Ce score de 0,92 est le chiffre le plus structurant de la publication. La grande majorité des benchmarks existants génèrent un écart domaine (domain gap) significatif parce qu'ils négligent deux variables décisives : l'éclairage et les propriétés de matériaux. VISER montre expérimentalement que ces deux facteurs pèsent directement sur le raisonnement géométrique et l'ancrage spatial des modèles VLA, deux capacités centrales pour toute manipulation physique fiable. Pour les équipes qui développent des politiques robotiques, un proxy simulation fiable à 0,92 réduit massivement le coût et le temps des cycles d'itération réel, notamment pour des architectures VLA dont le fine-tuning reste coûteux en déploiement physique. Le problème du sim-to-real gap structure la robotique de manipulation depuis plus d'une décennie. Les benchmarks de référence comme RLBench ou MetaWorld sont largement utilisés mais construits sur des rendus bas fidélité qui limitent leur valeur prédictive pour les approches VLA modernes, dont pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. VISER positionne explicitement ses actifs PBR comme une réponse à cette insuffisance, en automatisant la génération via MLLMs pour éviter le goulot d'artisanat manuel qui freinait les benchmarks précédents. La prochaine étape naturelle sera de mesurer si cette corrélation de 0,92 tient sur des robots à morphologies variées et des scénarios de manipulation industrielle hors laboratoire.

RechercheOpinion
1 source
RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes
2arXiv cs.RO 

RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes

Une équipe de chercheurs présente RoboDojo, un banc d'essai unifié combinant simulation et monde réel pour évaluer les politiques génératives de manipulation robotique, celles capables d'exécuter des tâches variées à partir d'instructions en langage naturel. Le système comprend 42 tâches en simulation et 18 tâches en conditions réelles, couvrant des capacités complémentaires. Le volet simulation mesure cinq dimensions : la généralisation, la mémoire, la précision, l'exécution de tâches longues, et la compréhension d'instructions en vocabulaire ouvert. Le volet réel expose les politiques aux difficultés concrètes du déploiement physique. La plateforme s'appuie sur Isaac Sim pour la simulation parallèle à grande échelle, et sur RoboDojo-RealEval, un système d'évaluation réelle accessible à distance via le cloud, avec matériel standardisé, réinitialisation automatisée des scènes et protocole reproductible. Trente politiques ont été intégrées via XPolicyLab et testées sur ce banc d'essai, donnant lieu à un classement public consultable sur robodojo-benchmark.com. L'initiative répond à un problème structurel du secteur : la prolifération de politiques génératives de manipulation (VLA) ces deux dernières années s'est faite sans étalon de mesure commun, chaque laboratoire publiant ses propres métriques sur ses propres tâches. Les évaluations en simulation seule ignorent les aléas physiques du réel (éclairage, frottements, imprécisions de préhension), tandis que les tests réels restent coûteux, lents et rarement reproductibles d'un labo à l'autre. En forçant une comparaison directe entre simulation et déploiement physique sur les mêmes politiques, RoboDojo permet de quantifier l'écart entre performance démontrée et robustesse réelle, un point sensible pour tout intégrateur ou décideur industriel cherchant à choisir une politique de contrôle avant un déploiement en usine ou en entrepôt. Le projet s'inscrit dans une dynamique où plusieurs équipes de recherche ont développé des systèmes de contrôle génératifs concurrents sans cadre d'évaluation partagé. En proposant à la fois l'infrastructure logicielle (XPolicyLab) et le protocole de test standardisé, RoboDojo vise à devenir une référence commune, avec un classement public appelé à s'enrichir au fur et à mesure que de nouvelles politiques y seront soumises.

RecherchePaper
1 source
RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique
3arXiv cs.RO 

RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique

Une équipe de chercheurs a déposé sur arXiv (identifiant 2604.19092) RoboWM-Bench, un benchmark dédié à l'évaluation des world models vidéo pour la manipulation robotique. Le protocole est exigeant : les comportements générés par ces modèles, à partir de vidéos de mains humaines ou de robots en action, sont convertis en séquences d'actions exécutables, puis validés par exécution réelle sur robot physique. Les évaluations conduites sur les meilleurs world models actuels sont sans appel : produire des comportements physiquement exécutables de manière fiable reste un problème ouvert. Les modes d'échec récurrents identifiés incluent les erreurs de raisonnement spatial, la prédiction instable des contacts entre effecteur et objet, et les déformations non physiques de matériaux. Un fine-tuning sur données de manipulation améliore les résultats, mais les incohérences physiques persistent. Ce constat soulève une question stratégique pour l'industrie : peut-on utiliser des world models comme simulateurs bon marché pour générer des données d'entraînement, en remplacement des démonstrations terrain coûteuses ? Le réalisme visuel d'une vidéo générée ne garantit pas sa plausibilité physique, une distinction que les benchmarks existants, majoritairement orientés perception ou diagnostic, ne permettaient pas de mesurer. En imposant la validation par exécution réelle comme critère central, RoboWM-Bench dépasse les métriques habituelles de cohérence temporelle ou de FID. Pour les équipes engineering et les intégrateurs, la conclusion est opérationnelle : les world models actuels ne sont pas encore substituables aux démonstrations réelles pour l'apprentissage de politiques de manipulation précise. L'intérêt pour les world models en robotique s'est intensifié depuis 2024, porté par des modèles génératifs comme Sora (OpenAI), Genie 2 (Google DeepMind) ou UniSim, et alimenté par les avancées des VLA (Vision-Language-Action). L'hypothèse qu'un monde simulé pourrait tenir lieu de terrain d'entraînement, évitant la collecte de données réelles, est au coeur des investissements d'une dizaine de startups et labos académiques actifs sur ce créneau. RoboWM-Bench s'inscrit dans une dynamique de standardisation comparable à ce que RoboMimic ou MetaWorld ont établi pour l'imitation learning : un protocole unifié et reproductible. Aucune affiliation institutionnelle ni timeline d'extension du benchmark ne figurent dans le preprint, ce qui en limite la portée immédiate, mais la publication envoie un signal net : la communauté robotique commence à exiger des preuves d'exécutabilité physique, et non plus seulement de cohérence visuelle.

RecherchePaper
1 source
Vers un pont entre simulation et réalité : transfert simulation-réel systématique pour divers robots à pattes
4arXiv cs.RO 

Vers un pont entre simulation et réalité : transfert simulation-réel systématique pour divers robots à pattes

Des chercheurs publient sur arXiv (2509.06342v2, version révisée) un nouveau cadre combinant apprentissage par renforcement sim-to-real et modèle énergétique physique pour moteurs synchrones à aimants permanents, les actionneurs les plus courants sur les robots à pattes. La méthode ne nécessite qu'un jeu minimal de paramètres pour capturer l'écart entre simulation et réalité, et repose sur une fonction de récompense compacte à quatre termes intégrant une formulation de pertes énergétiques fondée sur les premiers principes, équilibrant dissipation électrique et mécanique. L'équipe valide son approche par une identification dynamique ascendante, des actionneurs individuels aux trajectoires complètes en l'air puis à la locomotion au sol. Le cadre est testé sur trois plateformes principales et déployé sur dix robots supplémentaires, soit treize systèmes au total, avec un transfert de politique fiable obtenu sans randomisation des paramètres dynamiques. Résultat clé : une réduction de 32% du coût de transport (Cost of Transport) du quadrupède ANYmal, ramené à une valeur de 1,27. Code, modèles et jeux de données sont publiés en accès libre. Ce travail s'attaque à deux limites récurrentes de la robotique à pattes entraînée en simulation : le transfert peu fiable vers le matériel réel, et la négligence quasi systématique des pertes énergétiques spécifiques aux actionneurs dans les fonctions de récompense, souvent bricolées à la main. En montrant qu'une modélisation physique du moteur peut remplacer une partie de la randomisation de domaine habituellement jugée indispensable pour généraliser, l'étude questionne une hypothèse répandue du secteur : que la robustesse sim-to-real passe nécessairement par une randomisation massive des paramètres. Pour les intégrateurs et équipes R&D travaillant sur des robots mobiles à pattes, l'efficacité énergétique conditionne directement l'autonomie en batterie et la charge utile disponible, ce qui rend ce gain de 32% concrètement exploitable au-delà du seul intérêt académique. Le problème du fossé sim-to-real occupe la recherche en locomotion par apprentissage depuis l'essor des quadrupèdes comme l'ANYmal d'ANYbotics, plateforme de référence académique pour ce type de benchmark. La plupart des approches existantes traitent les pertes énergétiques comme un ajout secondaire plutôt qu'une contrainte physique de premier ordre dès l'entraînement. En publiant intégralement code, modèles et données avec cette version révisée, les auteurs positionnent leur contribution comme reproductible pour les laboratoires et industriels développant des plateformes à actionneurs PMSM, sans qu'aucun déploiement commercial ne soit annoncé à ce stade : il s'agit d'une avancée de recherche, dont l'adoption dépendra désormais de son intégration dans les pipelines d'entraînement d'autres équipes robotique.

UELe code, les modèles et les jeux de données étant publiés en accès libre, les laboratoires et industriels européens travaillant sur des robots à pattes à actionneurs PMSM (dont ANYbotics, dont le quadrupède ANYmal sert de plateforme de référence) peuvent directement reproduire et intégrer cette méthode.

RecherchePaper
1 source