Aller au contenu principal
RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné
RecherchearXiv cs.RO 

RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La robotique humanoïde et manipulatrice s'appuie de plus en plus sur une architecture a deux niveaux: un "System 1" qui gère le contrôle moteur bas niveau et un "System 2", le cerveau incarne, charge du raisonnement et de la prise de décision. Un article mis a jour sur arXiv présente RoboBench, un benchmark conçu pour évaluer spécifiquement ce cerveau incarne lorsqu'il est implémenté par un modèle multimodal de grande taille (MLLM). Le benchmark couvre cinq dimensions: compréhension des instructions, raisonnement perceptif, planification généralisée, prédiction d'affordances et analyse d'échecs, reparties en 14 capacités, 25 taches et 6 092 paires question réponse. Les données combinent des jeux de données robotiques réels a grande échelle et des collectes internes couvrant plusieurs types de robots, des objets aux attributs varies, des scenes multi vues et des taches de navigation dépendantes de la mémoire. Dix huit MLLMs de pointe ont été testes sur ce benchmark.

L'enjeu dépasse la simple mesure de performance: la plupart des benchmarks existants évaluent surtout le succès final d'exécution, sans isoler la qualité du raisonnement de haut niveau qui précède l'action, ni la réalité des taches proposées. RoboBench cherche a combler cet écart en testant directement si un modèle comprend une consigne implicite, raisonne correctement sur l'espace et le temps, ou diagnostique un échec, indépendamment de la couche de contrôle moteur. Les résultats montrent des limites persistantes sur la compréhension d'instructions implicites, le raisonnement spatio-temporel, la planification inter scenarios, la compréhension fine des affordances et le diagnostic d'échecs, ce qui questionne la maturité réelle des MLLMs actuels comme cerveaux de robots, au delà des démonstrations souvent mises en avant par les laboratoires.

Pour l'évaluation de la planification, les auteurs introduisent un cadre inédit dit "MLLM comme simulateur du monde", qui vérifie si un plan prédit peut effectivement produire les changements d'état critiques d'un objet sous contraintes physiques et visuelles, plutôt que de se contenter d'un simple appariement symbolique avec un plan de référence. Cette approche vise une évaluation plus fidèle du raisonnement a long horizon. Les chercheurs analysent également le lien entre ces capacités cognitives incarnées et la performance réelle en contrôle robotique, positionnant RoboBench comme un outil de référence pour orienter la prochaine génération de MLLMs vers une intelligence robotique plus robuste.

Dans nos dossiers

À lire aussi

RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique
1arXiv cs.RO 

RoboWM-Bench : un benchmark pour évaluer les modèles du monde en manipulation robotique

Une équipe de chercheurs a déposé sur arXiv (identifiant 2604.19092) RoboWM-Bench, un benchmark dédié à l'évaluation des world models vidéo pour la manipulation robotique. Le protocole est exigeant : les comportements générés par ces modèles, à partir de vidéos de mains humaines ou de robots en action, sont convertis en séquences d'actions exécutables, puis validés par exécution réelle sur robot physique. Les évaluations conduites sur les meilleurs world models actuels sont sans appel : produire des comportements physiquement exécutables de manière fiable reste un problème ouvert. Les modes d'échec récurrents identifiés incluent les erreurs de raisonnement spatial, la prédiction instable des contacts entre effecteur et objet, et les déformations non physiques de matériaux. Un fine-tuning sur données de manipulation améliore les résultats, mais les incohérences physiques persistent. Ce constat soulève une question stratégique pour l'industrie : peut-on utiliser des world models comme simulateurs bon marché pour générer des données d'entraînement, en remplacement des démonstrations terrain coûteuses ? Le réalisme visuel d'une vidéo générée ne garantit pas sa plausibilité physique, une distinction que les benchmarks existants, majoritairement orientés perception ou diagnostic, ne permettaient pas de mesurer. En imposant la validation par exécution réelle comme critère central, RoboWM-Bench dépasse les métriques habituelles de cohérence temporelle ou de FID. Pour les équipes engineering et les intégrateurs, la conclusion est opérationnelle : les world models actuels ne sont pas encore substituables aux démonstrations réelles pour l'apprentissage de politiques de manipulation précise. L'intérêt pour les world models en robotique s'est intensifié depuis 2024, porté par des modèles génératifs comme Sora (OpenAI), Genie 2 (Google DeepMind) ou UniSim, et alimenté par les avancées des VLA (Vision-Language-Action). L'hypothèse qu'un monde simulé pourrait tenir lieu de terrain d'entraînement, évitant la collecte de données réelles, est au coeur des investissements d'une dizaine de startups et labos académiques actifs sur ce créneau. RoboWM-Bench s'inscrit dans une dynamique de standardisation comparable à ce que RoboMimic ou MetaWorld ont établi pour l'imitation learning : un protocole unifié et reproductible. Aucune affiliation institutionnelle ni timeline d'extension du benchmark ne figurent dans le preprint, ce qui en limite la portée immédiate, mais la publication envoie un signal net : la communauté robotique commence à exiger des preuves d'exécutabilité physique, et non plus seulement de cohérence visuelle.

RecherchePaper
1 source
Les modèles du monde rendent-ils les robots meilleurs ? Un panorama des benchmarks d'évaluation pour l'IA incarnée prédictive
2arXiv cs.RO 

Les modèles du monde rendent-ils les robots meilleurs ? Un panorama des benchmarks d'évaluation pour l'IA incarnée prédictive

Une synthèse déposée sur arXiv fin septembre 2026 recense et vérifie une par une 160 benchmarks d'évaluation robotique publiés entre 2017 et 2026, dans le but de déterminer si les modèles du monde (world models), qui prédisent les observations futures, offrent un avantage mesurable en boucle fermée face aux politiques vision-langage-action (VLA), qui associent directement l'observation à l'action. Les 160 bancs d'essai sont répartis en quatre familles : suites d'évaluation de politiques, agents incarnés, évaluation pure des world models, et ponts prédiction-vers-action. Le bilan chiffré est net : 138 benchmarks sur 160, soit 86%, restent agnostiques au type de modèle, 11 seulement (7%) construisent une comparaison explicite VLA contre world model, et 4 seulement transforment une prédiction en action réellement exécutée sur un robot. La capacité contrefactuelle, c'est-à-dire anticiper ce qui se passerait sous une action alternative, n'est quasiment jamais mesurée dans l'ensemble du corpus étudié. Ce travail met en lumière un angle mort structurel du secteur : il est aujourd'hui impossible de trancher, preuves à l'appui, si entraîner un robot à prédire l'avenir améliore réellement ses performances en boucle fermée par rapport à une politique VLA directe. Les benchmarks de world models jugent la qualité de la prédiction sans jamais l'exécuter, tandis que les suites de succès de tâche n'hébergent qu'une seule politique à la fois et ne construisent jamais ce contraste. Pour les intégrateurs et décideurs qui arbitrent entre paradigmes de recherche et priorités d'investissement, la leçon est de rester prudent face aux annonces autour des world models : générer des vidéos futures convaincantes ne prouve aucun gain réel de succès de tâche en conditions réelles, faute de protocole capable d'isoler cet avantage. Ce fossé méthodologique vient du fait que les deux courants de recherche se sont développés en parallèle sans jamais vraiment se confronter, les politiques VLA étant jugées en boucle fermée sur le taux de réussite de tâches concrètes, les modèles du monde en boucle ouverte sur la seule qualité de leurs prédictions ou générations. Face à ce vide, les auteurs comparent leur couverture à celle des huit enquêtes les plus proches déjà publiées et revendiquent être les seuls à croiser capacité robotique et famille de modèle. Ils proposent une taxonomie opérationnelle des 160 bancs d'essai, une boucle d'évaluation conçue pour isoler spécifiquement l'avantage de la prédiction, et un protocole de quatre métriques ancrées sur des bancs d'essai nommés. Leur conclusion n'est pas que les world models aident ou non les robots, mais que répondre à cette question exige de construire des benchmarks conçus spécifiquement pour la poser.

RecherchePaper
1 source
Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences
3arXiv cs.RO 

Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences

Une équipe de chercheurs a publié BEAR (Benchmark for Embodied Abilities and Reasoning), un cadre d'évaluation qui décompose les tâches robotiques en 14 compétences atomiques pour diagnostiquer les failles des grands modèles de langage multimodaux (MLLMs) embarqués. Le benchmark regroupe 4 469 échantillons entrelacés image-vidéo-texte couvrant 6 catégories, de la perception bas niveau jusqu'à la planification de haut niveau. Soumis à 20 MLLMs dont GPT-5, il révèle deux résultats principaux : les capacités perceptuelles constituent le principal goulot d'étranglement derrière les échecs de raisonnement, et les modèles présentent une modélisation spatiotemporelle instable qui restait invisible dans les benchmarks précédents. En réponse, les auteurs proposent BEAR-Agent, un agent multimodal augmenté d'outils de raisonnement visuel et spatial, qui obtient une amélioration relative de 17,5 % sur GPT-5 par rapport au modèle de base, avec des gains confirmés en simulation et en robotique réelle. L'intérêt de ce travail tient à la granularité du diagnostic. Les benchmarks existants mesurent si un agent réussit une tâche sans expliquer pourquoi. BEAR révèle que les modèles n'échouent pas d'abord sur le raisonnement abstrait, mais sur la perception : identifier des objets dans une scène, interpréter une séquence vidéo, localiser un élément dans l'espace. Ce résultat contredit l'hypothèse répandue selon laquelle les LLMs auraient comblé le déficit de compréhension scénique grâce à leur préentraînement massif. La découverte sur l'instabilité spatiotemporelle est particulièrement significative pour les intégrateurs déployant des VLA (Vision-Language-Action models) en environnement industriel : elle suggère que les performances observées en démonstration vidéo curatée ne reflètent pas la fiabilité opérationnelle réelle. Ce preprint arXiv (version 2, 2025) s'inscrit dans un effort plus large pour structurer l'évaluation des agents embarqués, là où des benchmarks comme EgoSchema ou OpenEQA traitent la compréhension incarnée sans diagnostiquer les sous-compétences. BEAR se distingue par ses expériences en environnements robotiques réels, contrairement aux approches purement simulées comme EmbodiedScan. Aucun acteur français ou européen n'est directement impliqué dans cette publication académique, qui émane vraisemblablement d'équipes universitaires asiatiques ou nord-américaines au vu de la page projet associée. La prochaine étape logique serait l'adoption de BEAR comme protocole standard dans les pipelines d'évaluation VLA avant tout déploiement physique.

RecherchePaper
1 source
CoCoBench : un benchmark de coordination coopérative pour la planification de tâches multi-agents incarnés
4arXiv cs.RO 

CoCoBench : un benchmark de coordination coopérative pour la planification de tâches multi-agents incarnés

Des chercheurs ont présenté CoCoBench, un benchmark conçu pour évaluer la coordination entre agents dans des tâches domestiques exécutables pilotées par des modèles de langage multimodaux (MLLM). L'ensemble comprend 897 instances validées par un oracle, organisées autour de quatre constructions récurrentes de coordination : l'allocation des tâches, l'ordonnancement séquentiel, l'exclusion mutuelle et la coordination des transferts (handoff) entre agents. Au-delà du taux de réussite global des tâches, CoCoBench introduit des scores par construction, qui mesurent précisément si les agents coordonnent effectivement leurs actions plutôt que de simplement atteindre l'objectif final. Les auteurs ont évalué 11 MLLM de premier plan selon différents modes de coordination, types d'observations et nombres d'agents engagés. Le papier a été publié sur arXiv fin août 2026 et s'inscrit dans le champ des agents incarnés multi-robots pour l'environnement domestique. L'apport principal de ce travail est de démontrer que les benchmarks existants, qui résument la performance multi-agent à un simple taux de réussite global, masquent des défaillances de coordination bien réelles : travail dupliqué entre agents, violations des contraintes d'ordre, conflits d'accès aux ressources partagées et désynchronisation lors des transferts de tâches. Les résultats montrent que la capacité de coordination est fortement spécifique à chaque construction : un modèle affichant un bon score global peut échouer nettement sur un type précis de coordination, comme l'exclusion mutuelle, tout en excellant sur un autre. Ce constat contredit l'hypothèse implicite de nombreux acteurs du secteur selon laquelle un haut taux de succès agrégé traduit une compétence de coordination équilibrée. Pour les intégrateurs et décideurs qui envisagent des flottes de robots collaboratifs pilotés par des architectures VLA ou MLLM, ce diagnostic granulaire signale que les métriques usuelles ne suffisent pas à qualifier la fiabilité opérationnelle en environnement partagé. Ce travail s'inscrit dans la progression rapide des systèmes d'agents fondés sur les MLLM ces dernières années, un domaine où l'évaluation a longtemps privilégié soit l'accomplissement de tâches par un agent unique, soit des métriques agrégées peu diagnostiques pour les scénarios multi-agents. CoCoBench cherche à combler ce vide en proposant une évaluation au niveau des mécanismes de coordination eux-mêmes plutôt que du seul résultat final. Les auteurs positionnent leurs conclusions comme une piste concrète pour orienter la conception de futures architectures de modèles et améliorer spécifiquement les capacités de coordination multi-agent, plutôt que d'optimiser uniquement le taux de réussite agrégé. Aucun calendrier de déploiement industriel ni partenariat commercial n'est mentionné : il s'agit à ce stade d'une contribution de recherche et d'un outil de benchmark, destiné à la communauté académique et aux équipes développant des systèmes multi-robots embodied.

RecherchePaper
1 source