Aller au contenu principal
Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences
RecherchearXiv cs.RO 

Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié BEAR (Benchmark for Embodied Abilities and Reasoning), un cadre d'évaluation qui décompose les tâches robotiques en 14 compétences atomiques pour diagnostiquer les failles des grands modèles de langage multimodaux (MLLMs) embarqués. Le benchmark regroupe 4 469 échantillons entrelacés image-vidéo-texte couvrant 6 catégories, de la perception bas niveau jusqu'à la planification de haut niveau. Soumis à 20 MLLMs dont GPT-5, il révèle deux résultats principaux : les capacités perceptuelles constituent le principal goulot d'étranglement derrière les échecs de raisonnement, et les modèles présentent une modélisation spatiotemporelle instable qui restait invisible dans les benchmarks précédents. En réponse, les auteurs proposent BEAR-Agent, un agent multimodal augmenté d'outils de raisonnement visuel et spatial, qui obtient une amélioration relative de 17,5 % sur GPT-5 par rapport au modèle de base, avec des gains confirmés en simulation et en robotique réelle.

L'intérêt de ce travail tient à la granularité du diagnostic. Les benchmarks existants mesurent si un agent réussit une tâche sans expliquer pourquoi. BEAR révèle que les modèles n'échouent pas d'abord sur le raisonnement abstrait, mais sur la perception : identifier des objets dans une scène, interpréter une séquence vidéo, localiser un élément dans l'espace. Ce résultat contredit l'hypothèse répandue selon laquelle les LLMs auraient comblé le déficit de compréhension scénique grâce à leur préentraînement massif. La découverte sur l'instabilité spatiotemporelle est particulièrement significative pour les intégrateurs déployant des VLA (Vision-Language-Action models) en environnement industriel : elle suggère que les performances observées en démonstration vidéo curatée ne reflètent pas la fiabilité opérationnelle réelle.

Ce preprint arXiv (version 2, 2025) s'inscrit dans un effort plus large pour structurer l'évaluation des agents embarqués, là où des benchmarks comme EgoSchema ou OpenEQA traitent la compréhension incarnée sans diagnostiquer les sous-compétences. BEAR se distingue par ses expériences en environnements robotiques réels, contrairement aux approches purement simulées comme EmbodiedScan. Aucun acteur français ou européen n'est directement impliqué dans cette publication académique, qui émane vraisemblablement d'équipes universitaires asiatiques ou nord-américaines au vu de la page projet associée. La prochaine étape logique serait l'adoption de BEAR comme protocole standard dans les pipelines d'évaluation VLA avant tout déploiement physique.

Dans nos dossiers

À lire aussi

RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné
1arXiv cs.RO 

RoboBench : un benchmark d'évaluation complet pour les grands modèles multimodaux comme cerveau incarné

La robotique humanoïde et manipulatrice s'appuie de plus en plus sur une architecture a deux niveaux: un "System 1" qui gère le contrôle moteur bas niveau et un "System 2", le cerveau incarne, charge du raisonnement et de la prise de décision. Un article mis a jour sur arXiv présente RoboBench, un benchmark conçu pour évaluer spécifiquement ce cerveau incarne lorsqu'il est implémenté par un modèle multimodal de grande taille (MLLM). Le benchmark couvre cinq dimensions: compréhension des instructions, raisonnement perceptif, planification généralisée, prédiction d'affordances et analyse d'échecs, reparties en 14 capacités, 25 taches et 6 092 paires question réponse. Les données combinent des jeux de données robotiques réels a grande échelle et des collectes internes couvrant plusieurs types de robots, des objets aux attributs varies, des scenes multi vues et des taches de navigation dépendantes de la mémoire. Dix huit MLLMs de pointe ont été testes sur ce benchmark. L'enjeu dépasse la simple mesure de performance: la plupart des benchmarks existants évaluent surtout le succès final d'exécution, sans isoler la qualité du raisonnement de haut niveau qui précède l'action, ni la réalité des taches proposées. RoboBench cherche a combler cet écart en testant directement si un modèle comprend une consigne implicite, raisonne correctement sur l'espace et le temps, ou diagnostique un échec, indépendamment de la couche de contrôle moteur. Les résultats montrent des limites persistantes sur la compréhension d'instructions implicites, le raisonnement spatio-temporel, la planification inter scenarios, la compréhension fine des affordances et le diagnostic d'échecs, ce qui questionne la maturité réelle des MLLMs actuels comme cerveaux de robots, au delà des démonstrations souvent mises en avant par les laboratoires. Pour l'évaluation de la planification, les auteurs introduisent un cadre inédit dit "MLLM comme simulateur du monde", qui vérifie si un plan prédit peut effectivement produire les changements d'état critiques d'un objet sous contraintes physiques et visuelles, plutôt que de se contenter d'un simple appariement symbolique avec un plan de référence. Cette approche vise une évaluation plus fidèle du raisonnement a long horizon. Les chercheurs analysent également le lien entre ces capacités cognitives incarnées et la performance réelle en contrôle robotique, positionnant RoboBench comme un outil de référence pour orienter la prochaine génération de MLLMs vers une intelligence robotique plus robuste.

RecherchePaper
1 source
KineBench : évaluation des modèles du monde incarnés par ancrage cinématique sans IDM
2arXiv cs.RO 

KineBench : évaluation des modèles du monde incarnés par ancrage cinématique sans IDM

Une équipe de recherche a publié KineBench, un nouveau benchmark conçu pour évaluer la cohérence physique des modèles de monde incarnés (embodied world models, EWM), ces systèmes qui génèrent des vidéos prédictives de l'interaction robot-environnement. Jusqu'ici, l'évaluation en boucle fermée de ces modèles reposait presque exclusivement sur des modèles de dynamique inverse (IDM) pour extraire les actions robotiques à partir des vidéos générées, une méthode fragile dès que la scène ou l'objet manipulé sort de la distribution d'entraînement. KineBench s'affranchit de cette dépendance en extrayant directement des poses d'organe terminal en 6 degrés de liberté image par image, via une cascade de modèles de vision fondation, puis en rejouant ces trajectoires dans un simulateur physique pour valider l'exécution. Le benchmark ajoute deux métriques cinématiques classiques, la longueur d'arc spectrale (SPARC) et l'indice de manipulabilité de Maruyama, pour juger la fluidité et la faisabilité des trajectoires du point de vue du robot. L'ensemble s'appuie sur 20 tâches de manipulation issues du simulateur ManiSkill3, réparties en quatre suites progressives: exécution de base, transfert de tâche, généralisation visuelle hors distribution, et montée en complexité. L'enjeu dépasse la simple mesure académique: sans méthode fiable pour distinguer une erreur du modèle de monde d'une erreur de l'extracteur d'actions, impossible de savoir si un EWM comprend réellement la physique ou s'il produit des vidéos plausibles mais inexploitables pour du contrôle réel. C'est précisément le doute qui plane sur beaucoup de démonstrations vidéo dans le secteur des VLA (vision-language-action) et de la génération embarquée, où l'écart entre rendu visuel convaincant et action réellement exécutable reste mal quantifié. En testant plusieurs modèles de pointe, les auteurs montrent une montée en échelle non linéaire et bornée par la complexité des tâches, un signal utile pour calibrer les futures stratégies d'entraînement sur données plutôt que d'empiler des vidéos sans discernement. Ce travail s'inscrit dans la lignée des benchmarks fermés basés simulateur, déjà utilisés pour évaluer le sim-to-real, mais cherche à corriger leur talon d'Achille méthodologique, la dépendance aux IDM appris. En s'appuyant sur ManiSkill3, un environnement de simulation déjà largement adopté par la communauté manipulation robotique, KineBench se positionne comme un outil de diagnostic reproductible plutôt qu'un nouveau modèle concurrent, avec pour prochaine étape probable son extension à davantage de tâches et de familles de modèles génératifs.

RecherchePaper
1 source
LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action
3arXiv cs.RO 

LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action

Un benchmark baptisé LIBERO-VIFO, décrit dans un article arXiv (2608.17600v1) publié comme nouvelle soumission, évalue pour la première fois de façon systématique deux dimensions distinctes des modèles Vision-Language-Action (VLA) : leur capacité à suivre des indices visuels autorisés, et le risque qu'ils suivent des indices visuels non autorisés. Le benchmark définit huit familles de signaux visuels couvrant des formes variées, et structure l'évaluation en quatre protocoles répartis en deux parties. La première partie mesure la compréhension du signal et son exécution correcte lorsqu'il est autorisé. La seconde partie teste ce qui se passe en cas de conflit entre l'instruction en langage naturel et le signal visuel, ainsi qu'en l'absence totale d'instruction verbale. Sept modèles VLA ont été évalués sur ce protocole, complété par des expériences additionnelles sur des scènes instanciées, des configurations jugées critiques pour la sécurité, et un déploiement sur robot réel. Le résultat central est double et contre-intuitif : comprendre un indice visuel ne garantit pas qu'un modèle VLA l'exécute correctement, mais à l'inverse, plusieurs modèles se sont montrés capables d'exécuter une tâche indiquée uniquement par un signal visuel, sans aucune instruction linguistique associée. Cela révèle un angle mort de sécurité resté largement ignoré jusqu'ici : la plupart des benchmarks existants traitent implicitement tout indice visuel comme légitime et ne mesurent que le succès final de la tâche, sans distinguer suivi autorisé et non autorisé. Pour les intégrateurs et décideurs déployant des robots pilotés par VLA en environnement partagé (usine, entrepôt, espace public), cela signifie qu'un marqueur, objet ou geste placé dans la scène par un tiers non habilité pourrait suffire à déclencher une action, en dehors de tout contrôle par instruction verbale. Cela nuance l'hypothèse selon laquelle le canal langage resterait le point de contrôle sûr et unique des architectures VLA. Les auteurs justifient LIBERO-VIFO par les limites des travaux antérieurs, cantonnés à un éventail restreint de formes d'indices et à une évaluation grossière fondée sur le seul succès de tâche, sans jamais interroger la légitimité du signal suivi. Le nom du benchmark suggère un ancrage dans la suite existante LIBERO, utilisée pour l'apprentissage de politiques de manipulation robotique. En couvrant à la fois capacité et sécurité du suivi de signaux visuels, et en confirmant ses constats jusque sur robot réel, ce travail entend établir la "sécurité centrée sur le visuel" comme nouvel axe d'évaluation pour la communauté VLA, aux côtés des travaux déjà existants sur les vulnérabilités liées au langage. Il s'agit à ce stade d'un benchmark académique et non d'un produit ou d'un déploiement industriel.

RechercheActu
1 source
RoboPhys-3D : évaluation complète des modèles du monde incarnés par reconstruction 3D
4arXiv cs.RO 

RoboPhys-3D : évaluation complète des modèles du monde incarnés par reconstruction 3D

Une équipe de recherche présente RoboPhys-3D, un benchmark d'évaluation pour les world models vidéo embarqués (embodied world models, EWM), construit sur RoboTwin 2.0. Il couvre 50 tâches de manipulation réparties en quatre régimes, avec 5 000 épisodes et 25 000 vidéos multi-vues de référence. Particularité du protocole : les vidéos générées et les vidéos de référence passent par le même pipeline de reconstruction 3D, ce qui permet de distinguer l'erreur due à la reconstruction de celle due à la génération elle-même. Le benchmark organise 50 métriques en 18 sous-dimensions réparties sur quatre niveaux : fidélité au pixel, cohérence géométrique 3D, compréhension de l'état de la scène et complétude de la tâche. Deux scores composites en découlent : l'Average Full Score, qui moyenne les 50 métriques, et le RoboPhyscore, centré sur les métriques les plus corrélées au succès réel de la tâche. Sur quatre world models vidéo testés, Cosmos 3 obtient le meilleur RoboPhyscore (0,6330, soit 92,7% du score de référence), et ce score affiche une forte corrélation avec l'évaluation humaine (Pearson r = 0,9761, Spearman rho = 0,8962). Ce travail comble un angle mort de l'évaluation des world models pour la robotique : la plupart des benchmarks existants jugent la qualité visuelle ou sémantique des vidéos générées via des juges perceptuels ou des modèles vision-langage, sans vérifier si la scène 3D reste physiquement exploitable pour piloter un robot. Or les métriques ancrées dans l'état de la scène et dans l'exécutabilité des actions révèlent des échecs substantiels que ces jugements perceptuels ou VLM ne détectent pas, un écart classique entre qualité d'image perçue et utilité réelle pour la planification. Pour les équipes qui exploitent des world models comme moteurs de données synthétiques, planificateurs d'actions ou simulateurs, cela signale qu'un bon score de fidélité visuelle ne garantit pas un rollout exploitable en aval. La forte corrélation du RoboPhyscore avec le jugement humain suggère en revanche qu'une métrique compacte et ancrée dans l'exécution pourrait remplacer une évaluation humaine coûteuse à grande échelle. Ce besoin découle de l'absence, jusqu'ici, d'un standard 3D unifié pour vérifier si un rollout généré préserve l'état réel de la scène, les benchmarks EWM existants restant majoritairement 2D ou basés sur des scores subjectifs. RoboPhys-3D positionne Cosmos 3, la gamme de world models vidéo de NVIDIA, comme la plus performante parmi les quatre testées, sans détailler ici les trois autres modèles comparés ni de calendrier de déploiement industriel : il s'agit d'un travail de recherche en évaluation (preprint arXiv 2608.28718v1), pas d'une annonce produit. Il s'inscrit dans une dynamique plus large où les world models vidéo sont de plus en plus proposés comme substituts à la simulation physique classique pour entraîner des politiques de manipulation robotique, et la publication de ce protocole ouvre la voie à des comparaisons plus rigoureuses à mesure que de nouvelles versions de ces modèles sortiront.

RecherchePaper
1 source