Aller au contenu principal
RecherchearXiv cs.RO 

Les modèles du monde rêvent de réussite : diagnostiquer et corriger leur insensibilité à l'échec en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient CureWM, une méthode de réparation pour les modèles du monde robotiques (world models) qui échouent à distinguer une action réussie d'un échec. Le constat part de quatre checkpoints publics issus de deux familles d'architectures: tous réagissent faiblement aux changements d'action et prédisent des issues «proches du succès» pour des échecs pourtant vérifiés. CureWM génère des actions alternatives à partir de démonstrations réussies, sur une grille de sévérité. Il en vérifie ensuite le résultat par exécution, en simulation ou sur matériel réel. Enfin, il affine le modèle existant sur les échecs obtenus, sur les succès restants et sur les démonstrations nominales, sans toucher à l'architecture ni à l'objectif d'entraînement. Le code est disponible sur GitHub.

Sur 484 contrefactuels d'échec réservés du benchmark LIBERO, l'optimisme excessif (la part d'échecs prédits comme des succès) tombe de 80 % après un affinage sur les données officielles à 30-43 % sur quatre modèles CureWM entraînés indépendamment, soit 38 % en moyenne. Sur un bras robotique physique, dans deux évaluations distinctes, les prédictions d'échec jugées «proches du succès» par un diagnostic de distance latente passent de 90 % (affinage sur succès seuls) à 33 % avec CureWM. À nombre d'échecs par tâche, données de rejeu de succès et budget d'entraînement égaux, les échecs contrefactuels donnent un écart de valeur succès-échec de 0,124, contre 0,014 pour des échecs «on-policy» collectés à neuf.

Ces résultats comptent parce que les world models servent de plus en plus à évaluer des politiques, à planifier et à produire des données synthétiques. Un modèle qui «rêve» le succès quelle que soit l'action rend ces usages trompeurs: une politique défaillante paraîtrait performante, et des données générées seraient biaisées vers la réussite. Le travail remet aussi en cause l'idée que collecter davantage d'échecs réels suffit, puisque les échecs on-policy apportent ici douze fois moins de contraste que les contrefactuels construits depuis un même contexte initial. Les auteurs ajoutent un garde-fou méthodologique: réduire l'optimisme ne suffit pas, il faut le mesurer avec la capacité de discrimination entre succès et échec, faute de quoi un modèle pessimiste en tout passerait pour réparé. Les chiffres proviennent d'un seul groupe, sur LIBERO et un bras unique, sans validation indépendante à ce stade.

Ce papier s'inscrit dans une littérature qui intègre déjà des échecs à l'entraînement des world models, mais en modifiant architecture ou objectif. CureWM vise au contraire la réparation a posteriori de checkpoints diffusés, ce qui le rend directement applicable aux modèles que les équipes utilisent déjà. Il s'adresse à ceux qui s'appuient sur des modèles du monde pour la validation de politiques VLA avant déploiement. Les prochaines étapes à surveiller sont la reproduction sur d'autres benchmarks et morphologies, ainsi que l'application à de plus grands modèles de fondation.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Les modèles du monde robotiques suivent-ils vraiment les actions ? Diagnostic et alignement pour l'apprentissage de politiques
1arXiv cs.RO 

Les modèles du monde robotiques suivent-ils vraiment les actions ? Diagnostic et alignement pour l'apprentissage de politiques

Un article publié sur arXiv (référence 2608.24885v1) introduit deux outils complémentaires pour diagnostiquer et corriger un défaut jusqu'ici non vérifié dans les "world models" conditionnés par l'action, ces simulateurs appris de plus en plus utilisés pour évaluer et améliorer des politiques robotiques. Le premier, WorldEcho, est un protocole de diagnostic qui mesure si les futurs générés par un modèle suivent réellement l'action commandée, via l'intégrité visuelle des séquences et l'alignement des trajectoires SE(3), sur un éventail d'actions bien plus large que les seules démonstrations expertes utilisées jusque-là par les benchmarks existants. Le diagnostic montre que les modèles actuels exécutent correctement les actions issues de démonstrations expertes, mais échouent largement face à des trajectoires hors distribution: soit ils ignorent la commande, soit ils produisent des séquences visuellement incohérentes. Pour y remédier, les auteurs proposent WorldSync, qui agit sur trois axes: élargissement de la distribution d'entraînement sur les conséquences des actions, ancrage des représentations vidéo intermédiaires dans la dynamique du robot via un "Action-Forcing Expert", et alignement des changements prédits sous intervention avec les changements réels observés. Testé sur les benchmarks RoboTwin et sur des tâches réelles avec un robot physique, WorldSync améliore les métriques WorldEcho et fait gagner du taux de réussite aux politiques entraînées avec ce simulateur. Pour l'industrie robotique, ce travail pointe une faille méthodologique qui touche tout le courant des world models utilisés comme simulateurs pour l'apprentissage par renforcement ou l'amélioration itérative de politiques: un modèle qui ne suit fidèlement que les actions proches de la distribution expert ne peut pas servir de proxy fiable pour tester des comportements qui s'en écartent, ce qui est pourtant l'objectif recherché quand on veut affiner une politique par simulation plutôt que par collecte coûteuse de données réelles. Le papier documente ainsi un écart entre démonstration convaincante et fiabilité réelle, et invite intégrateurs et équipes de recherche à ne pas présumer qu'un modèle génératif entraîné sur des démonstrations suit correctement des actions arbitraires avant de l'utiliser en boucle fermée pour du fine-tuning de politiques. Ce travail s'inscrit dans la tendance qui consiste à utiliser des modèles de génération vidéo conditionnés par l'action comme simulateurs internes pour l'apprentissage de politiques robotiques, en complément des simulateurs physiques classiques. RoboTwin, benchmark déjà reconnu pour la manipulation bimanuelle en simulation, sert ici de terrain de test. En révélant que les world models actuels généralisent mal au-delà des trajectoires expertes, les auteurs ouvrent la voie à des méthodes comme WorldSync, jugées nécessaires avant de pouvoir intégrer ces simulateurs comme brique standard dans des pipelines d'amélioration itérative de politiques, en simulation comme sur robot physique.

RecherchePaper
1 source
Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle
2arXiv cs.RO 

Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle

Une équipe de recherche présente Hi-WM (Human-in-the-World-Model), un cadre de post-entraînement pour politiques robotiques généralisées, publié sur arXiv (2604.21741). L'approche remplace l'exécution physique par un modèle du monde appris : la politique est d'abord déroulée en boucle fermée dans ce simulateur interne, et lorsqu'une trajectoire devient incorrecte ou risquée, un opérateur humain intervient directement dans le modèle pour fournir des actions correctives courtes. Hi-WM met en cache les états intermédiaires et supporte le rollback et le branchement, ce qui permet de réutiliser un seul état d'échec pour générer plusieurs continuations correctives distinctes. Les trajectoires ainsi produites sont réinjectées dans le jeu d'entraînement. Évalué sur trois tâches de manipulation réelle (objets rigides et déformables) avec deux architectures de politique différentes, le système affiche un gain de 37,9 points en taux de succès réel par rapport à la politique de base, et de 19,0 points par rapport à une ligne de base en boucle fermée dans le modèle du monde. La corrélation entre les évaluations dans le modèle et les performances réelles atteint r = 0,953. Ce résultat adresse un goulot d'étranglement structurel du déploiement robotique : le post-entraînement actuel exige du temps robot, des resets de scène, une supervision opérateur en continu, autant de contraintes qui rendent la correction itérative coûteuse à l'échelle. En décorrélant la phase corrective de l'exécution physique, Hi-WM densifie la supervision précisément là où la politique échoue, sans mobiliser le matériel. La forte corrélation sim-to-real (r > 0,95) est notable : elle suggère que le modèle du monde est suffisamment fidèle pour qualifier les politiques avant déploiement, ce qui contredit en partie l'hypothèse que l'évaluation dans le modèle reste trop éloignée des conditions réelles pour être exploitable. Les modèles du monde conditionnés sur les actions sont étudiés depuis plusieurs années principalement pour la génération de données synthétiques et l'évaluation de politiques, notamment dans les travaux autour des VLA (Vision-Language-Action models) et des politiques généralisées comme celles portées par Physical Intelligence (Pi-0) ou les recherches internes de Google DeepMind. Hi-WM repositionne ces modèles comme substrat correctif actif, une troisième fonction jusqu'ici peu explorée. Les suites naturelles incluent l'extension à des tâches de locomotion, la réduction du coût de construction du modèle du monde, et l'intégration dans des pipelines de fine-tuning continu pour robots déployés en environnement industriel variable.

RechercheOpinion
1 source
LIBERO-RECOVER : au-delà de la réussite des tâches, la récupération après échec dans les modèles de manipulation robotique
3arXiv cs.RO 

LIBERO-RECOVER : au-delà de la réussite des tâches, la récupération après échec dans les modèles de manipulation robotique

Des chercheurs ont publié le 5 septembre 2026 sur arXiv (2609.05178) LIBERO-Recover, un benchmark consacré à la récupération après échec des modèles de manipulation robotique Vision-Language-Action (VLA) ou World Action (WAM). Construit à partir de LIBERO, référence de l'apprentissage robotique en simulation, il rassemble plus de 1 000 scénarios d'échecs réels issus de modèles état de l'art, répartis en quatre niveaux : réessai d'action, adaptation d'action, récupération de l'état de l'objet et récupération environnementale. Il évalue quatre compétences : compréhension spatiale, raisonnement sur la structure des objets, compréhension des interactions et raisonnement topologique. Le projet est disponible sur liulin815.github.io/LIBERO-Recovery. L'enjeu est réel pour les intégrateurs et décideurs du secteur robotique : les modèles les plus avancés affichent des taux de succès proches de 100% sur LIBERO, souvent présentés comme preuve de maturité pour un déploiement réel. Les auteurs contestent cette lecture, car ces scores mesurent l'exécution de tâches depuis des états initiaux idéaux, sans jamais tester la réaction à une prise ratée, une collision ou un déplacement involontaire d'objet, situations pourtant inévitables hors laboratoire. LIBERO-Recover déplace ainsi la question de la réussite d'une tâche vers la capacité à s'en remettre après un échec, nuançant l'idée que le sim-to-real et l'apprentissage par imitation à grande échelle seraient déjà résolus. Pour les industriels évaluant des piles VLA, ce travail rappelle que les scores de benchmark actuels ne garantissent pas la robustesse opérationnelle. Ce travail s'inscrit dans une critique méthodologique croissante des benchmarks de manipulation robotique : LIBERO, désormais jugé saturé, ne mesurait que la réussite finale d'une tâche, jamais la résilience face à l'imprévu. Il s'agit d'une contribution académique en preprint, sans lien annoncé avec un produit commercial : aucun robot physique, partenariat industriel ni calendrier de commercialisation n'est mentionné. Les auteurs présentent LIBERO-Recover comme le premier benchmark à grande échelle consacré à la récupération après échec en robotique incarnée, un manque notable face à la multiplication des modèles fondation pour la manipulation. La suite attendue est l'adoption de ce protocole par la communauté pour évaluer les futurs modèles VLA sur cet axe de robustesse, plutôt que sur le seul taux de succès brut.

RecherchePaper
1 source
Repenser le modèle monde-action pour la manipulation robotique compositionnelle et en contexte
4arXiv cs.RO 

Repenser le modèle monde-action pour la manipulation robotique compositionnelle et en contexte

Des chercheurs proposent ViGAR (Visual Goal-conditioned Action Reasoning), un cadre hiérarchique pour la manipulation robotique compositionnelle à long horizon, détaillé dans un preprint arXiv (2610.02368). Il sépare la tâche en deux modules. Un planificateur de sous-buts visuels prédit, à partir de l'observation courante et de l'instruction globale, une image du sous-but de la prochaine sous-tâche. Un exécuteur de sous-buts génère ensuite conjointement les trajectoires visuelles futures et les actions, conditionnées par ce sous-but. Les deux composants partagent la même représentation de world model pré-entraîné. Sur le benchmark simulé RoboTwin Clean2Random, ViGAR atteint 82,00 % de réussite en configuration Clean et 67,02 % en configuration Random. Cela représente 12,86 points de pourcentage de mieux que la meilleure référence, en moyenne. Les auteurs ajoutent des essais sur robot réel : cinq tâches compositionnelles et deux tâches d'apprentissage en contexte. Le résumé ne précise ni la plateforme matérielle, ni le nombre d'essais, ni les modèles de référence. Ce travail s'attaque à une limite connue des world-action models (WAM), qui prédisent à la fois de courts futurs visuels et des actions, mais sans raisonnement explicite au niveau des sous-tâches. Pour un intégrateur, la plupart des tâches utiles, comme l'assemblage, le tri ou le conditionnement, enchaînent plusieurs gestes coordonnés, et c'est sur cet enchaînement que les politiques de bout en bout échouent le plus souvent. Introduire un sous-but visuel explicite rend le plan lisible et inspectable, ce qui compte pour le diagnostic en production. L'apprentissage en contexte va dans le même sens. Une image du but global fournie comme contexte suffit à induire des décompositions et des comportements différents, sans mise à jour des paramètres. Cela réduirait le coût de reconfiguration d'une cellule robotisée. Les résultats restent à relativiser : le score Random de 67 % montre qu'une perte de performance subsiste face à la variabilité de l'environnement, et les tests réels sont peu nombreux. Ce travail s'inscrit dans la montée des politiques vision-langage-action (VLA) et des world models comme base de la manipulation généraliste. Il se place face à des approches qui produisent des actions seules, comme Pi-0, ou des modèles qui prédisent des futurs vidéo sans hiérarchie. Le benchmark RoboTwin, de manipulation bimanuelle avec randomisation de l'environnement, sert de plus en plus de test de robustesse. C'est un résultat académique, sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont la validation sur des horizons plus longs et des plateformes variées, la publication du code et des poids, et le coût de calcul d'une prédiction visuelle à chaque sous-tâche, que le résumé ne chiffre pas.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source