Aller au contenu principal
RecherchearXiv cs.RO 

Les modèles du monde robotiques ne sont pas invariants à la façon dont les actions sont écrites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2609.23252v1) montre qu'un world model robotique s'effondre lorsqu'on change simplement la façon d'écrire les actions, cibles articulaires absolues ou déplacements relatifs à l'état courant, tout en lui soumettant la même trajectoire commandée. Sur trois jeux de données robotiques et deux morphologies, la récupération de trajectoires se dégrade d'un facteur 2,6 à 13,4 et la sélection d'action conditionnée par un objectif tombe de 53% à 15% de réussite. Sur l'environnement PushT, les deux représentations internes du même futur deviennent quasi orthogonales, avec un cosinus de similarité de 0,067, jusqu'à -0,377 dans le pire cas, alors qu'elles restent mutuellement reconstructibles à R² = 0,996, ce qui écarte toute perte d'information. Un test conçu pour distinguer une reparamétrisation valide d'un résumé avec perte rejette trois des quatre axes candidats proposés par les auteurs.

Le résultat pèse sur un secteur qui traite le choix entre encodage absolu et delta comme un détail interchangeable, rarement documenté d'un composant à l'autre. Un world model utilisé pour évaluer une politique hors ligne, planifier ou retrouver des trajectoires similaires peut ainsi répondre silencieusement à une question différente dès que cette convention diverge entre les briques assemblées, sans message d'erreur, seulement un effondrement des métriques. Pour les intégrateurs combinant des composants entraînés séparément, cela nuance l'hypothèse selon laquelle les world models généralisent au-delà de leurs conditions d'entraînement exactes, puisque l'échec survient ici sans aucun changement de capteur, de caméra ou de tâche.

Ce travail comble un angle mort de la littérature sur la robustesse des modèles robotiques, jusqu'ici centrée sur les perturbations visuelles, recadrage, bruit, pose de caméra, sans jamais auditer le canal d'action. La réparation proposée moyenne les deux encodages au niveau de la fonction de perte durant l'entraînement, ce qui restaure la performance, alors que moyenner les sorties, valable pour des probabilités, échoue pour des prédictions à valeur directionnelle. Sur PushT, ce moyennage reste toutefois incomplet, l'accord dans le pire cas ne remontant qu'à 0,78, contre 0,995 avec une pénalité de désaccord, ce qui laisse ouverte la question pour les politiques vision-langage-action déployées à plus grande échelle.

À lire aussi

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique
1arXiv cs.RO 

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique

Des chercheurs ont publié JailWAM, premier framework d'évaluation de jailbreak conçu spécifiquement pour les World Action Models (WAM), ces modèles qui pilotent directement des robots manipulateurs à partir d'instructions en langage naturel. Décrit dans un article déposé sur arXiv (identifiant 2604.05498, version 2), le système repose sur trois composants. Le premier, Visual-Trajectory Mapping, convertit les sorties d'action hétérogènes de différentes architectures de WAM en une représentation de trajectoire visuelle commune, ce qui permet de comparer des modèles différents sur une même base. Le deuxième, un Risk Discriminator, classe les résultats selon trois niveaux de gravité physique croissante : conformité de sécurité, échec de mouvement, et risque catastrophique. Le troisième, une Dual-Path Verification Strategy, combine un tri rapide des candidats d'attaque avec une simulation physique en boucle fermée réservée aux cas jugés dangereux, afin de réduire le coût de calcul. Testé dans l'environnement de simulation RoboTwin, JailWAM atteint un taux de réussite d'attaque de 84,2 % contre le modèle LingBot-VA. Ce résultat illustre concrètement que les WAM, censés traduire fidèlement des consignes en gestes physiques sûrs, restent vulnérables à des instructions adversariales capables de provoquer des comportements dangereux du bras ou du robot. Pour les intégrateurs industriels et les décideurs qui envisagent de déployer ces modèles vision-langage-action en usine ou en entrepôt, l'étude rappelle qu'aucun garde-fou standardisé n'existe encore contre ce type d'attaque, contrairement au red-teaming déjà bien établi pour les grands modèles de langage textuels. Le chiffre de 84,2 % a toutefois été obtenu en simulation, pas sur du matériel physique réel, ce qui laisse ouverte la question d'un éventuel écart sim-to-real ; la tendance qu'il révèle sur la fragilité de l'alignement sécuritaire des WAM reste néanmoins significative. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui équipent la nouvelle génération de robots humanoïdes et de bras manipulateurs, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix. JailWAM transpose au monde physique des méthodologies de jailbreak déjà développées pour les modèles de langage textuels. Les auteurs appellent explicitement à davantage de recherche sur l'évaluation de sécurité et l'alignement des systèmes robotiques embarqués, signe d'un besoin encore naissant de standards de certification avant tout déploiement industriel à grande échelle. Aucun acteur français ou européen du secteur n'apparaît dans cette étude.

RechercheActu
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique
3arXiv cs.RO 

IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique

Un article publié sur arXiv (2607.00836) dresse un état des lieux conceptuel des "world models" utilisés en robotique et en simulation générative, un terme dont le périmètre varie fortement selon les communautés de recherche. Les auteurs proposent une définition unifiée : un modèle du monde est un système conditionné par l'action qui prédit l'évolution future des observations ou des états pertinents pour une tâche donnée. Ils distinguent deux grandes familles : les modèles dans l'espace des observations, qui prédisent des images ou vidéos brutes, et les modèles dans l'espace des états, qui travaillent sur des représentations compactes. Chaque approche est comparée selon quatre critères : fidélité visuelle, structuration spatiale, interprétabilité physique et facilité d'usage pour le contrôle. Le papier introduit ensuite les "world action models", qui relient ces prédictions du futur à des actions robotiques exécutables, avec quatre paradigmes identifiés : imaginer puis exécuter, prédiction d'action conditionnée par des features vidéo, modélisation conjointe vidéo-action, et prédiction vidéo auxiliaire pour l'apprentissage de politiques. Cette clarification terminologique a une portée pratique pour les équipes qui développent des politiques robotiques : elle aide à choisir entre un modèle générateur de pixels, coûteux en calcul mais riche visuellement, et un modèle d'état plus léger, plus proche du contrôle temps réel mais moins interprétable. Elle formalise aussi un débat de fond du secteur : les modèles de génération vidéo produisent des démonstrations spectaculaires, mais leur utilité réelle pour piloter un bras ou un humanoïde reste à prouver, faute de garanties physiques strictes, ce qui rejoint les critiques récurrentes sur l'écart entre démo et déploiement réel. En distinguant explicitement l'approche "imaginer puis exécuter" des méthodes qui apprennent directement une politique conjointe vidéo-action, le tutoriel donne aux intégrateurs une grille de lecture pour évaluer les annonces commerciales selon ce qu'elles modélisent vraiment, plutôt que sur la seule qualité de leurs vidéos. Ce travail arrive alors que les world models occupent une place croissante dans la course aux modèles vision-langage-action, portée par des systèmes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui combinent tous, à des degrés divers, prédiction du futur et génération d'actions. Sans analyser directement ces produits commerciaux, la taxonomie proposée offre un cadre académique pour resituer ces systèmes les uns par rapport aux autres, à un moment où la recherche universitaire tente de structurer conceptuellement un domaine dont la vitesse de publication industrielle a largement dépassé la théorie.

RecherchePaper
1 source
SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile
4arXiv cs.RO 

SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile

Des chercheurs ont publié sur arXiv le 19 juin 2026 un preprint décrivant SWAP (Symmetric World-model for Agile Parkour), un cadre d'apprentissage par renforcement pour la locomotion agile de robots quadrupèdes. L'approche couple un modèle du monde latent, qui permet des prédictions proactives sur le terrain à venir, avec un principe d'équivariance par symétrie gauche-droite intégré simultanément dans le modèle du monde et dans les réseaux acteur-critique. En tests réels, le robot associé au framework franchit un fossé de 2,13 mètres d'un saut et escalade une plateforme de 1,63 mètre. Les auteurs présentent ces résultats comme des records pour le parkour quadrupède, affirmation non encore validée de façon indépendante. Le système démontre également une généralisation robuste à des environnements extérieurs et à des terrains miroirs non vus lors de l'entraînement, sans ré-entraînement (zero-shot transfer). L'enjeu central est l'efficacité d'apprentissage. Les modèles du monde purement pilotés par les données encodent les interactions symétriques gauche-droite comme des patterns indépendants, gonflant inutilement la complexité d'apprentissage et empêchant la capture des régularités géométriques du terrain. En intégrant l'équivariance comme prior structurel, SWAP réduit cette redondance et rend l'espace latent plus compact pour la politique en aval. Pour les équipes de recherche appliquée, le résultat le plus notable reste le transfert zero-shot vers des terrains inédits : si confirmé sur d'autres plateformes matérielles, cela réduirait le besoin de données de fine-tuning spécifiques à chaque déploiement, un verrou important dans le sim-to-real actuel pour la locomotion agile. Le parkour quadrupède est devenu un benchmark de facto depuis les travaux d'ETH Zurich sur ANYmal et le papier Parkour Learning de 2023, suivis par Carnegie Mellon University, qui ont progressivement montré que des politiques entraînées en simulation pouvaient généraliser à des obstacles physiques complexes. L'usage de modèles du monde latents pour la locomotion reste une piste plus récente par rapport aux pipelines classiques de RL bout-en-bout, et SWAP se positionne à l'intersection de ces deux axes. Le preprint ne mentionne ni le nom précis du robot utilisé ni l'institution d'origine des auteurs, deux détails qui limiteront la reproductibilité jusqu'à la publication complète en conférence. Aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source