Aller au contenu principal
RecherchearXiv cs.RO 

TAPDreamer : des patchs adversariaux transférables contre les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont mis au point TAPDreamer, une attaque par patch adversarial qui vise les « world action models » (WAM), ces modèles qui prédisent l'évolution de leur environnement pour piloter un robot. Le patch est construit à partir d'un seul encodeur visuel public, sans aucune requête vers la politique cible. Il suffit de six images d'une tâche source pour optimiser la distance L1 globale entre les représentations de l'encodeur sur image propre et sur image patchée. Un patch figé par benchmark, couvrant environ 6,5 % de l'image, fait chuter FastWAM de 97,7 % à 0,0 % de réussite sur 40 tâches LIBERO, et de 90,86 % à 0,0 % sur 50 tâches RoboTwin, en boucle fermée. Des patchs aléatoires de même taille laissent 81,5 % et 79,2 % de réussite. Le patch transféré fait tomber deux configurations de DreamWAM à 1,45 % et 1,00 %, et Motus à 10,60 %. Ces résultats viennent d'une étude académique en simulation, sans test sur robot physique.

L'enjeu tient au mécanisme. Selon les auteurs, les interactions entre les poids d'attention et les vecteurs de valeur propagent un décalage de représentation quasi identique bien au-delà de la zone masquée, et ce décalage reste stable d'une tâche à l'autre. Un attaquant n'a donc besoin ni de la politique, ni de ses sorties, ni de ses futurs prédits, contrairement aux attaques existantes. Pour les intégrateurs et les responsables de sécurité industrielle, cela déplace le risque. Durcir uniquement la génération d'actions ne suffit pas, car l'encodeur visuel partagé devient un point de défaillance commun à plusieurs architectures. Ce travail relativise aussi la robustesse affichée par les modèles du monde sur les benchmarks propres. Un score de 97,7 % sur LIBERO ne dit rien de la tenue face à une perturbation locale persistante, par exemple un autocollant ou une étiquette dans le champ de la caméra. Une réserve s'impose : la portée physique reste à démontrer, car les patchs sont appliqués numériquement sur les images.

Le contexte est celui d'une adoption rapide des modèles du monde comme socle du contrôle robotique généraliste, avec des encodeurs pré-entraînés réutilisés d'un modèle à l'autre. Cette mutualisation facilite le développement, mais elle crée la surface d'attaque exploitée ici. Les travaux antérieurs sur les politiques vision-langage-action (VLA) avaient déjà montré une vulnérabilité aux perturbations visuelles, en général avec accès aux sorties du modèle. TAPDreamer abaisse ce seuil d'accès. La conclusion des auteurs est que les défenses devront protéger les encodeurs visuels partagés contre les perturbations locales persistantes. La suite logique serait une validation sur matériel réel, avec des patchs imprimés et des conditions d'éclairage variables, puis l'évaluation de contre-mesures comme l'entraînement adversarial de l'encodeur ou la détection de patchs avant l'inférence.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Détecter et supprimer : une défense mécanistique contre les patchs adversariaux dans les modèles VLA
1arXiv cs.RO 

Détecter et supprimer : une défense mécanistique contre les patchs adversariaux dans les modèles VLA

Des chercheurs proposent une défense mécaniste contre les patchs adversariaux qui perturbent les modèles Vision-Langage-Action (VLA), ces politiques de contrôle robotique qui transforment images et instructions textuelles en actions. Les auteurs analysent les représentations internes d'un VLA à l'aide d'un autoencodeur parcimonieux (SAE) et isolent une caractéristique dont l'activation est fortement corrélée à la présence d'un patch adversarial dans l'image. Une sonde linéaire détecte l'attaque, et ce n'est qu'à ce moment que la caractéristique identifiée est supprimée à l'inférence. La méthode ne demande aucun réentraînement du VLA. Les tests portent sur LIBERO-10, un banc d'essai de manipulation en simulation, face à des attaques par patch contre des VLA. Le taux de réussite s'améliore sous attaques intermittentes. Le résumé publié ne donne pas de chiffres précis, et l'évaluation reste cantonnée à la simulation. L'intérêt tient à deux enseignements. D'abord, les défaillances causées par un patch ne sont pas diffuses : elles passent par une direction identifiable dans l'espace des représentations, donc ciblable. Cela ouvre une alternative à l'entraînement adversarial, coûteux, qui impose de réentraîner ou d'affiner des modèles de plusieurs milliards de paramètres. Ensuite, le moment de l'intervention compte. Appliquer la même suppression en continu dégrade nettement la politique en fonctionnement normal. Le coût d'une défense passive est donc réel, et la détection conditionnelle devient la pièce centrale. Pour un intégrateur ou un responsable de site, c'est un rappel que la robustesse des VLA face à des perturbations visuelles physiques (autocollants, objets inattendus, éléments d'affichage) n'est pas acquise. Elle ne se règle pas par un simple filtre appliqué en permanence. Les limites sont à garder en tête : un seul benchmark simulé, des attaques intermittentes, et une défense dont l'efficacité face à un adversaire qui connaîtrait la sonde de détection n'est pas démontrée. Un attaquant adaptatif pourrait chercher à contourner à la fois le détecteur et la caractéristique ciblée. Ces travaux s'inscrivent dans la montée en puissance des VLA (Pi-0, GR00T, Helix et d'autres), dont la sécurité reste moins étudiée que les capacités. Les attaques par patch, héritées de la vision par ordinateur classique, ont été transposées à la robotique : elles y provoquent des erreurs de contrôle et non plus seulement de classification. Cette approche reprend les outils d'interprétabilité mécaniste, notamment les SAE, développés pour l'analyse des grands modèles de langage, et les applique à la défense de politiques robotiques. Les prochaines étapes logiques sont la validation sur des robots physiques, le test d'autres architectures de VLA et de patchs imprimés, ainsi que l'évaluation face à des attaques adaptatives. Aucun déploiement industriel n'est annoncé : il s'agit d'une preuve de concept de recherche publiée sur arXiv.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
JailWAM : pirater les modèles d'action du monde dans le contrôle robotique
2arXiv cs.RO 

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique

Des chercheurs ont publié JailWAM, premier framework d'évaluation de jailbreak conçu spécifiquement pour les World Action Models (WAM), ces modèles qui pilotent directement des robots manipulateurs à partir d'instructions en langage naturel. Décrit dans un article déposé sur arXiv (identifiant 2604.05498, version 2), le système repose sur trois composants. Le premier, Visual-Trajectory Mapping, convertit les sorties d'action hétérogènes de différentes architectures de WAM en une représentation de trajectoire visuelle commune, ce qui permet de comparer des modèles différents sur une même base. Le deuxième, un Risk Discriminator, classe les résultats selon trois niveaux de gravité physique croissante : conformité de sécurité, échec de mouvement, et risque catastrophique. Le troisième, une Dual-Path Verification Strategy, combine un tri rapide des candidats d'attaque avec une simulation physique en boucle fermée réservée aux cas jugés dangereux, afin de réduire le coût de calcul. Testé dans l'environnement de simulation RoboTwin, JailWAM atteint un taux de réussite d'attaque de 84,2 % contre le modèle LingBot-VA. Ce résultat illustre concrètement que les WAM, censés traduire fidèlement des consignes en gestes physiques sûrs, restent vulnérables à des instructions adversariales capables de provoquer des comportements dangereux du bras ou du robot. Pour les intégrateurs industriels et les décideurs qui envisagent de déployer ces modèles vision-langage-action en usine ou en entrepôt, l'étude rappelle qu'aucun garde-fou standardisé n'existe encore contre ce type d'attaque, contrairement au red-teaming déjà bien établi pour les grands modèles de langage textuels. Le chiffre de 84,2 % a toutefois été obtenu en simulation, pas sur du matériel physique réel, ce qui laisse ouverte la question d'un éventuel écart sim-to-real ; la tendance qu'il révèle sur la fragilité de l'alignement sécuritaire des WAM reste néanmoins significative. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui équipent la nouvelle génération de robots humanoïdes et de bras manipulateurs, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix. JailWAM transpose au monde physique des méthodologies de jailbreak déjà développées pour les modèles de langage textuels. Les auteurs appellent explicitement à davantage de recherche sur l'évaluation de sécurité et l'alignement des systèmes robotiques embarqués, signe d'un besoin encore naissant de standards de certification avant tout déploiement industriel à grande échelle. Aucun acteur français ou européen du secteur n'apparaît dans cette étude.

RechercheActu
1 source
OpenWAM : un cadre ouvert pour des modèles monde-action composables
3arXiv cs.RO 

OpenWAM : un cadre ouvert pour des modèles monde-action composables

OpenWAM est un cadre open source de modèles monde-action (WAM, world-action models), ces systèmes qui couplent la prédiction vidéo du futur au contrôle d'un robot. Les auteurs partent de Wan2.2-5B, un modèle de génération vidéo de 5 milliards de paramètres, qu'ils pré-entraînent de façon causale sur plus de 10 000 heures de vidéo robotique. Ils y greffent un « expert d'action » via une architecture Mixture-of-Transformers partagée. Celle-ci permet quatre modes de génération : conjointe, vidéo puis action, action puis vidéo, et découplée. Sur les quatre suites du benchmark de simulation LIBERO, le système obtient des taux de réussite élevés, de même que sur des tâches bimanuelles réelles dont l'abstract ne détaille ni le nombre ni les conditions. L'adaptation causale conjuguée à l'entraînement sur vidéo robotique fait passer le taux de réussite en mode vidéo puis action sur LIBERO-Long de 68,4 % à 97,8 %. L'apport principal tient à la méthode plus qu'à un score. Les WAM existants changent simultanément de backbone vidéo, de structure d'interaction, de supervision et de procédure d'inférence, ce qui empêche d'attribuer un gain à un choix de conception précis. OpenWAM fournit un banc d'essai commun où l'on ne modifie qu'un paramètre à la fois. Les résultats sur la dynamique sont les plus intéressants pour les équipes qui cherchent à réduire leur dépendance aux démonstrations coûteuses. Quand seul le prédicteur vidéo est adapté à une nouvelle tâche, un modèle de dynamique inverse gelé, à contexte local, entraîné sur des transitions contrefactuelles et des démonstrations, atteint 84,0 % de réussite moyenne sur quatre tâches LIBERO-90 jamais vues. Le même modèle entraîné sur les seules démonstrations plafonne à 21,5 %, et une version à contexte complet atteint 47,0 %. En dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et fait passer l'identification du bon résultat de 21,1 % à 71,3 % parmi 16 issues partant du même état. Ces chiffres viennent de LIBERO, un benchmark simulé et saturé, et d'un article non encore évalué par des pairs : ils ne disent rien du fossé entre démonstration et déploiement industriel. Ce travail s'inscrit dans la montée des politiques fondées sur la vidéo, qui font concurrence aux modèles vision-langage-action (VLA) classiques comme Pi-0 ou GR00T. Leur promesse est de tirer parti de la grande quantité de vidéo disponible, au-delà des seules démonstrations réussies. Wan2.2 sert ici de socle, ce qui illustre la réutilisation des modèles vidéo génératifs ouverts en robotique. Le cadre est publié sous le numéro arXiv 2610.07922, en version 1, et l'abstract ne mentionne aucun pilote industriel ni calendrier de déploiement. La suite logique serait une validation sur davantage de tâches réelles, avec des comparaisons à poids de calcul équivalent contre les VLA établis.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
4arXiv cs.RO 

WAMJET : un cadre pour accélérer les modèles d'action du monde

WAMJET, présenté sur arXiv (2610.03797, version 2), est un « harness » agentique qui accélère l'inférence des World Action Models (WAM). Ces modèles réutilisent des modèles de fondation vidéo pré-entraînés pour la manipulation robotique, en prédisant conjointement la vidéo future et les actions. Ce couplage et la taille des backbones rendent l'inférence coûteuse. Le harness dote des agents de code de consignes d'optimisation réutilisables et d'outils de mesure et de validation. L'agent suit un flux piloté par les goulots d'étranglement : il profile l'inférence, modifie le code ciblé, valide les effets, puis affine la pile d'accélération à mesure que les goulots se déplacent, sans dégrader la qualité des actions. Les expériences couvrent six WAM, trois agents de code et deux architectures de GPU. WAMJET atteint jusqu'à 9,95x d'accélération sans perte par rapport aux implémentations amont. Des optimisations par approximation et adaptées au matériel réduisent encore la latence, avec des taux de succès comparables. Ce travail s'attaque à un frein concret du déploiement des WAM : leurs latences d'inférence. Les techniques d'accélération existent déjà (quantification, distillation, réduction du nombre de pas de diffusion, optimisation des noyaux), mais choisir et composer celles qui conviennent à chaque modèle et à chaque plateforme matérielle demande un travail d'ingénierie lourd et répété. En automatisant cette étape avec des agents de code, les auteurs proposent de la traiter comme un problème d'optimisation outillé plutôt que comme du sur-mesure. Pour un intégrateur ou une équipe qui porte un WAM sur un robot réel, le gain de latence conditionne la fréquence de contrôle atteignable. Le résultat suggère aussi que les implémentations amont des WAM laissent beaucoup de performance inexploitée. Le chiffre de 9,95x est un maximum, obtenu sur le meilleur cas, et non une moyenne. L'extrait disponible ne détaille ni les latences absolues ni la liste des six modèles, ce qui limite la lecture de ce chiffre. La mention de taux de succès « comparables » pour les variantes approximatives demande à être vérifiée sur des tâches physiques variées, et pas seulement sur des benchmarks. Cette approche s'inscrit dans deux tendances. La première est la montée des modèles d'action fondés sur la vidéo, qui héritent de la qualité des modèles vidéo génératifs, mais aussi de leur coût de calcul, par opposition aux VLA classiques, plus légers. La seconde est l'usage d'agents de code pour optimiser des systèmes, sur le modèle de l'ingénierie assistée de noyaux GPU. Les travaux concurrents sur l'accélération des VLA, comme les politiques à flow matching ou à diffusion réduite en pas, visent le même objectif de contrôle temps réel, mais sans automatiser la composition des techniques. La suite logique est une validation sur robots physiques et sur davantage de plateformes, notamment embarquées, où les contraintes de calcul sont les plus fortes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source