Aller au contenu principal
Sécurité de l'IA incarnée : panorama des risques, attaques et défenses
RecherchearXiv cs.RO 

Sécurité de l'IA incarnée : panorama des risques, attaques et défenses

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié fin avril 2026 sur arXiv (identifiant 2605.02900) une revue systématique de la sécurité dans l'IA incarnée (embodied AI), couvrant plus de 400 articles académiques. Le périmètre s'étend à l'ensemble du pipeline d'un agent physique : perception sensorielle, cognition, planification, exécution d'actions et interactions humain-robot. La taxonomie proposée organise les menaces en quatre grandes familles d'attaques (adversariales, backdoor, jailbreak, matérielles) et trois axes de défense (détection d'attaques, entraînement robuste, inférence sûre). Les domaines d'application ciblés incluent la conduite autonome, la robotique industrielle et d'assistance, ainsi que les applications médicales, tous caractérisés par des conséquences physiques directes en cas de défaillance.

Ce travail pointe trois angles morts particulièrement préoccupants pour les intégrateurs et les équipes produit. D'abord, la fragilité de la fusion multimodale : combiner vision, LiDAR et langage amplifie les surfaces d'attaque plutôt que de les réduire, contrairement à l'hypothèse dominante de redondance. Ensuite, l'instabilité de la planification sous attaque jailbreak : les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2, de plus en plus déployés dans des systèmes humanoïdes, restent vulnérables à des injections de prompt qui court-circuitent les contraintes de sécurité définies au niveau applicatif. Enfin, la confiance dans les interactions en monde ouvert demeure non résolue dès que le scénario sort des conditions de laboratoire, ce qui est précisément le cas des déploiements industriels réels.

Le contexte est celui d'une accélération brutale du déploiement d'agents physiques autonomes depuis 2024, portée par des acteurs comme Figure AI, Boston Dynamics, 1X Technologies, Apptronik et des labos publics (Stanford, CMU, ETH Zurich). L'absence d'un cadre de sécurité unifié est jusqu'ici restée dans l'angle mort de la course aux performances : les benchmarks sectoriels mesurent la dextérité et le sim-to-real transfer, rarement la robustesse face à un adversaire actif. Ce survey constitue un premier référentiel structuré ; il ne propose pas de solution clé en main mais identifie les briques manquantes, notamment les protocoles d'évaluation standardisés pour les attaques sur hardware embarqué et les mécanismes de contrôle d'intégrité des VLA en production.

Impact France/UE

Les acteurs européens déployant des VLA (dont ETH Zurich, contributeur cité) et soumis à l'AI Act, qui classe les applications médicales et industrielles en systèmes à haut risque, devront intégrer les protocoles d'évaluation de robustesse adversariale identifiés comme manquants par ce survey.

À lire aussi

Sécurité des agents incarnés pilotés par des modèles fondation : surfaces d'attaque, attaques, défenses et évaluation
1arXiv cs.RO 

Sécurité des agents incarnés pilotés par des modèles fondation : surfaces d'attaque, attaques, défenses et évaluation

Des chercheurs publient sur arXiv (arXiv:2608.16843v1, avec des données collectées jusqu'au 15 aout 2026) une synthèse consacrée a la sécurité des agents robotiques pilotes par des modèles de fondation, ces systèmes qui intègrent perception, raisonnement, planification et génération d'actions dans une seule boucle de contrôle. Plutot que de classer les menaces par mécanisme d'attaque (jailbreak, injection de prompt, backdoor, empoisonnement de données, exemples adversariaux) comme le font les travaux existants, les auteurs adoptent une approche centrée sur les frontières de confiance: ils identifient le point d'entrée exact ou un attaquant compromet le système pour la première fois. Le système est décompose en cinq couches et douze surfaces d'attaque, couvrant la chaine d'approvisionnement du modèle, les instructions utilisateur, le contexte et la mémoire, l'environnement physique et sémantique, la perception multimodale, l'état du monde, le raisonnement interne, la planification de taches, les interfaces d'action, le middleware, la communication multi-agents et le contrôle d'exécution. L'analyse s'appuie sur 58 cas d'attaques documentées et 61 mécanismes de défense recenses. Le constat principal intéressé directement intégrateurs et décideurs robotique: la recherche en attaque se concentre presque exclusivement sur la perception multimodale et les interfaces d'action, la ou les défenses existantes se cantonnent surtout au niveau action et a la protection en temps réel. A l'inverse, la mémoire a long terme et le contexte, le middleware et les couches réseau, l'intégrité de l'état du monde, ainsi que la confiance entre agents dans les flottes multi-robots restent quasiment ignores par la littérature. Autrement dit, une faille numérique en amont (une instruction manipulée, une donnée de contexte corrompue) peut se propager jusqu'a un comportement physique dangereux sans qu'aucune défense structurelle ne l'intercepte, un angle mort critique pour toute entreprise déployant des agents embodied bases sur des VLA (vision-language-action) a l'échelle industrielle. Cette synthèse s'inscrit dans un champ encore jeune, celui de la sécurité des agents robotiques génératifs, ou la multiplication des modèles de fondation appliques a la robotique a devance les cadres d'évaluation. Les auteurs pointent plusieurs chantiers ouverts pour la suite: la provenance vérifiable de l'état du système, des défenses compositionnelles capables de couvrir plusieurs couches simultanément, la propagation d'attaques sur des horizons temporels longs, la réalisabilité physique des exploits théoriques, le comportement byzantin dans les essaims multi-robots, et une méthodologie d'évaluation unifiée en boucle fermée.

UECe travail concerne indirectement les intégrateurs et décideurs robotiques européens déployant des agents VLA, en pointant des angles morts de sécurité à anticiper, sans citer d'acteur ni de réglementation française ou européenne spécifique.

RechercheActu
1 source
L'utilisation des LLM pour la planification en IA incarnée introduit des risques de sécurité systématiques
2arXiv cs.RO 

L'utilisation des LLM pour la planification en IA incarnée introduit des risques de sécurité systématiques

Des chercheurs ont publié le 24 avril 2026 sur arXiv (arXiv:2604.18463) un benchmark nommé DESPITE, conçu pour évaluer systématiquement la sécurité des grands modèles de langage (LLM) utilisés comme planificateurs robotiques. Le jeu de données comprend 12 279 tâches couvrant à la fois des dangers physiques (collisions, manipulation de charges) et normatifs (violation de règles de sécurité industrielles), avec une validation entièrement déterministe. Testé sur 23 modèles, le résultat le plus frappant est le suivant : le meilleur modèle en termes de planification n'échoue à produire un plan valide que dans 0,4 % des cas, mais génère des plans dangereux dans 28,3 % des situations. Parmi les 18 modèles open-source évalués, allant de 3 milliards à 671 milliards de paramètres, la capacité de planification s'améliore fortement avec la taille (de 0,4 % à 99,3 % de réussite), tandis que la conscience du danger reste remarquablement plate (38 à 57 %). Trois modèles propriétaires dotés de capacités de raisonnement explicite atteignent des niveaux de sécurité nettement supérieurs, entre 71 % et 81 %, alors que les modèles propriétaires sans raisonnement et les modèles open-source restent sous le seuil des 57 %. Ces résultats contredisent directement l'hypothèse, implicite dans de nombreux projets d'intégration, selon laquelle un modèle plus capable est automatiquement plus sûr. Les auteurs identifient une relation multiplicative entre capacité de planification et conscience du danger : un LLM qui planifie mieux complète davantage de tâches en toute sécurité, mais uniquement parce qu'il génère plus de plans valides, pas parce qu'il évite mieux les situations à risque. Pour un intégrateur robotique ou un COO industriel qui envisage de déployer un LLM comme cerveau d'un AMR ou d'un bras manipulateur, cela signifie concrètement que la saturation des performances de planification, déjà proche pour les modèles frontier, déplace le goulot d'étranglement vers la sécurité, un axe que les recettes de scaling habituelles ne résolvent pas. Ce travail s'inscrit dans un débat actif autour des architectures VLA (Vision-Language-Action) et de l'utilisation des LLM comme planificateurs de haut niveau dans des systèmes comme ceux développés par Physical Intelligence (pi0), Figure AI ou Boston Dynamics. Le benchmark DESPITE comble un vide méthodologique : jusqu'ici, les évaluations de sécurité reposaient sur des scénarios ad hoc ou des métriques de performance générale. L'absence de tout modèle open-source dépassant les 57 % de conscience du danger soulève des questions directes pour les acteurs européens qui misent sur des modèles ouverts pour des raisons de souveraineté ou de coût, notamment dans les secteurs logistique et manufacturier. Les prochaines étapes logiques incluent l'intégration de DESPITE dans les pipelines de fine-tuning orientés sécurité et la collaboration avec des organismes de normalisation comme l'ISO ou l'IEC pour ancrer ces métriques dans des référentiels de certification robotique.

UELes acteurs européens qui misent sur des modèles open-source pour des raisons de souveraineté se retrouvent plafonnés à 57 % de conscience du danger, bien en dessous des modèles propriétaires à raisonnement explicite (71-81 %), ce qui fragilise directement les déploiements LLM-as-planner dans la logistique et le manufacturier européens.

RechercheOpinion
1 source
Quand les robots nous comprennent mal : les risques de sécurité de l'IA incarnée à commande vocale
3arXiv cs.RO 

Quand les robots nous comprennent mal : les risques de sécurité de l'IA incarnée à commande vocale

Une étude publiée sur arXiv (arXiv:2608.28518v1, catégorie cross-listing) le 31 août 2026, intitulée "When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI", examine si les erreurs de reconnaissance vocale automatique (ASR) dans les commandes utilisateur peuvent conduire des modèles d'IA incarnée (Embodied AI) à exécuter des instructions dangereuses. Les auteurs simulent des erreurs ASR typiques et les combinent avec deux benchmarks de sécurité existants, SafeAgentBench et POEX, pour mesurer l'effet de différents types d'erreurs sur le comportement des modèles. Résultat central : certaines erreurs de transcription préservent la structure grammaticale de la phrase mais introduisent une ambiguïté qui devient dangereuse une fois exécutée par le robot, tandis que d'autres affaiblissent directement le mécanisme de refus du modèle, permettant la génération et l'exécution de plans d'action nuisibles qui auraient normalement été bloqués. La correction automatique des erreurs ASR réduit le risque dans certains cas, mais l'étude montre que cet effet n'est pas systématique. Globalement, les chercheurs concluent que les erreurs ASR constituent un facteur de risque significatif pour la sécurité des systèmes d'IA incarnée. Ce travail met en évidence une surface d'attaque souvent négligée dans la sécurisation des robots à commande vocale : le maillon de transcription lui-même, en amont du modèle de langage ou de planification. Pour les intégrateurs qui déploient des interfaces vocales sur des robots humanoïdes ou des bras manipulateurs, cela signifie qu'un audit de sécurité centré uniquement sur le comportement de refus du modèle de langage reste incomplet si le pipeline vocal en amont n'est pas testé pour sa robustesse aux erreurs de transcription. Le résultat contredit l'hypothèse implicite selon laquelle un alignement de sécurité validé sur des commandes textuelles propres garantit la sécurité en usage réel, où le bruit ambiant, les accents ou les homophones dégradent la fidélité de l'ASR, notamment dans des environnements industriels bruyants. L'article s'inscrit dans la lignée des benchmarks de sécurité pour agents incarnés comme SafeAgentBench et POEX, qui évaluaient jusqu'ici la robustesse face à des prompts textuels malveillants ou ambigus sans modéliser la couche de reconnaissance vocale. Il s'agit d'une contribution de recherche académique, sans lien avec un déploiement commercial ou un robot spécifique. Les auteurs appellent implicitement à intégrer des vérifications de sécurité cross-modales, capables de détecter les incohérences entre l'intention probable de l'utilisateur et le texte transcrit, avant toute exécution d'action physique par le robot.

RechercheActu
1 source
Repenser les modèles du monde pour les systèmes incarnés à sécurité critique
4arXiv cs.RO 

Repenser les modèles du monde pour les systèmes incarnés à sécurité critique

Un article de perspective mis en ligne sur arXiv (référence 2609.03774v1, cross-listing) remet en cause l'approche dominante de construction des "world models", ces modèles qui simulent l'environnement d'un système embarqué. Passés de représentations latentes compactes à des simulateurs génératifs interactifs produisant des vidéos photoréalistes, ces modèles sont aujourd'hui jugés sur leur vraisemblance statistique et leur fidélité visuelle, deux critères insuffisants pour garantir une décision sûre. Les auteurs identifient trois décalages structurels: vraisemblance contre risque, prédiction contre intervention, et horizon de prédiction fini contre conséquences accumulées dans le temps. Ils proposent le Risk-Informed World Model (RIWM), une architecture organisée autour des conséquences, de l'intervention, de l'incertitude épistémique et de la récupérabilité, qui combine quatre capacités interdépendantes: une représentation orientée décision, un raisonnement contrefactuel, une mémoire épisodique dédiée à la sécurité, et une assurance de sécurité au moment de l'exécution. Le constat vise directement les modèles de fondation robotique et les simulateurs utilisés pour entraîner des systèmes autonomes, véhicules, robots humanoïdes ou bras industriels, où une vidéo prédite plausible peut masquer une erreur dangereuse sur les conséquences réelles d'une action. En distinguant conséquences physiques, sociales et opérationnelles, et en conditionnant chaque prédiction à un niveau d'incertitude épistémique, RIWM conteste l'hypothèse implicite selon laquelle une meilleure fidélité perceptuelle garantit une meilleure sécurité de décision, un point sensible pour les intégrateurs qui évaluent aujourd'hui les modèles VLA et les simulateurs génératifs sur la qualité visuelle plutôt que sur leur capacité réelle à prévenir un incident. Ce travail s'inscrit dans l'évolution récente des world models, passés de modèles de dynamique latente de type Dreamer à des simulateurs génératifs interactifs capables de produire des environnements explorables en temps réel. Plutôt qu'un produit ou un pilote déployé, les auteurs posent un programme de recherche ouvert: identifier quels futurs sont réellement critiques pour la sécurité, valider empiriquement le raisonnement contrefactuel, maintenir des mémoires de sécurité révisables dans le temps, traduire des conséquences apprises en contraintes exécutables par un système embarqué, et déterminer à quel niveau de preuve un agent peut agir plutôt que devoir détecter, différer ou s'abstenir. Aucun acteur industriel ni calendrier de déploiement n'est mentionné, ce travail relevant du positionnement académique et non d'une annonce commerciale.

RecherchePaper
1 source