Aller au contenu principal
Pas ce que vous avez demandé : attaques typographiques dans la manipulation par robots ménagers
RecherchearXiv cs.RO 

Pas ce que vous avez demandé : attaques typographiques dans la manipulation par robots ménagers

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont mis en ligne sur arXiv (référence 2605.18593) une étude démontrant que de simples autocollants portant du texte imprimé suffisent à détourner les robots ménagers qui utilisent CLIP comme moteur de perception. Dans un environnement de simulation Habitat configuré avec le benchmark HomeRobot, l'attaque a atteint un taux de succès (ASR) de 67,8% sur un pool de 59 épisodes contrôlés, montant à 70,0% parmi les épisodes où le robot accomplissait normalement sa tâche sans perturbation. L'architecture évaluée repose sur une configuration découplée qui expose un encodeur CLIP gelé aux autocollants adversariaux, tout en maintenant un ancrage géométrique via DETIC. Sans optimisation perceptuelle préalable, sans contrôle des angles de vue ni de l'occlusion, le robot saisit physiquement le mauvais objet et le dépose dans la zone cible désignée.

L'apport majeur de ce travail réside dans la démonstration que l'erreur de perception se propage à travers la carte sémantique 3D persistante du robot jusqu'à produire ce que les auteurs appellent des "défaillances cinétiques" - des actions physiques erronées entièrement pilotées par un état sémantique empoisonné. C'est la première évaluation du cycle Sense-Plan-Act complet d'un manipulateur ménager face à des attaques typographiques, là où les travaux antérieurs se limitaient à des benchmarks 2D statiques ou à des tâches de navigation. Pour un intégrateur ou un COO envisageant des déploiements de robots de service, ce résultat révèle un vecteur d'attaque dont le coût d'exécution est quasi nul : une étiquette imprimée. Cela remet en question la robustesse sécuritaire des pipelines VLA (Vision-Language-Action) modulaires qui délèguent la perception à des modèles open-vocabulary non durcis.

Les attaques typographiques sur CLIP sont documentées depuis 2021, mais ce travail représente le premier transfert vers la manipulation physique, la tâche commercialement la plus pertinente pour les robots de service. CLIP reste omniprésent dans les stacks d'agents incarnés open-vocabulary, de HomeRobot à des architectures de type SayPlan ou PerAct. Des alternatives comme SigLIP ou Florence pourraient offrir une résistance différente, mais aucun benchmark comparatif n'est fourni dans cette étude. Il n'y a pas de déploiement réel ni de partenaire industriel annoncé : il s'agit d'un preprint publié en mai 2025, en simulation uniquement. La suite logique passe par la validation sur hardware réel et l'évaluation de défenses, notamment la redondance perceptuelle, le filtrage sémantique ou la détection d'anomalies textuelles dans le champ de vision.

Impact France/UE

Les intégrateurs européens déployant des robots de service basés sur CLIP doivent intégrer ce vecteur d'attaque à coût quasi nul dans leurs audits de sécurité avant tout déploiement commercial.

Dans nos dossiers

À lire aussi

Défense active contre les attaques par injection de fausses données dans les manipulateurs robotiques
1arXiv cs.RO 

Défense active contre les attaques par injection de fausses données dans les manipulateurs robotiques

Une équipe de chercheurs a publié sur arXiv (réf. 2605.17950) deux mécanismes de défense active contre les attaques par injection de fausses données (FDIA, False Data Injection Attacks) visant les manipulateurs robotiques. Ces attaques corrompent les signaux capteurs transmis au contrôleur d'un bras, permettant à un adversaire de dévier le comportement de l'effecteur final sans déclencher les alarmes classiques. La vulnérabilité exploitée est structurelle : la linéarisation par retour d'état (feedback linearization), méthode de contrôle très répandue, expose les systèmes à une faille dite d'intégrateur sur l'horizon fini d'une tâche. Les deux contre-mesures proposées, baptisées "amortissement virtuel sensible aux anomalies" et "réduction de manipulabilité", s'accompagnent de garanties probabilistes sur l'exécution nominale. Les simulations ont été conduites sur un manipulateur redondant à 7 degrés de liberté (7-DOF). Les résultats montrent que ces défenses réduisent substantiellement l'impact des FDIA par rapport au filtre Chi-carré, référence standard à seuil fixe pour la détection d'anomalies, tout en préservant les performances nominales en l'absence d'attaque. Ce point est décisif pour les intégrateurs industriels : une contre-mesure qui dégrade les cycles normaux ne sera jamais déployée en production. L'apport réel de ce travail réside dans la capacité à neutraliser des attaques furtives, précisément celles qui passent sous le radar d'un Chi-carré classique. La linéarisation par retour d'état étant omniprésente en cobotique, en assemblage industriel et en chirurgie assistée, cette vulnérabilité d'intégrateur a une portée concrète bien au-delà du cadre académique. Les FDIA sont documentées depuis une décennie sur les réseaux électriques, les drones et les véhicules autonomes ; leur application aux manipulateurs robotiques constitue un axe de recherche plus récent, particulièrement critique pour les applications en environnement dangereux ou médical. Sur le plan industriel, les grands fabricants de bras (KUKA, ABB, FANUC, Universal Robots) ne publient pas leurs architectures de contrôle, mais la généralisation des interfaces réseau et des mises à jour OTA élargit mécaniquement leur surface d'attaque. L'étude reste à ce stade une contribution de simulation : la validation sur hardware réel et l'intégration dans des pipelines de contrôle commerciaux constituent les prochaines étapes naturelles avant toute adoption terrain.

UEKUKA (Allemagne) et ABB (Suisse/Suède) figurent parmi les fabricants de bras les plus exposés à cette vulnérabilité structurelle de linéarisation, mais l'étude reste au stade simulation, aucune action directe n'est requise pour les intégrateurs européens avant une validation hardware.

RechercheOpinion
1 source
PROBE : questions-réponses visuelles ancrées dans la manipulation avec des agents VLM
2arXiv cs.RO 

PROBE : questions-réponses visuelles ancrées dans la manipulation avec des agents VLM

Publié le 19 août 2026 sur arXiv (2608.17129), le framework PROBE évalue et entraîne des VLM capables de manipuler des objets pour répondre à des questions visuelles, une tâche formalisée sous le nom de Manipulation-Grounded Visual Question Answering (MG-VQA). Les auteurs construisent PROBE-Sim, un simulateur de table avec objets du quotidien et un bras doté d'outils de préhension et de poussée, puis PROBE-Bench : 150 tâches en six types de questions sur des scènes encombrées, où les méthodes agentiques à base d'outils battent la perception seule de 8,0% en moyenne. Le finetuning PROBE-Agent, qui distille les trajectoires d'un grand modèle enseignant vers un modèle open-weight plus petit, porte ce gain à 11,5%, avec généralisation à des objets inédits et une première validation sim-to-real sur table réelle. Ce travail pointe une limite peu documentée des VLM actuels : performants en ancrage 2D et raisonnement spatial sur des scènes statiques, ils peinent dès qu'une action de manipulation modifie la scène à interpréter. Pour les concepteurs de modèles vision-language-action et les intégrateurs de robotique de service, cela suggère que le reality gap ne se limite pas au contrôle moteur mais touche aussi le raisonnement visuel, longtemps jugé résolu par des benchmarks statiques. Les gains chiffrés restent des moyennes internes sur des tâches hétérogènes et valent comme signal directionnel plutôt que comme mesure absolue ; ils indiquent néanmoins qu'une brique de raisonnement dynamique manipulation-perception se rapproche, condition préalable à des robots d'assistance à domicile ou d'inventaire en entrepôt capables de gérer du désordre réel. PROBE s'inscrit dans la continuité des travaux combinant VLM et usage agentique d'outils, actif depuis que ces modèles ont démontré de solides capacités de planification sur des scènes fixes. Il s'agit d'une contribution académique publiée sur arXiv, évaluée majoritairement dans PROBE-Sim, avec une validation réelle limitée à des environnements de table contrôlés plutôt qu'à un déploiement domestique effectif. Le choix de distiller un grand modèle enseignant vers un modèle open-weight plus petit suit une pratique courante en robotique, où le coût d'inférence embarqué pousse à compresser des modèles de fondation volumineux, sans calendrier de déploiement ni partenaire industriel annoncé.

RecherchePaper
1 source
Votre robot a appris sur un mensonge » : attaques par empoisonnement du maillage de collision en manipulation robotique
3arXiv cs.RO 

Votre robot a appris sur un mensonge » : attaques par empoisonnement du maillage de collision en manipulation robotique

Une équipe de recherche publie sur arXiv (arXiv:2609.18122, catégorie croisée, septembre 2026) un article intitulé "Your Robot Was Trained on a Lie", qui met au jour une nouvelle faille dans les pipelines d'entraînement des robots manipulateurs fondés sur l'apprentissage automatique. Les auteurs décrivent le Collision Mesh Poisoning (CMP), présenté comme la première attaque par empoisonnement visant la chaîne d'approvisionnement des assets 3D utilisés pour entraîner et évaluer des politiques de manipulation en simulation. Le mécanisme exploite un écart légitime et répandu entre deux géométries distinctes que contient tout asset 3D dans un simulateur robotique : le maillage visuel (visual mesh), utilisé pour le rendu graphique, et le maillage de collision (collision mesh), une approximation volontairement grossière destinée à alléger le calcul physique. Les chercheurs baptisent cet écart le Visual-Collision Gap (V-C Gap). Dans l'attaque, seul le maillage de collision est altéré ; le maillage visuel et le reste de l'asset restent intacts, donc indétectables à l'inspection visuelle. Une politique entraînée et évaluée avec un asset ainsi corrompu se comporte normalement tout au long des tests en simulation, mais se dégrade, échoue ou crée des risques physiques une fois déployée dans le monde réel. Cette découverte importe car l'industrie s'appuie de plus en plus sur la simulation, notamment pour entraîner des politiques de manipulation de type vision-langage-action, avant tout déploiement réel, sur l'hypothèse implicite qu'une validation réussie en simulation garantit un comportement sûr sur du matériel physique. Le CMP contredit directement cette hypothèse et révèle un angle mort dans les pratiques actuelles de revue des assets 3D, qui contrôlent les malwares, les droits d'auteur et la conformité de format, mais jamais la cohérence entre maillage visuel et maillage de collision. Des assets ainsi piégés peuvent donc circuler via des canaux d'approvisionnement parfaitement légitimes, ce qui en fait un risque de sécurité pour tout intégrateur ou laboratoire réutilisant des bibliothèques d'assets tierces. Cette étude s'inscrit dans une littérature émergente sur la sécurité adversariale des pipelines d'IA robotique, en écho aux travaux sur l'empoisonnement de données d'entraînement pour les grands modèles de langage et de vision, mais appliquée pour la première fois à la chaîne d'approvisionnement des assets 3D en manipulation robotique. Les auteurs testent plusieurs défenses existantes contre le CMP et montrent qu'aucune n'est suffisante, ce qui souligne selon eux la nécessité de concevoir de nouveaux mécanismes de détection spécifiques à cette classe de menace. Le papier ne mentionne ni déploiement réel ni acteur industriel concerné : il s'agit à ce stade d'une démonstration de vulnérabilité au niveau recherche, sans produit ni pilote annoncé.

RecherchePaper
1 source
Apprentissage d'une variété d'actions par priors latents multi-vues pour la manipulation robotique
4arXiv cs.RO 

Apprentissage d'une variété d'actions par priors latents multi-vues pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (preprint 2605.11832, mai 2026) une méthode adressant deux limites structurelles des modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique : l'ambiguïté de profondeur issue des capteurs monoculaires, et l'inefficacité de l'apprentissage d'actions par régression classique. La première contribution, le G3T (Geometry-Guided Gated Transformer), exploite un modèle de diffusion multi-vues pré-entraîné pour synthétiser des représentations latentes de nouvelles perspectives, alignées sous contrainte géométrique 3D, avec filtrage adaptatif du bruit d'occlusion. La seconde, l'Action Manifold Learning (AML), remplace la régression sur des cibles non structurées, bruit ou champ de vitesse, approches dominantes depuis Diffusion Policy (2023), par une prédiction directe sur la variété des actions valides. Testée sur les benchmarks LIBERO et RoboTwin 2.0, ainsi que sur des tâches en robot réel, la méthode affiche des taux de succès supérieurs aux baselines état de l'art actuelles. L'enjeu est précis : la quasi-totalité des déploiements industriels de manipulateurs n'embarquent qu'une caméra RGB, sans LiDAR ni stéréovision. Sans profondeur fiable, les VLA peinent à estimer distances et tailles relatives, ce qui dégrade directement la précision de préhension en conditions réelles. Le G3T propose de contourner ce manque sans ajout matériel, maintenant les contraintes hardware à un niveau réaliste pour l'intégration. L'AML, de son côté, questionne un paradigme issu des travaux sur la diffusion en robotique : prédire directement sur la variété d'actions valides pourrait réduire la variance d'entraînement et accélérer la convergence. Les résultats semblent valider l'hypothèse, bien qu'un preprint reste à soumettre à peer-review pour être pleinement crédité, les métriques annoncées sont issues des propres expériences des auteurs, sans reproductions indépendantes publiées à ce stade. Ce travail s'inscrit dans la course aux VLA généralistes ouverte par RT-2 (Google DeepMind, 2023), avec pour concurrents directs OpenVLA (UC Berkeley), π0 de Physical Intelligence et GR00T N2 de NVIDIA. RoboTwin 2.0, l'un des benchmarks retenus, cible spécifiquement la manipulation bi-manuelle de précision, parmi les scénarios les plus exigeants du domaine. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; l'impact concret dépendra des reproductions indépendantes et d'une éventuelle intégration dans des frameworks ouverts comme LeRobot (Hugging Face). Le code et la page projet sont annoncés disponibles publiquement.

RechercheOpinion
1 source