
StepTrigger : attaques par porte dérobée déclenchées par l'état de contact sur des robots à pattes pilotés par VLM
Des chercheurs publient sur arXiv (2609.26131v1, type "new") une étude intitulée StepTrigger, qui démontre une attaque par porte dérobée déclenchée non pas par du texte ou une image, mais par l'état de contact pied-sol d'un robot quadrupède. Le système cible est un Unitree Go1 dont le planificateur de haut niveau, un modèle vision-langage (VLM), choisit des actions de navigation ou de manipulation a partir des objectifs de tache et de résumés capteurs. Le déclencheur est produit par les motifs de pression générés lorsque le robot traverse une zone de terrain dense spécifique, signal proprioceptif invisible dans le flux camera ou le prompt. Comme ces signaux de contact sont naturellement bruites et peuvent survenir pendant une marche normale, les auteurs entrainent une politique de porte dérobée sélective a partir d'états robot multimodaux, en utilisant des événements de pression fortuits comme exemples bénins et les contacts sur zone dense comme exemples empoisonnes. Sur une évaluation offline stratifiée, le planificateur compromis conserve un comportement normal dans 98,75% des cas, rejette les faux déclencheurs a 92,50%, active le comportement malveillant réel dans 76,25% des cas, pour une précision globale de 89,17%.
Le résultat met en lumière une surface d'attaque ignorée par les défenses actuelles, centrées sur le langage, la vision ou l'historique d'actions, alors que les canaux proprioceptifs et tactiles restent des angles morts. Pour les intégrateurs et décideurs qui déploient des robots humanoïdes ou quadrupèdes pilotes par des architectures vision-language-action comme celles derrière Figure 03, Optimus, GR00T N2 ou Helix, cela souligne un risque de chaine d'approvisionnement logicielle: un planificateur pré-entraine ou fine-tune par un tiers pourrait embarquer un déclencheur physique indétectable par simple inspection du code ou des prompts, sans dégrader les performances apparentes en usage normal.
Ce travail prolonge les recherches sur les vulnérabilités des agents LLM et VLM embarques, qui avaient jusqu'ici documente surtout des déclencheurs linguistiques ou visuels sur des robots simules ou réels. StepTrigger étend ce champ aux signaux de contact au sol, un axe encore peu explore malgré l'essor des VLA généralistes de type Pi-0 ou GR00T déployés sur des plateformes comme le Go1. Les auteurs pointent implicitement le besoin de mécanismes de défense couvrant les canaux proprioceptifs, un chantier encore ouvert pour la robustesse des systèmes robotiques autonomes.
Dans nos dossiers




