TMT : détection de portes dérobées à l'exécution pour les politiques vision-langage-action (VLA) sur des tâches inédites
Des chercheurs présentent sur arXiv (2610.09462) TMT, un détecteur de backdoors fonctionnant à l'exécution pour les politiques vision-langage-action (VLA). Une politique VLA compromise conserve des performances normales sur ses tâches habituelles, mais produit des actions malveillantes dès qu'un déclencheur apparaît dans l'observation. TMT (Token Manifold and latent Transition modeling) est entraîné uniquement sur des rollouts bénins. Une première branche évalue la structure des tokens d'entrée. Une seconde mesure les erreurs de prédiction dans la dynamique latente entre couches adjacentes. Un rollout jugé suspect par la première branche est confirmé par des déviations latentes, ce qui guide le choix des transitions à surveiller ensuite. Les auteurs testent aussi une purification par auto-distillation: une copie gelée de la politique infectée fournit les actions de référence sur entrées bénignes pour superviser un modèle étudiant, sur des paires d'observations bénignes et déclenchées, sans politique saine séparée. Face à dix baselines (détecteurs de backdoors classiques adaptés, méthodes de détection d'anomalies et d'échecs réutilisées), TMT revendique le meilleur résultat sur des tâches inédites, pour trois attaques. Le résumé ne donne aucun chiffre, et la comparaison est menée a posteriori par les auteurs eux-mêmes.
Le point difficile est que chaque action malveillante peut être plausible isolément, et qu'une tâche nouvelle modifie légitimement observations et comportements. Un détecteur calibré sur les tâches d'entraînement risque donc de multiplier les fausses alertes en production. Viser la généralisation à des tâches inédites correspond au besoin réel des intégrateurs, qui déploient des VLA génériques sur des cellules changeantes. L'absence de politique de référence saine pour la purification est aussi un atout pratique, puisque ces modèles sont rarement disponibles en double. Il s'agit toutefois d'un résultat académique, sans validation sur robot réel annoncée, et le gain reste à confirmer hors des benchmarks choisis.
Les VLA se diffusent via des poids ouverts et du fine-tuning tiers, ce qui expose la chaîne d'approvisionnement logicielle: un modèle téléchargé ou ajusté par un prestataire peut embarquer un déclencheur dormant. La sécurité des politiques robotiques reste bien moins outillée que celle des modèles de langage. TMT s'inscrit dans cette lacune, au moment où les VLA entrent dans des pilotes industriels. Les prochaines étapes à surveiller sont la publication du code via la page projet des auteurs, des tests sur matériel physique et une évaluation face à des attaques adaptatives conçues pour contourner la détection.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




