Plus facile à dire qu'à faire : comprendre l'écart entre intention et comportement dans le jailbreak des robots pilotés par LLM
Des chercheurs de l'université du Zhejiang (projet « ZJU SHINE ») publient la cinquième version d'un article posé sur arXiv (2412.16633) consacré aux attaques de type « jailbreak » contre les robots pilotés par grands modèles de langage (LLM). Dans ces architectures, le LLM sert de planificateur et traduit une instruction en langage naturel en appels de politiques exécutables, comme grasp(), moveto() ou opengripper(). Les auteurs observent que les jailbreaks existants, qui produisent des politiques d'apparence malveillante (« intent jailbreaks »), échouent souvent à provoquer une action physique réellement nuisible (« behavior jailbreaks »). Les causes sont propres à la robotique : erreurs de logique, API de contrôle hallucinées, mauvais ordonnancement des politiques, contraintes matérielles et cinématiques ignorées. Pour combler cet écart, l'équipe présente POEF (POlicy EFfective Jailbreak), un cadre automatisé de red teaming. Il utilise les gradients des couches cachées d'un LLM non aligné pour guider l'optimisation des prompts, puis un évaluateur multi-agents vérifie la faisabilité des politiques générées. Testé sur des robots commerciaux (humanoïde Unitree G1, bras Franka) et en simulation, POEF atteint 80 % de succès en behavior jailbreak et se transfère entre différents LLM. Deux stratégies de défense sont également proposées.
Le résultat déplace la question de la sécurité des robots à LLM. Jusqu'ici, beaucoup d'évaluations comptaient un succès dès que le modèle produisait un plan dangereux sur le papier, ce qui surestimait le risque réel. Le « gap » mesuré ici montre que la robustesse physique (API réelles, ordre des actions, limites cinématiques) agit comme une protection involontaire, mais fragile : un attaquant qui en tient compte atteint 80 % de réussite. Pour les intégrateurs et responsables de déploiement, la leçon est qu'un filtrage du texte en entrée ne suffit pas. Il faut aussi valider les politiques au niveau de l'exécution, par exemple avec des vérifications de faisabilité, des limites de force et de vitesse, et des listes blanches d'API. Le transfert entre LLM suggère en outre qu'un changement de fournisseur de modèle ne règle pas le problème. Une réserve s'impose : les tests portent sur un nombre restreint de plateformes et de scénarios, et ne couvrent pas les architectures VLA de bout en bout (type Pi-0 ou Helix), qui n'utilisent pas ce schéma de planification par API.
Ces travaux s'inscrivent dans une série de recherches sur les jailbreaks de robots, qui ont montré que des LLM embarqués pouvaient être poussés à générer des plans dangereux, sans toujours démontrer leur exécution. POEF fait passer l'évaluation de l'intention à l'effet physique mesuré. Le calendrier du secteur rend l'enjeu concret : les humanoïdes à planificateur LLM, de Unitree à Figure ou Tesla, avancent vers des pilotes industriels, et les auteurs jugent urgent de renforcer les contre-mesures avant tout déploiement à grande échelle. Aucun acteur européen n'est cité, mais les exigences du règlement européen sur l'IA et des normes de sécurité machine pourraient faire de ce type de red teaming un passage obligé. Les prochaines étapes probables sont des tests sur davantage de plateformes et sur les VLA, ainsi qu'une évaluation indépendante des deux défenses proposées.
Ce type de red teaming pourrait devenir un passage obligé pour la conformité des robots à LLM au règlement européen sur l'IA et aux normes de sécurité machine, mais aucun acteur européen n'est impliqué.
Dans nos dossiers




