RoboInspector : révèle les failles de fiabilité du code de politique en IA robotique manipulatrice
Des chercheurs présentent RoboInspector, un pipeline conçu pour détecter et caractériser les défaillances du "policy code", le code de commande généré automatiquement par des grands modèles de langage (LLM) pour piloter des robots manipulateurs à partir d'une simple instruction en langage naturel. L'équipe a mené 216 combinaisons distinctes de tâches, d'instructions et de modèles LLM, testées sur deux frameworks reconnus de manipulation robotique pilotée par LLM. Cette analyse systématique a permis d'identifier quatre grands types de comportements non fiables qui provoquent l'échec de la manipulation, liés à la complexité de la tâche demandée et au niveau de détail de l'instruction fournie par l'utilisateur. Les chercheurs documentent précisément ces comportements et leurs causes sous jacentes. Ils proposent également une méthode de raffinement fondée sur le retour d'erreur du code de politique défaillant, qui améliore la fiabilité de génération jusqu'à 35 %, validée à la fois en simulation et sur des essais réels.
Cette étude touche un point sensible de la robotique pilotée par IA générative : la plupart des démonstrations de "un seul prompt suffit pour commander un bras robotique" reposent sur des tâches simples et des instructions bien formulées, un contexte éloigné des conditions réelles où les opérateurs formulent des consignes ambiguës ou incomplètes. En quantifiant précisément où et pourquoi le code généré échoue, RoboInspector fournit aux intégrateurs et développeurs de frameworks un diagnostic actionnable plutôt qu'une promesse marketing, et rappelle que la fiabilité, pas seulement la capacité de génération, reste le principal verrou avant un déploiement industriel de la manipulation pilotée par LLM.
Le papier, disponible sur arXiv sous la référence 2508.21378 (version 2, republiée en remplacement d'une version antérieure), s'inscrit dans le champ en expansion des architectures "code as policy", où le LLM ne prédit pas directement des actions motrices mais génère du code exécutable interfaçant avec des primitives robotiques. Cette approche, popularisée par des frameworks académiques de manipulation par LLM, gagne du terrain face aux modèles vision-langage-action (VLA) entraînés de bout en bout. Les auteurs annoncent la mise à disposition de leur pipeline d'évaluation, ouvrant la voie à des benchmarks de fiabilité comparables entre futurs systèmes.
Dans nos dossiers




