Simulation à fidélité bornée comme scène de démonstration : transfert de mocap pour des benchmarks de gouvernance
Des chercheurs proposent un motif de conception baptisé « bounded-fidelity sim-as-démo-stage », destiné aux benchmarks de gouvernance de robots pilotés par des LLM. Le principe est de supprimer la physique de contact à l'intérieur d'enveloppes de transfert d'objet explicitement délimitées (saisie, transport, dépose), tout en conservant la dynamique complète partout ailleurs. L'implémentation repose sur la primitive « mocap-body » de MuJoCo, pilotée par un adaptateur Python de 220 lignes que le pont de gouvernance appelle via des intentions structurées. Les auteurs définissent la stabilité de la chaîne d'audit comme l'égalité octet à octet du journal d'événements haché d'une relecture à l'autre. Sur 1000 relectures par configuration, la variante mocap produit un seul hash distinct (1000/1000 identiques, intervalle de Wilson à 95 % : [0,997 ; 1,000]). La base de référence en contact physique en produit 584 distincts, avec 993 relectures sur 1000 divergentes. Un balayage du pas de temps (1, 2, 5 et 10 ms) montre que la divergence reste à 0,985 à chaque valeur. Une gigue de ±10 pas de simulation sur les bords de l'enveloppe (1400 relectures) n'entraîne aucune divergence. Les chaînes restent identiques pour 1, 2 ou 3 objets transférés successivement (1500 relectures), avec un surcoût par opération de prise et dépose qui croît de façon sous-linéaire.
L'enjeu touche à la manière dont on évalue la gouvernance des robots à base de LLM. Quand un simulateur sert à démontrer qu'un pipeline d'admission, de politique, de contrat et d'audit se comporte correctement, le bruit d'intégration des forces de contact introduit des divergences dans la chaîne d'audit sans rapport avec la propriété testée. Le résultat indique que ce non-déterminisme est structurel et non un défaut de réglage, puisqu'il ne dépend pas du pas de temps. Pour un intégrateur ou un responsable conformité, cela signifie qu'un benchmark de gouvernance peut devenir reproductible au bit près pour un coût d'ingénierie quasi nul. Il faut toutefois lire ces chiffres pour ce qu'ils sont : une démonstration en simulation, sur un seul moteur physique, qui ne dit rien du comportement d'un robot réel. Les auteurs le reconnaissent en cartographiant les cas où le motif est nuisible : validation sim-to-real, entraînement de politiques et tâches riches en contacts.
Ce travail s'inscrit à contre-courant d'une recherche sim-to-real qui poursuit la fidélité physique comme objectif principal, en jugeant un simulateur à sa capacité à reproduire les dynamiques de contact réelles. Ici, le simulateur n'est qu'une scène de démonstration pour la couche de gouvernance, et la fidélité devient un handicap localisé. L'article est un préprint arXiv (v1) et n'annonce ni produit, ni pilote, ni déploiement industriel. Les suites logiques seraient l'adoption du motif par d'autres benchmarks de gouvernance et sa validation sur d'autres simulateurs ou d'autres tâches, ce que l'article ne documente pas.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




