
Quand un déploiement VLA plus rapide modifie le comportement en boucle fermée : analyse succès-latence de SmolVLA en PyTorch et ONNX
Des chercheurs ont publié le 15 septembre 2026 sur arXiv (2609.14146) une étude comparant les performances du modèle vision-langage-action (VLA) SmolVLA (HuggingFaceVLA/smolvla_libero) selon son mode de déploiement, sur une carte graphique modeste RTX 2060 de 6 Go, avec les suites de benchmarks LIBERO Spatial et Object (MuJoCo 3.3.2, LeRobot 0.6.1, seed 42). En configuration PyTorch avec précision mixte (AMP), le modèle atteint 70,0% de réussite en Spatial et 88,0% en Object, pour une latence p99 de 1181 ms. En convertissant le modèle vers ONNX Runtime avec exécution CUDA, les versions dites FP16 et INT8 réduisent la latence p99 à 601 ms et 532 ms respectivement, mais le taux de réussite Spatial chute à 41,0% et 40,0%, tandis qu'Object reste stable à 89,0%. Un audit des graphes de calcul révèle que ces artefacts ONNX sont en réalité des graphes FP32 identiques bit à bit: la variante "INT8" n'est donc pas une quantification réelle au niveau des opérateurs. Un test complémentaire faisant varier la largeur du contexte textuel (16, 24, 32 tokens) montre une réussite Spatial de 41,0%, 75,0% puis 71,0%, la largeur 24 tokens égalant quasiment la performance PyTorch de référence pour environ deux fois moins de latence, sans différence statistiquement significative (p=0,53). Le code est disponible sur GitHub (rafiqul713/smolvla-libero-onnx).
Ce travail illustre un piège fréquent dans le déploiement des modèles VLA en robotique: accélérer l'inférence via une conversion vers un format supposé plus léger peut faire chuter silencieusement le succès en boucle fermée, même quand les chiffres de latence affichés semblent excellents. L'étude démontre aussi qu'une étiquette de "quantification INT8" peut être trompeuse si elle n'est pas vérifiée au niveau du graphe de calcul, un signal d'alerte pour les intégrateurs qui évaluent des pipelines d'inférence optimisés pour l'edge sans audit technique. Elle plaide pour un reporting conjoint de la latence, de l'inspection des artefacts et du taux de réussite réel des tâches, plutôt que la seule métrique de vitesse mise en avant commercialement.
SmolVLA est le modèle VLA compact de Hugging Face, et LIBERO constitue un benchmark de référence pour évaluer la généralisation spatiale et objet des politiques de manipulation robotique. Le choix d'un GPU d'entrée de gamme, plutôt qu'un A100 de laboratoire, reflète les contraintes matérielles réelles du déploiement embarqué, un enjeu partagé par les concurrents du secteur VLA comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, tous confrontés à l'arbitrage entre vitesse d'inférence et fiabilité comportementale sur du matériel contraint.




