vla.simd : inférence CPU efficace pour la manipulation conditionnée par le langage
Publié en septembre 2026 sur arXiv, vla.simd est un moteur d'inférence CPU pour les politiques de manipulation robotique conditionnées par le langage (VLA), combinant micro-noyaux SIMD partagés, calcul réutilisable et optimisations spécifiques au processeur cible. Testé sur six politiques et quatre CPU, il obtient un gain médian d'environ 1,4x par rapport à des références PyTorch compilées, tout en conservant la précision numérique fp32. Les auteurs présentent aussi IMPACT, une politique dérivée de l'architecture ACT à représentations textuelles mises en cache et features visuelles modulées par le langage. Sur un Raspberry Pi 5, IMPACT est la seule politique language-conditioned testée à fournir au moins 30 actions par seconde : 33,5 actions/s en fp32 et 81,2 en int8, après 90 secondes de chauffe thermique. Sur GPU, elle atteint 76,4% de réussite moyenne sur quatre suites LIBERO sans pré-entraînement robotique, et a été testée physiquement sur un bras SO-101, ainsi que SmolVLA sur un UR10e à pince Robotiq.
Ce résultat cible un frein concret au déploiement industriel : la plupart des politiques VLA supposent un GPU embarqué ou une inférence déportée dans le cloud, ce qui alourdit coût et latence. Faire tourner une politique conditionnée par le langage en temps réel sur un CPU bas de gamme comme le Raspberry Pi 5 ouvre la voie à des manipulateurs moins coûteux pour la logistique ou l'assemblage léger, sans accélérateur matériel dédié. La distinction que font les auteurs entre offre d'actions et fréquence de rétroaction rappelle que le chunking, pas seulement la vitesse brute du modèle, conditionne la fluidité d'exécution réelle. Ces chiffres restent toutefois à nuancer : le pic de 81,2 actions/s repose sur une quantification int8 et sur une chauffe préalable rarement précisée dans les annonces marketing du secteur.
IMPACT s'inscrit dans la famille ACT (Action Chunking Transformer), largement utilisée en apprentissage par imitation, et se positionne face à des politiques VLA plus lourdes conçues pour GPU. Le choix de SmolVLA, politique compacte de Hugging Face, comme second cas de test sur un bras UR10e traduit une volonté de compatibilité avec l'écosystème open-source existant plutôt qu'un modèle propriétaire isolé. Il s'agit à ce stade d'une publication de recherche arXiv, sans annonce commerciale, pilote industriel ni calendrier de mise sur le marché, présentée comme une brique d'infrastructure réutilisable dans un secteur où la pression pour réduire le coût matériel du déploiement en périphérie s'intensifie.
Dans nos dossiers




