TurboVLA : un modèle vision-langage-action en temps réel à 32 Hz sur RTX 4090 avec moins d'1 Go de VRAM
Une équipe de recherche présente TurboVLA, un nouveau modèle vision-langage-action (VLA) capable de tourner à 32 Hz sur une carte grand public RTX 4090, avec moins d'1 Go de VRAM utilisée à l'inférence. Publié sur arXiv fin juillet 2026, le travail propose une architecture radicalement allégée : plutôt que de faire transiter les observations visuelles par un grand modèle de langage avant de les décoder en actions (le schéma classique V→L→A des VLA actuels), TurboVLA encode séparément l'image et l'instruction textuelle, les fait interagir via un mécanisme bidirectionnel léger, puis prédit directement des séquences d'actions continues avec un petit décodeur (V+L→A). Résultat chiffré sur le benchmark de manipulation LIBERO : 97,7% de taux de réussite moyen, avec seulement 0,2 milliard de paramètres, 31,2 ms de latence d'inférence et 0,9 Go de VRAM sur RTX 4090. Le code est disponible sur GitHub (H-EmbodVis/TurboVLA).
L'intérêt pour l'industrie robotique tient moins à la performance brute qu'à l'efficacité : la plupart des VLA compétitifs (Pi-0, GR00T N2, Helix) s'appuient sur des LLM de plusieurs milliards de paramètres, coûteux à faire tourner en temps réel sur du matériel embarqué. En atteignant un score comparable ou supérieur avec un modèle cent fois plus petit et une inférence tenant sur une carte de jeu grand public, TurboVLA questionne l'hypothèse selon laquelle un grand modèle de langage est nécessaire pour connecter perception et action. Pour les intégrateurs et équipes robotique, cela ouvre la voie à des politiques VLA déployables sur du edge compute limité, sans datacenter dédié à l'inférence.
Le papier s'inscrit dans la vague de recherche sur les modèles VLA compacts qui a suivi la démonstration de la faisabilité de l'apprentissage par imitation à grande échelle (RT-2, OpenVLA, puis Pi-0 et GR00T). À ce stade, TurboVLA reste un résultat de recherche validé uniquement en simulation sur LIBERO, sans démonstration publiée de déploiement sur robot physique ni partenariat industriel annoncé ; la prochaine étape naturelle serait une validation sim-to-real sur plateforme réelle.
Dans nos dossiers




