VLA-ULAP : alterner appels VLA cloud et prédiction d'action locale ultralégère en périphérie
Un article publié sur arXiv (2609.18663) présente VLA-ULAP, qui entrelace des appels à un modèle vision-langage-action (VLA) distant et lourd avec un prédicteur d'actions local ultra-léger, ULAP, d'environ 7,4 millions de paramètres, encodeur visuel gelé inclus. ULAP combine images caméra, proprioception et historique d'actions pour prédire un bloc d'actions en une passe, sans état caché du VLA ni aller-retour serveur. Sur un Jetson Orin Nano, une inférence prend 19,9 ms pour 0,183 joule, contre 284,3 ms et 50,55 joules pour GR00T sur une RTX A6000. En simulation, la méthode supprime 48,8 à 76,7% des appels au VLA en conservant 95,0 à 97,5% du taux de réussite de référence ; sur un bras physique SO-101, elle conserve 95,2 à 100% de réussite en réduisant le temps d'inférence de 47,9 à 58,0% et l'énergie de 52,1 à 62,5%.
Ce résultat s'attaque au principal frein au déploiement des politiques VLA à grande échelle sur des robots embarqués : la puissance de calcul nécessaire à bord et la latence des appels distants, incompatible avec des tâches dynamiques. Pour les intégrateurs et fabricants de bras ou d'humanoïdes, cela suggère qu'un petit prédicteur local peut remplacer une bonne partie des appels au grand modèle sans perte notable de performance, contredisant l'idée qu'une inférence VLA continue soit indispensable à la fiabilité. Comparé à ACT et SP-VLA sur l'architecture VLA-JEPA, ULAP réduirait de 49 à 79% le temps et l'énergie par épisode réussi. En simulation sensible à la latence (LIBERO-Safety), VLA-ULAP dépasserait π0.5 de 11,0 et 15,5 points sur deux tâches en divisant par deux le nombre d'appels au VLA, signe que la latence pèse autant que la précision sur le succès des tâches dynamiques.
VLA-ULAP s'inscrit dans la course aux politiques VLA à très grande échelle, dont GR00T sert ici de point de comparaison, réputées pour leur généralisation mais coûteuses à faire tourner en continu sur du matériel embarqué. Elle se positionne face à d'autres pistes d'accélération locale, ACT et SP-VLA, que les auteurs disent dépasser en efficacité à réussite comparable. Aucun calendrier de déploiement industriel n'est communiqué : les résultats restent ceux d'une recherche validée en simulation et sur une seule plateforme physique bas coût, le bras SO-101, avant toute extension.
Dans nos dossiers




