
NAC : un codec neuronal d'actions pour les modèles vision-langage-action
Des chercheurs publient une version mise à jour (v2) du préprint arXiv 2606.21372, intitulé « NAC: Neural Action Codec for Vision-Language-Action Models », qui introduit un nouveau tokenizer d'actions pour les modèles vision-langage-action (VLA). Le NAC reprend l'architecture des codecs audio neuronaux, encodeur-décodeur convolutif à quantification vectorielle résiduelle (RVQGAN) utilisée dans les modèles de fondation audio, en traitant les courtes trajectoires d'actions robotiques comme des signaux 1D multicanaux compressés à plusieurs échelles. Le système produit un espace de tokens compact et ordonné via des codebooks décalés, ce qui permet à des politiques autorégressives standard de fonctionner sur des séquences courtes et structurées ; la reconstruction des trajectoires s'appuie sur un décodeur de style Vocos, avec tête ISTFT et discriminateurs adversariaux. Évalué sur les bancs d'essai LIBERO-10 et RoboMimic, ainsi que sur une série de tâches de manipulation réelles, NAC atteint une fidélité de reconstruction élevée et des taux de réussite moyens supérieurs au binning, à FAST et aux tokenizers VQ antérieurs, à taux de compression comparable ou meilleur.
Le tokenizer d'actions est le goulot d'étranglement discret entre commande continue du robot et modélisation de séquence autorégressive au cœur de tout VLA ; jusqu'ici, binning, FAST et quantification vectorielle classique forçaient un compromis entre compression, latence et performance. En montrant qu'une architecture éprouvée pour l'audio se transpose presque sans changement structurel au contrôle robotique, ce travail suggère que la tokenisation d'actions n'est plus le facteur limitant majeur pour faire passer à l'échelle les politiques VLA, un enjeu concret pour tout intégrateur entraînant des politiques génériques de manipulation sur plusieurs tâches et morphologies de robot. Le gain de taux de réussite à compression égale ou supérieure compte surtout pour le temps réel, où latence d'inférence et longueur de séquence conditionnent le temps de cycle. Les résultats restent toutefois issus de bancs d'essai académiques, simulation complétée d'un nombre limité de tâches réelles, donc d'un stade de recherche et non d'un produit ou d'un déploiement industriel.
Le travail s'inscrit dans la lignée des tokenizers développés pour les VLA récents, dont FAST, méthode associée à la famille de modèles Pi-0 de Physical Intelligence et prise ici comme référence de comparaison, ainsi que les approches par binning et par quantification vectorielle discrète plus anciennes. L'idée de recycler les codecs audio neuronaux à quantification résiduelle, déjà standard pour les modèles de fondation audio, illustre une tendance plus large du secteur à importer des briques génératives multimodales vers la robotique. Publiée sous forme de préprint arXiv, sans annonce de licence, d'intégration produit ni de calendrier de déploiement, la contribution demeure un résultat de recherche dont la portée dépendra de sa reproduction sur des politiques VLA de plus grande échelle et de tests au-delà des bancs d'essai contrôlés utilisés dans l'article.
Dans nos dossiers




