Aller au contenu principal
NAC : un codec neuronal d'actions pour les modèles vision-langage-action
RecherchearXiv cs.RO 

NAC : un codec neuronal d'actions pour les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient une version mise à jour (v2) du préprint arXiv 2606.21372, intitulé « NAC: Neural Action Codec for Vision-Language-Action Models », qui introduit un nouveau tokenizer d'actions pour les modèles vision-langage-action (VLA). Le NAC reprend l'architecture des codecs audio neuronaux, encodeur-décodeur convolutif à quantification vectorielle résiduelle (RVQGAN) utilisée dans les modèles de fondation audio, en traitant les courtes trajectoires d'actions robotiques comme des signaux 1D multicanaux compressés à plusieurs échelles. Le système produit un espace de tokens compact et ordonné via des codebooks décalés, ce qui permet à des politiques autorégressives standard de fonctionner sur des séquences courtes et structurées ; la reconstruction des trajectoires s'appuie sur un décodeur de style Vocos, avec tête ISTFT et discriminateurs adversariaux. Évalué sur les bancs d'essai LIBERO-10 et RoboMimic, ainsi que sur une série de tâches de manipulation réelles, NAC atteint une fidélité de reconstruction élevée et des taux de réussite moyens supérieurs au binning, à FAST et aux tokenizers VQ antérieurs, à taux de compression comparable ou meilleur.

Le tokenizer d'actions est le goulot d'étranglement discret entre commande continue du robot et modélisation de séquence autorégressive au cœur de tout VLA ; jusqu'ici, binning, FAST et quantification vectorielle classique forçaient un compromis entre compression, latence et performance. En montrant qu'une architecture éprouvée pour l'audio se transpose presque sans changement structurel au contrôle robotique, ce travail suggère que la tokenisation d'actions n'est plus le facteur limitant majeur pour faire passer à l'échelle les politiques VLA, un enjeu concret pour tout intégrateur entraînant des politiques génériques de manipulation sur plusieurs tâches et morphologies de robot. Le gain de taux de réussite à compression égale ou supérieure compte surtout pour le temps réel, où latence d'inférence et longueur de séquence conditionnent le temps de cycle. Les résultats restent toutefois issus de bancs d'essai académiques, simulation complétée d'un nombre limité de tâches réelles, donc d'un stade de recherche et non d'un produit ou d'un déploiement industriel.

Le travail s'inscrit dans la lignée des tokenizers développés pour les VLA récents, dont FAST, méthode associée à la famille de modèles Pi-0 de Physical Intelligence et prise ici comme référence de comparaison, ainsi que les approches par binning et par quantification vectorielle discrète plus anciennes. L'idée de recycler les codecs audio neuronaux à quantification résiduelle, déjà standard pour les modèles de fondation audio, illustre une tendance plus large du secteur à importer des briques génératives multimodales vers la robotique. Publiée sous forme de préprint arXiv, sans annonce de licence, d'intégration produit ni de calendrier de déploiement, la contribution demeure un résultat de recherche dont la portée dépendra de sa reproduction sur des politiques VLA de plus grande échelle et de tests au-delà des bancs d'essai contrôlés utilisés dans l'article.

À lire aussi

VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action
1arXiv cs.RO 

VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action

Une publication arXiv soumise en août 2026 présente VLAff, un modèle vision-langage-affordance conçu pour apprendre aux robots à manipuler des objets à partir de vidéos humaines filmées à la première personne. Le verrou visé est connu du secteur : la morphologie d'un bras robotique diffère de celle d'une main humaine, ce qui complique le transfert direct des gestes observés. Les auteurs contournent l'obstacle en extrayant des affordances centrées sur l'objet, indépendantes de la morphologie du robot, qui précisent où interagir, comment saisir et comment déplacer. La méthode combine reconstruction 3D par Structure-from-Motion et reconstruction de maillage de la main sur des vidéos égocentriques, appliquée à un nouveau jeu de données, EgoAffordance, comptant 204 000 épisodes, 5,6 millions d'affordances visuelles et 11,6 millions d'affordances de préhension et de trajectoire. Entraîné sur cette base, VLAff génère, à partir d'une observation et d'une instruction, des cartes de chaleur d'affordance, des poses de préhension et des trajectoires, converties en actions exécutables via les informations de scène 3D. Ce travail s'inscrit dans une tendance de fond de la robotique manipulative : exploiter la masse de vidéos humaines disponibles en ligne pour pallier la rareté et le coût des données de téléopération robotique. Si l'état de l'art revendiqué en prédiction d'affordance visuelle se confirme au-delà des bancs d'essai internes des auteurs, la méthode ouvrirait une source de données bon marché pour les modèles vision-langage-action que développent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure AI (Helix), tous engagés dans la course aux modèles fondation génériques pour la manipulation. Un bémol s'impose toutefois : les résultats sont pour l'instant mesurés en interne, sans comparaison indépendante publiée, et les démonstrations de manipulation zero-shot sur robot réel restent, d'après le résumé, cantonnées à des scénarios de laboratoire plutôt qu'à un déploiement industriel. La recherche sur les affordances actionnables, où et comment interagir avec un objet, est un axe actif de la robotique et de la vision par ordinateur depuis plusieurs années, mais les travaux antérieurs se limitaient souvent à une seule modalité ou à des jeux de données restreints tournés en environnement contrôlé. L'apport revendiqué par VLAff est d'unifier trois modalités, visuelle, préhension et trajectoire, dans un seul modèle fondation entraîné sur des vidéos égocentriques du quotidien plutôt que sur des démonstrations robotiques dédiées et coûteuses. Le papier ne précise ni affiliation institutionnelle ni calendrier de publication du code ou du jeu de données : il s'agit à ce stade d'une contribution académique, non d'un produit ou d'un pilote industriel annoncé, dont la suite logique serait la publication du code pour permettre à la communauté de reproduire les résultats.

RechercheOpinion
1 source
NS-VLA : vers des modèles vision-langage-action neuro-symboliques
2arXiv cs.RO 

NS-VLA : vers des modèles vision-langage-action neuro-symboliques

Une équipe de recherche a publié sur arXiv (référence 2603.09542, troisième version révisée) un article décrivant NS-VLA, un cadre neuro-symbolique pour les modèles Vision-Language-Action (VLA), ces systèmes qui traduisent une instruction en langage naturel et un contexte visuel en séquence d'actions pour un bras ou un robot manipulateur. Les auteurs pointent trois limites des VLA actuels : des architectures dorsales (backbones) aveugles à la structure des tâches, une capacité de généralisation qui reste bridée par le backbone choisi, et un entraînement par optimisation à objectif unique, incapable de distinguer les niveaux de granularité d'une tâche. NS-VLA répond avec trois briques : un encodeur neuro-symbolique qui infère des primitives d'action sous contrainte de plan, un solveur neuro-symbolique qui conditionne une politique indépendante du backbone sur la primitive active, et une méthode d'optimisation hiérarchique conjointe qui aligne la granularité de la récompense sur celle de la tâche. Sur des benchmarks de manipulation robotique, les auteurs rapportent de meilleurs résultats que les méthodes précédentes en apprentissage one-shot et face à des perturbations de données, ainsi qu'une généralisation zero-shot et un espace d'exploration élargis. Le code est publié en open source. Ce travail s'attaque à un point de friction central du secteur : les modèles VLA généralistes, dans la lignée de systèmes comme Pi-0, GR00T ou Helix, sont devenus le pari dominant pour doter bras robotiques et humanoïdes de compétences de manipulation transférables, mais leur généralisation reste plafonnée par le backbone vision-langage sur lequel ils s'appuient, souvent pré-entraîné sans notion explicite de structure de tâche. En découplant la politique d'action du backbone via une couche symbolique intermédiaire, NS-VLA suggère qu'il est possible d'améliorer robustesse et généralisation sans dépendre d'un unique modèle de fondation propriétaire, ce qui intéresserait les intégrateurs cherchant à faire tourner la même logique de contrôle sur plusieurs plateformes matérielles. Si ces gains se confirment au-delà des benchmarks internes des auteurs, cela nourrirait la thèse selon laquelle l'approche purement bout en bout des VLA actuels atteint ses limites face à la diversité des tâches industrielles. Il s'agit d'une contribution académique publiée sur arXiv, pas d'un produit commercialisé ni d'un déploiement en usine : les comparaisons de performance proviennent des propres expériences des auteurs, sans validation tierce ni précision sur le matériel utilisé ou un éventuel test sur robot physique plutôt qu'en simulation, ce qui invite à la prudence sur l'ampleur réelle des gains revendiqués. Le neuro-symbolique n'est pas une idée neuve : il ressurgit régulièrement en robotique pour combler les angles morts des réseaux de neurones purs, depuis que les limites de généralisation des premiers VLA, héritiers de RT-2 puis d'OpenVLA, ont révélé l'écart entre démonstrations impressionnantes et robustesse en conditions réelles. La mise à disposition du code doit permettre à la communauté de reproduire les résultats sur d'autres backbones ; la suite logique, non documentée dans l'article, serait une évaluation sur robot physique et une comparaison directe avec les VLA propriétaires déjà déployés commercialement.

RechercheOpinion
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
4arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source