Aller au contenu principal
Modélisation du seuil de différence perceptible pour la compression de tokens dans les modèles vision-langage-action
RecherchearXiv cs.RO 

Modélisation du seuil de différence perceptible pour la compression de tokens dans les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2608.21247, catégorie cross-list, 24 août 2026) une méthode baptisée Action-JND pour la compression de tokens dans les modèles vision-langage-action (VLA). Le principe consiste à adapter le concept de "just noticeable différence" (JND), issu de la caractérisation de la tolérance du système visuel humain aux signaux, au contrôle robotique en boucle fermée : un token ne doit être compressé que si sa modification n'entraîne pas de déviation d'action au-delà d'une marge tolérée par la politique. Les auteurs développent un estimateur JND léger, calculé token par token dans l'espace de features visuelles profondes, qui prédit la perturbation maximale admissible sans dégrader la réponse du modèle. Ce score de tolérance d'action sert ensuite de critère plug-and-play pour prioriser les tokens à compresser dans des techniques existantes comme la réutilisation de KV-cache périmé ("stale-KV reuse") ou l'élagage de tokens ("token pruning"). Testée sur le benchmark de simulation LIBERO avec les modèles open-source OpenVLA et OpenVLA-OFT, la méthode améliore la fiabilité de la compression, en particulier aux ratios les plus agressifs.

Pour les équipes travaillant sur des VLA embarqués, réduire le coût d'inférence est un enjeu direct puisque la latence conditionne la viabilité d'un contrôle robotique temps réel en boucle fermée. Les critères de compression habituels (similarité visuelle, scores d'attention, saillance) mesurent la redondance perceptuelle mais ignorent l'effet réel sur l'action produite, ce qui peut faire dévier une politique sans avertissement en cas de compression trop agressive. En rattachant explicitement le critère de compression à la réponse d'action plutôt qu'à la perception, Action-JND vise à sécuriser des déploiements VLA à budget de calcul réduit, un sujet central pour l'embarqué robotique. Il s'agit toutefois d'une contribution méthodologique validée uniquement en simulation, et non d'un produit ou d'un déploiement terrain.

Le travail prolonge les techniques de compression de tokens popularisées sur les grands modèles vision-langage, désormais transposées aux agents incarnés pilotés par des politiques VLA comme OpenVLA, l'un des modèles open-source de référence pour le contrôle robotique par langage naturel, aux côtés d'autres familles telles que Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le concept de JND, historiquement développé pour la perception humaine, avait déjà été étendu aux réponses de systèmes machine avant cette extension à l'action robotique. Les auteurs positionnent Action-JND comme complémentaire des schémas de compression existants plutôt que comme une alternative, applicable en amont du pruning ou du stale-KV reuse. Aucun calendrier de déploiement industriel ni partenariat n'est mentionné : l'apport reste, à ce stade, une preuve de concept académique sur benchmark simulé.

À lire aussi

ActionPiece : repenser la tokenisation des actions pour les modèles vision-langage-action autorégressifs
1arXiv cs.RO 

ActionPiece : repenser la tokenisation des actions pour les modèles vision-langage-action autorégressifs

Un article de recherche publié le 17 septembre 2026 sur arXiv (référence 2609.18487v1) propose ActionPiece, une nouvelle méthode de tokenisation d'actions pour les modèles vision-langage-action (VLA) autorégressifs. Ces modèles convertissent les commandes robotiques continues en tokens discrets, puis les régénèrent en commandes exécutables. Les auteurs introduisent une métrique baptisée "physical rank consistency" (PRC), qui évalue si la tokenisation conserve l'ordre relatif des distances physiques entre actions proches, un aspect ignoré par l'erreur quadratique moyenne (MSE) habituellement utilisée pour juger la fidélité de reconstruction. ActionPiece combine deux objectifs d'apprentissage joints : une supervision du rang physique sur les distances de l'encodeur et des features quantifiées, et une régularisation appliquant le même ordre aux assignations de codewords. Testé avec un pipeline d'entraînement de politique basé sur Qwen3-VL-4B, le système atteint 94,8% de réussite sur le benchmark de simulation LIBERO, 68,8% sur LIBERO-Plus (tâches non vues à l'entraînement), 71,9% sur SimplerEnv et 51,5% sur VLA-Arena (niveaux L0 à L2). Ce travail cible un maillon technique précis mais central dans l'architecture des VLA autorégressifs : la façon dont les actions continues sont discrétisées avant d'être traitées comme des tokens de langage. Un tokenizer imprécis peut faire converger des actions distinctes vers une même représentation, ce qui aplatit les nuances nécessaires à des contextes différents, un problème invisible aux métriques ponctuelles classiques. Pour les équipes qui construisent des politiques VLA (bras robotiques, humanoïdes), cela suggère que les gains de performance ne viennent pas uniquement de modèles plus gros, mais aussi de la qualité de la représentation intermédiaire des actions, un point souvent négligé face à l'attention portée aux architectures de perception ou de langage. Le papier s'inscrit dans un débat plus large sur la tokenisation discrète des actions (utilisée par des lignées de modèles type RT-2 ou OpenVLA) face aux approches à génération continue ou par diffusion, telles que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Toutes les évaluations présentées restent toutefois limitées à des benchmarks de simulation (LIBERO, SimplerEnv, VLA-Arena), sans validation sur robot physique ni déploiement industriel annoncé à ce stade.

RechercheActu
1 source
TOAST : tokenisation stochastique des actions de robot pour les modèles vision-langage-action (VLA) autorégressifs
2arXiv cs.RO 

TOAST : tokenisation stochastique des actions de robot pour les modèles vision-langage-action (VLA) autorégressifs

Des chercheurs proposent TOAST (TOkenization of Action sequences with STochastic sampling), une méthode de tokenisation stochastique des actions pour les modèles Vision-Language-Action (VLA) autorégressifs, décrite dans un preprint arXiv (2610.00899v1). Ces modèles convertissent les actions continues du robot en séquences de tokens discrets, ce qui permet de les prédire avec l'objectif standard du token suivant. Le schéma FAST, référence actuelle, compresse des actions couvrant plusieurs fréquences temporelles en peu de tokens, mais attribue une seule tokenisation déterministe à chaque séquence d'actions quantifiée. TOAST, lui, tire au hasard pendant l'entraînement l'une des tokenisations alternatives de cette même séquence, sans changer le mouvement décodé et sans nouvelle démonstration. Sur le benchmark LIBERO, TOAST bat systématiquement sa version déterministe, avec un gain de 6,8 points de taux de succès quand seulement 1/16 des données d'entraînement est disponible. Sur quatre tâches de manipulation avec un robot réel, le taux de succès moyen progresse de 15,8 points. Ces résultats visent un problème concret pour les équipes qui déploient des VLA : la rareté des démonstrations, qui coûtent cher en téléopération. Compresser les actions réduit le nombre de tokens à prédire, mais n'améliore pas l'efficacité d'apprentissage à partir de peu d'exemples. Les auteurs exploitent une redondance déjà présente dans la représentation, plusieurs suites de tokens pouvant décoder le même geste, comme une forme d'augmentation de données au niveau de la supervision. L'effet croît à mesure que les données diminuent, ce qui correspond au cas d'usage industriel, où l'on adapte une politique à une nouvelle tâche avec quelques dizaines de démonstrations. Il faut toutefois relativiser. Les gains sont mesurés par rapport à FAST seul, pas contre des politiques à diffusion ou à flow matching. L'évaluation réelle ne porte que sur quatre tâches, sans précision dans le résumé sur le robot, le nombre d'essais ou les intervalles de confiance. Un gain de 6,8 points sur LIBERO reste modeste, et les 15,8 points sur robot réel demandent à être confirmés sur davantage de tâches et de plateformes. Ce travail s'inscrit dans le débat sur la meilleure façon de représenter les actions dans les VLA. D'un côté, la tokenisation discrète (FAST, dans la lignée de RT-2 et OpenVLA) conserve la simplicité d'un modèle de langage. De l'autre, des approches continues à diffusion ou flow matching, comme celles de la famille Pi-0, gèrent les actions de façon différente. TOAST défend la voie discrète en améliorant son efficacité en données plutôt qu'en changeant d'architecture. Il s'agit d'un preprint, non évalué par les pairs : aucun produit ni déploiement n'est annoncé. La suite logique serait des tests sur des benchmarks plus variés, une comparaison directe avec les politiques continues, et une vérification sur de grands modèles pré-entraînés.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Token-World : modélisation du monde dans l'espace de jetons d'un modèle vision-langage pour la manipulation robotique
3arXiv cs.RO 

Token-World : modélisation du monde dans l'espace de jetons d'un modèle vision-langage pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.00575) Token-World, un modèle du monde conditionné par l'action, conçu pour les systèmes vision-langage-action (VLA) en manipulation robotique. La plupart des simulateurs actuels prédisent les futures images RGB, puis les ré-encodent pour la politique de contrôle. Token-World évite ce détour. Il compresse les tokens visuels d'un modèle vision-langage (VLM) en un état compact. Il apprend la dynamique future dans cet espace réduit, puis reconvertit les états prédits vers la représentation d'origine que consomme la politique. Sur plusieurs benchmarks de manipulation, les auteurs annoncent une meilleure fidélité des features en boucle ouverte et une meilleure cohérence des actions de la politique que les simulateurs récents. La dégradation est aussi plus lente sur de longs horizons de rollout. En boucle fermée, la performance simulée corrèle davantage avec celle de la politique de référence que Ctrl-World (r = 0,794 contre 0,583), avec une latence de simulation plus faible. Le code est annoncé, pas encore publié. L'enjeu est l'évaluation des politiques robotiques, aujourd'hui l'un des principaux goulots d'étranglement des VLA. Tester une politique sur robot réel coûte cher et prend du temps. Un simulateur appris et fiable permettrait de comparer des checkpoints et d'itérer sans immobiliser de matériel. Le gain de corrélation (0,794 contre 0,583) reste modeste en valeur absolue. Un coefficient proche de 0,8 classe correctement les politiques en gros, mais il n'est pas assez fin pour trancher entre deux variantes proches. L'intérêt de l'approche est aussi pratique, puisqu'elle supprime la génération de pixels, étape coûteuse en calcul. Elle suppose en revanche que le simulateur reste lié à la représentation d'un VLM donné. Les résultats viennent de benchmarks et non d'un déploiement industriel. Rien ne dit encore comment la méthode se comporte avec des contacts riches, des objets déformables ou des scènes hors distribution, ni sur quels robots ni avec quels volumes de données elle a été validée. Ce travail s'inscrit dans la vague des modèles du monde pour la robotique, où des systèmes comme Ctrl-World, la référence directe ici, génèrent des vidéos conditionnées par l'action pour évaluer ou améliorer des politiques. Le débat porte sur la nécessité de reconstruire des pixels pour planifier ou évaluer, alors que les politiques VLA de type Pi-0 ou GR00T travaillent déjà sur des représentations latentes. Token-World est une publication académique en préimpression, sans évaluation par les pairs. Il ne s'agit ni d'un produit ni d'un déploiement. La suite dépendra de la publication du code et d'une reproduction indépendante, notamment sur robot réel et sur des politiques tierces.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source