Aller au contenu principal
IA physiquearXiv cs.RO 

Décomposition direction-échelle dans la représentation d'action : repenser ce qu'il faut tokeniser pour les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un nouveau papier publié sur arXiv (2609.28865) propose Direction-Scale Decomposition (DSD), une méthode pour améliorer la représentation des actions dans les modèles vision-langage-action (VLA) à tokens discrets, en partant du constat que les représentations classiques par incréments de pose produisent des tokens sensibles à la vitesse d'exécution et aux normalisations propres à chaque dataset, ce qui brouille la structure géométrique commune aux démonstrations. DSD décompose les incréments de translation et de rotation en une composante direction et une composante échelle avant la tokenisation, isolant le sens du mouvement tout en conservant les amplitudes dans des canaux séparés. Testée avec deux tokenizers, un binning uniforme (BIN) et BEAST, un tokenizer basé sur des B-splines, en simulation comme sur robot réel et en entraînement mono comme multi-datasets, la méthode améliore le taux de succès moyen sur le benchmark LIBERO avec les deux tokenizers, et fait gagner 10,3 points de pourcentage à DSD-BIN par rapport à BIN sur SimplerEnv en entraînement multi-datasets. Les expériences sur robot réel confirment des gains, avec et sans pré-entraînement robotique.

Pour les équipes qui entraînent des VLA sur des mélanges hétérogènes de datasets, ce résultat cible un point de friction concret : la dégradation de performance observée quand on combine des démonstrations collectées à des vitesses, fréquences ou conventions de normalisation différentes. En isolant la direction du mouvement des variations d'amplitude liées au dataset, DSD s'attaque à ce qui limite le passage à l'échelle des politiques de manipulation entraînées sur de grands corpus agrégés, un enjeu central alors que le secteur cherche à reproduire pour la robotique le scaling qui a fonctionné pour les modèles de langage. Le gain observé sur SimplerEnv en régime multi-datasets suggère, s'il se confirme sur d'autres benchmarks, que le choix de représentation d'action, souvent traité comme un détail d'implémentation, pèse autant que l'architecture du modèle ou la taille du dataset dans la qualité finale d'une politique VLA.

Ce travail s'inscrit dans un champ encore jeune consacré à la tokenisation des actions pour les VLA à sortie discrète, un terrain qui coexiste avec des architectures propriétaires à sortie continue comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. DSD se positionne comme une amélioration compatible avec des tokenizers existants tels que le binning uniforme ou BEAST, plutôt que comme un tokenizer concurrent supplémentaire, et l'abstract ne précise ni la plateforme robotique utilisée pour les essais réels ni le laboratoire à l'origine des travaux. Une page de projet (vla-dsd.github.io) met à disposition du code et des ressources additionnelles, en vue d'une validation attendue sur des architectures VLA plus larges et des jeux de données de manipulation plus diversifiés.

À lire aussi

GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action
1arXiv cs.RO 

GesVLA : représentations gestuelles intégrées pour un modèle vision-langage-action

Des chercheurs ont publié GesVLA, un modèle Vision-Language-Action augmenté d'une modalité gestuelle, dans un preprint arXiv soumis en mai 2026 (arXiv:2605.22812). L'architecture repose sur un double VLM (Vision-Language Model) qui encode les features gestuelles directement dans l'espace latent, permettant aux gestes pointés de la main de participer à la fois au raisonnement de haut niveau et à la génération d'actions motrices. Pour l'entraînement, l'équipe a construit un pipeline de génération de données synthétiques en rendant des modèles 3D de mains sur des images de scènes réelles, produisant des annotations de pointage variées tout en réduisant le sim-to-real gap visuel. Le modèle a été évalué sur plusieurs tâches physiques réelles : manipulation contrôlée de blocs et sélection de produits dans des environnements encombrés. Les expériences montrent une amélioration mesurée de la précision de grounding cible et de l'efficacité de l'interaction humain-robot, particulièrement dans des scènes complexes avec objets similaires. L'apport principal de GesVLA est d'adresser une faiblesse connue des VLA actuels : l'ambiguïté spatiale. Quand plusieurs objets similaires sont présents dans la scène, une instruction textuelle seule (type "prends la bouteille") reste ambiguë. Intégrer le geste de pointage comme modalité parallèle au texte offre un ancrage spatial explicite sans modifier l'interface verbale. L'architecture dual-VLM représente un choix architectural non trivial par rapport aux approches qui traitent les modalités de façon séquentielle. Ce n'est pas la première tentative d'incorporer des signaux humains dans les VLA, mais la formalisation du geste comme modalité de premier rang dans l'espace latent, plutôt qu'en post-processing, est une contribution d'architecture à surveiller pour les intégrateurs qui déploient des cobots en environnements de picking désordonnés. GesVLA s'inscrit dans la vague de recherche post-RT-2 et pi-0 qui cherche à rendre les VLA robustes au-delà du régime de laboratoire. Les modèles concurrents comme OpenVLA (Berkeley), Octo ou RoboFlamingo travaillent essentiellement avec du texte et de la vision, sans modalité gestuelle native. Physical Intelligence (pi) avec pi-0 et Google DeepMind avec RT-2/RT-X restent les références industrielles sur la généralisation des VLA à grande échelle. Le preprint ne mentionne pas de partenariat industriel ni de timeline de déploiement commercial. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés (LIBERO, Calvin) pour permettre des comparaisons directes, et une intégration sur des plateformes comme Franka ou UR5 au-delà des configurations de démonstration présentées.

IA physiqueOpinion
1 source
Régularisation contrastive des représentations pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

Régularisation contrastive des représentations pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs propose RS-CL (Robot State-aware Contrastive Loss), une nouvelle méthode de régularisation des représentations pour les modèles Vision-Language-Action (VLA), publiée dans une pré-publication arXiv (2510.01711v3, troisième révision). Le principe : ajouter une perte contrastive légère qui aligne les représentations internes du modèle sur les états proprioceptifs du robot, en utilisant les distances relatives entre ces états comme supervision douce. Cette composante s'intègre sans modification architecturale aux pipelines VLA existants et vient compléter l'objectif classique de prédiction d'actions. Sur le benchmark RoboCasa-Kitchen, RS-CL porte le meilleur modèle existant à 69,7 % de taux de succès. Sur des tâches réelles de manipulation en conditions difficiles, le gain est de 45,0 % à 58,3 %, soit plus de treize points d'écart. Ce résultat pointe une faiblesse structurelle des VLA actuels : hérités de Visual Language Models pré-entraînés sur des données web, leurs espaces de représentation sont optimisés pour la compréhension visuelle et linguistique, pas pour le contrôle moteur. RS-CL s'attaque directement à ce désalignement sans réentraîner le backbone ni alourdir significativement l'inférence. Pour les intégrateurs et les équipes de recherche appliquée, cela signifie qu'un gain de plus de treize points sur des tâches réelles est accessible via un simple ajout à la fonction de perte, sans refonte du pipeline. C'est une avancée sur la question du sim-to-real et du gap entre benchmarks synthétiques et déploiements effectifs, même si les conditions exactes des évaluations réelles ne sont pas détaillées dans le résumé. Les VLA constituent un axe de recherche actif depuis l'émergence de modèles comme RT-2 (Google DeepMind, 2023), OpenVLA, et plus récemment Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Ces modèles partagent la même architecture de base : un VLM pré-entraîné auquel on greffe une tête de prédiction d'actions. RS-CL s'inscrit dans une tendance plus large visant à mieux ancrer ces modèles dans la physique du robot plutôt que dans la sémantique du langage. Les prochaines étapes naturelles seraient de tester la méthode sur d'autres benchmarks standardisés (LIBERO, OpenX-Embodiment) et sur des plateformes humanoïdes où la proprioception joue un rôle encore plus central.

IA physiqueOpinion
1 source
Au-delà du passage à l'échelle des données : le pré-entraînement continu centré sur la représentation pour les modèles vision-langage-action
3arXiv cs.RO 

Au-delà du passage à l'échelle des données : le pré-entraînement continu centré sur la représentation pour les modèles vision-langage-action

Des chercheurs ont publie sur arXiv le modèle VLAct, un système vision-langage-action (VLA) fonde sur un pré-entrainement continu qui privilégié la qualité de représentation plutôt que le seul volume de données robotiques. Le backbone VLM généraliste est étendu sur des trajectoires multi-robots hétérogènes, en préservant le prior du VLM et en unifiant partiellement les actions entre morphologies avant un fine-tuning par tache. Sur LIBERO-Plus et RoboTwin 2.0, VLAct devance les systèmes industriels ABot-M0 et LingBot-VLA avec 82,6% et 92,5% de réussite, et se classe sixième sur RoboDojo devant toutes les entrées "world-action model". Sur la morphologie humanoïde inédite RoboCasa-GR1, il bat le GR00T-N1.6 entraine sur 100% des données en n'en utilisant que 20%, le tout avec des données open-source et seulement 16 GPU d'entrainement. Ce résultat nuance l'hypothèse dominante selon laquelle la performance des VLA dépend surtout du volume de trajectoires collectées, sur le modèle du scaling des grands modèles de langage. En rivalisant avec des systèmes industriels grâce a seulement 16 GPU et des données publiques, les auteurs montrent que la qualité du transfert entre morphologies pèse davantage que la taille brute des données, un axe accessible a des équipes aux moyens plus modestes. Le résultat sur RoboCasa-GR1, ou une morphologie jamais vue est généralisée avec un cinquième des données habituelles, s'attaque directement au frein du transfert cross-embodiment. Ces résultats restent toutefois obtenus sur des bancs d'essai simules, sans déploiement industriel réel documente: une contribution de recherche, pas un produit commercialise. Les références choisies, les systèmes chinois ABot-M0 et LingBot-VLA et le GR00T-N1.6 de NVIDIA, situent VLAct dans une compétition dense entre modèles VLA généralistes, aux cotes d'acteurs comme Physical Intelligence (Pi-0) ou Figure AI (Helix), absents toutefois des baselines testées ici. Le modèle se positionne comme une alternative sobre en calcul face a la course a l'échelle des données menée par les grands laboratoires. Publie pour l'instant en preprint, l'article ne mentionne ni partenariat industriel ni calendrier de déploiement; les étapes attendues restent la revue par les pairs et, le cas échéant, la publication du code et des poids, les données d'entrainement étant déjà open-source.

IA physiqueOpinion
1 source
Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action
4arXiv cs.RO 

Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action

Des chercheurs publient sur arXiv (2607.14635v1) une étude sur les modèles vision-langage-action (VLA), remettant en question la manière dont la supervision par action est utilisée pour entraîner ces systèmes. Traditionnellement traitée comme un simple objectif d'apprentissage en aval pour prédire les actions, cette supervision agit en réalité comme une force qui remodèle les représentations multimodales héritées des modèles vision-langage préentraînés. Les auteurs montrent que cet effet est double : il est indispensable pour construire des représentations compatibles avec l'action, mais lorsqu'il est appliqué trop directement sur le flux multimodal hérité, il déstabilise aussi les capacités de traitement du langage et d'ancrage des objets. Pour résoudre cette tension, l'équipe introduit Action QFormer, une interface à base de requêtes conditionnées par les instructions, qui réorganise les informations multimodales héritées en représentations orientées action avant la génération des commandes. En navigation zero-shot sim-to-real, cette architecture fait bondir le taux de réussite moyen des tâches en boucle fermée de 18,8% à 56,3%, la justesse de génération d'action à instruction fixe de 22,5% à 75,5%, et réduit quasiment à zéro les générations d'instructions hors distribution. Ce résultat touche un point sensible du secteur robotique : l'écart persistant entre démonstrations impressionnantes et performances réelles en conditions variables, souvent attribué au fossé sim-to-real. En multipliant par trois le taux de succès en navigation zero-shot, Action QFormer suggère que les gains de performance des VLA ne viendront pas uniquement de backbones préentraînés plus puissants, à la manière de Pi-0, GR00T N2 ou Helix, mais aussi de la façon dont l'information multimodale héritée est sélectionnée et organisée avant d'être exposée à la supervision par action. Pour les intégrateurs et équipes de recherche robotique, ce travail envoie un signal clair : le simple passage à l'échelle des données d'action ou le fine-tuning direct sur des architectures VLM existantes comporte un risque de dégradation silencieuse des capacités de compréhension du langage et de perception, un compromis rarement documenté dans les communications commerciales. Ce travail s'inscrit dans la lignée des modèles VLA apparus depuis RT-2 et OpenVLA, qui adaptent des architectures vision-langage préentraînées à la prédiction directe d'actions robotiques, approche depuis reprise par des laboratoires comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix. La question de la préservation des capacités multimodales sous supervision d'action rejoint des préoccupations déjà observées ailleurs dans le secteur, où l'écart entre vidéos de démonstration sélectionnées et déploiement réel reste un sujet de vigilance éditoriale. Les auteurs positionnent Action QFormer comme une brique architecturale plutôt qu'un produit fini, validée pour l'instant sur des tâches de navigation en environnement simulé puis réel ; la suite logique serait son extension à des tâches de manipulation avec davantage de degrés de liberté, ainsi que sa validation sur des backbones VLA de plus grande échelle.

IA physiqueActu
1 source